{"as_of":"2026-08-05T23:57:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ead33bae9d1dd7ea8215ba6f9ab1912fc9d14e8c879aedc91cb89ef3bfb1b4ba","coverage":[{"denominator":13,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":13,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-13T14:32:41.948156Z","state":"measured"},{"denominator":113,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":113,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":129,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T23:13:49.027688Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":1955,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":"1812.05905","doi":"10.48550/arxiv.1812.05905","metadata_source":"pith","pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Soft Actor-Critic Algorithms and Applications","venue":"cs.LG","work_id":"bb49c9fb-03b2-4226-9edb-50186b8193e4","year":2018},"citing_paper":{"arxiv_id":"1910.07113","last_updated":"2019-10-16T00:59:05Z","snapshot_observed_at":"2026-08-02T15:37:37.200292Z","submitted_at":"2019-10-16T00:59:05Z","title":"Solving Rubik's Cube with a Robot Hand","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-15T09:38:28.621842Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/1910.07113"},"observation_digest":"sha256:8b955ad1503574092585085564317622367b1c90b8d0fb25a211eb02f89612a4","observation_id":"7da5b571-da5e-456f-877b-c72e364a954e","resolution":{"observed_at":"2026-05-15T09:38:28.936381Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":"1812.05905","doi":"10.48550/arxiv.1812.05905","metadata_source":"pith","pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Soft Actor-Critic Algorithms and Applications","venue":"cs.LG","work_id":"bb49c9fb-03b2-4226-9edb-50186b8193e4","year":2018},"citing_paper":{"arxiv_id":"2009.12293","last_updated":"2025-01-18T02:57:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-09-25T15:32:31Z","title":"robosuite: A Modular Simulation Framework and Benchmark for Robot Learning","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-12T22:37:13.401815Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2009.12293"},"observation_digest":"sha256:a8cb6c047ae84e7918150f436007508c384a0cc83d78b5ae37f8c21422367499","observation_id":"0b5d07ec-d09a-4f32-8783-5397d40a35de","resolution":{"observed_at":"2026-05-13T14:32:42.077468Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":"1812.05905","doi":"10.48550/arxiv.1812.05905","metadata_source":"pith","pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Soft Actor-Critic Algorithms and Applications","venue":"cs.LG","work_id":"bb49c9fb-03b2-4226-9edb-50186b8193e4","year":2018},"citing_paper":{"arxiv_id":"2306.10407","last_updated":"2026-04-30T16:19:41Z","snapshot_observed_at":"2026-08-03T04:16:41.040494Z","submitted_at":"2023-06-17T18:28:03Z","title":"FP-IRL: Fokker--Planck Inverse Reinforcement Learning -- A Physics-Constrained Approach to Markov Decision Processes","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-24T08:26:33.267655Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2306.10407"},"observation_digest":"sha256:ff3d5c2b8c7bc166956aba33d9df3a6cc748f02a44d057a10ec626dc018a9f99","observation_id":"1453e9c2-b39d-4c48-a384-d93b0f74a5a3","resolution":{"observed_at":"2026-05-24T08:29:11.424793Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":"1812.05905","doi":"10.48550/arxiv.1812.05905","metadata_source":"pith","pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Soft Actor-Critic Algorithms and Applications","venue":"cs.LG","work_id":"bb49c9fb-03b2-4226-9edb-50186b8193e4","year":2018},"citing_paper":{"arxiv_id":"2310.16828","last_updated":"2024-03-21T17:56:19Z","snapshot_observed_at":"2026-07-31T05:32:29.431480Z","submitted_at":"2023-10-25T17:57:07Z","title":"TD-MPC2: Scalable, Robust World Models for Continuous Control","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-05-14T17:27:35.733800Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2310.16828"},"observation_digest":"sha256:0f8c51660e6ad0692d5dd2a50d0167b83961b8519235f859f592217ffbe5aa3a","observation_id":"0387d6f7-4683-4d6b-abad-47135f081e56","resolution":{"observed_at":"2026-05-14T17:27:35.932371Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":"1812.05905","doi":"10.48550/arxiv.1812.05905","metadata_source":"pith","pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Soft Actor-Critic Algorithms and Applications","venue":"cs.LG","work_id":"bb49c9fb-03b2-4226-9edb-50186b8193e4","year":2018},"citing_paper":{"arxiv_id":"2310.17245","last_updated":"2026-04-13T15:52:28Z","snapshot_observed_at":"2026-07-06T16:38:48.736281Z","submitted_at":"2023-10-26T08:45:23Z","title":"CROP: Conservative Reward for Model-based Offline Policy Optimization","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-24T06:37:57.104233Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2310.17245"},"observation_digest":"sha256:b948c9a334d4c5aedec022f16167eedcd1d368fb3f569b0cae4a538f4211d773","observation_id":"e2cbd209-c7fb-4a05-b9ce-5170d3ce790d","resolution":{"observed_at":"2026-05-24T06:39:01.278088Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":"1812.05905","doi":"10.48550/arxiv.1812.05905","metadata_source":"pith","pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Soft Actor-Critic Algorithms and Applications","venue":"cs.LG","work_id":"bb49c9fb-03b2-4226-9edb-50186b8193e4","year":2018},"citing_paper":{"arxiv_id":"2403.02290","last_updated":"2026-05-01T05:16:59Z","snapshot_observed_at":"2026-07-06T17:39:24.823145Z","submitted_at":"2024-03-04T18:19:48Z","title":"Koopman-Assisted Reinforcement Learning","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-24T02:49:43.717890Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2403.02290"},"observation_digest":"sha256:28c63efc9c3b373f740bb7787106d6a461dccb8f66296a17bdee0502485d43e3","observation_id":"0b010a92-4cb6-4395-ae42-61d86fdc3713","resolution":{"observed_at":"2026-05-24T02:53:48.798199Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":"1812.05905","doi":"10.48550/arxiv.1812.05905","metadata_source":"pith","pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Soft Actor-Critic Algorithms and Applications","venue":"cs.LG","work_id":"bb49c9fb-03b2-4226-9edb-50186b8193e4","year":2018},"citing_paper":{"arxiv_id":"2406.07069","last_updated":"2024-06-11T08:56:08Z","snapshot_observed_at":"2026-07-06T18:28:47.000729Z","submitted_at":"2024-06-11T08:56:08Z","title":"Optimal Gait Control for a Tendon-driven Soft Quadruped Robot by Model-based Reinforcement Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-23T23:51:21.019535Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2406.07069"},"observation_digest":"sha256:ff3fa007fce15f25eb633ce3f9c3b4b82a77d223f9964b7d2041f0a3d4d4121b","observation_id":"e09dadb6-cde6-4d75-9b6d-d041c992053f","resolution":{"observed_at":"2026-05-23T23:53:38.718102Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":"1812.05905","doi":"10.48550/arxiv.1812.05905","metadata_source":"pith","pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Soft Actor-Critic Algorithms and Applications","venue":"cs.LG","work_id":"bb49c9fb-03b2-4226-9edb-50186b8193e4","year":2018},"citing_paper":{"arxiv_id":"2502.18834","last_updated":"2026-06-01T07:37:08Z","snapshot_observed_at":"2026-08-02T01:32:35.152678Z","submitted_at":"2025-02-26T05:19:16Z","title":"FinTSB: A Comprehensive and Practical Benchmark for Financial Time Series Forecasting","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-23T02:49:40.277048Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2502.18834"},"observation_digest":"sha256:0e70c4f135fd9e96443f34f511ea7b63295700b3c77c62abff204ac44cfaf56f","observation_id":"c2b80a4c-f453-45f2-9592-6320e793fbbe","resolution":{"observed_at":"2026-05-23T02:52:26.623292Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":"1812.05905","doi":"10.48550/arxiv.1812.05905","metadata_source":"pith","pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Soft Actor-Critic Algorithms and Applications","venue":"cs.LG","work_id":"bb49c9fb-03b2-4226-9edb-50186b8193e4","year":2018},"citing_paper":{"arxiv_id":"2505.07527","last_updated":"2026-04-21T19:04:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-12T13:09:49Z","title":"Kalman Filter Enhanced GRPO for Reinforcement Learning-Based Language Model Reasoning","version":5},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-22T15:49:44.263123Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2505.07527"},"observation_digest":"sha256:cdcd705dc2246f4f9fbb26ad1a0e6362f0df03810504bb3f3dc31ea2169d357a","observation_id":"b9a4d2fc-82d9-45f8-b5ea-511557d7374a","resolution":{"observed_at":"2026-05-22T15:51:45.699715Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":"1812.05905","doi":"10.48550/arxiv.1812.05905","metadata_source":"pith","pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Soft Actor-Critic Algorithms and Applications","venue":"cs.LG","work_id":"bb49c9fb-03b2-4226-9edb-50186b8193e4","year":2018},"citing_paper":{"arxiv_id":"2506.01167","last_updated":"2026-04-02T21:24:15Z","snapshot_observed_at":"2026-07-31T06:28:18.254097Z","submitted_at":"2025-06-01T20:59:40Z","title":"Accelerated Learning with Linear Temporal Logic using Differentiable Simulation","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-05-19T10:50:18.047151Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2506.01167"},"observation_digest":"sha256:58f1c75cc6d0a09259396ff94ebb94baf5c018434f8ec4e06c5ecc99893cb11b","observation_id":"9760c728-ec29-4196-9e4b-5c7a7e81932b","resolution":{"observed_at":"2026-05-19T10:52:15.118525Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":"1812.05905","doi":"10.48550/arxiv.1812.05905","metadata_source":"pith","pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Soft Actor-Critic Algorithms and Applications","venue":"cs.LG","work_id":"bb49c9fb-03b2-4226-9edb-50186b8193e4","year":2018},"citing_paper":{"arxiv_id":"2506.12622","last_updated":"2026-04-18T21:54:34Z","snapshot_observed_at":"2026-08-02T08:28:01.941809Z","submitted_at":"2025-06-14T20:36:44Z","title":"DR-SAC: Distributionally Robust Soft Actor-Critic for Reinforcement Learning under Uncertainty","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-19T09:09:51.531488Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2506.12622"},"observation_digest":"sha256:3822f8120c444d08c95ea9437990f9aead78de50a9b87a520a9545c289e18ba9","observation_id":"e8e5e04d-8eb4-4849-94b5-d83b1ea8b6be","resolution":{"observed_at":"2026-05-19T09:12:14.675283Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":"1812.05905","doi":"10.48550/arxiv.1812.05905","metadata_source":"pith","pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Soft Actor-Critic Algorithms and Applications","venue":"cs.LG","work_id":"bb49c9fb-03b2-4226-9edb-50186b8193e4","year":2018},"citing_paper":{"arxiv_id":"2507.00275","last_updated":"2026-05-14T20:49:30Z","snapshot_observed_at":"2026-07-06T21:50:11.849401Z","submitted_at":"2025-06-30T21:32:46Z","title":"Deep Double Q-learning","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-22T00:23:41.373753Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2507.00275"},"observation_digest":"sha256:7a9c1cb6b1f6a39fd4f1d79a1ae40d13ebfcc988c899d198a0d1bace6a9c8884","observation_id":"514b3a63-17a3-4436-9091-30655c9af17b","resolution":{"observed_at":"2026-05-22T00:24:27.690993Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":"1812.05905","doi":"10.48550/arxiv.1812.05905","metadata_source":"pith","pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Soft Actor-Critic Algorithms and Applications","venue":"cs.LG","work_id":"bb49c9fb-03b2-4226-9edb-50186b8193e4","year":2018},"citing_paper":{"arxiv_id":"2507.07986","last_updated":"2026-04-30T00:00:17Z","snapshot_observed_at":"2026-08-02T06:26:17.199293Z","submitted_at":"2025-07-10T17:57:46Z","title":"EXPO: Stable Reinforcement Learning with Expressive Policies","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-19T05:09:02.111308Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2507.07986"},"observation_digest":"sha256:a0b30507b65e7fa96dcb56f76d6205b55cb06b0ed95a727c896849b371fd2d60","observation_id":"441c3157-77e6-4b7d-8c39-ea13c868c73b","resolution":{"observed_at":"2026-05-19T05:12:05.210606Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":"1812.05905","doi":"10.48550/arxiv.1812.05905","metadata_source":"pith","pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Soft Actor-Critic Algorithms and Applications","venue":"cs.LG","work_id":"bb49c9fb-03b2-4226-9edb-50186b8193e4","year":2018},"citing_paper":{"arxiv_id":"2507.09794","last_updated":"2026-05-03T14:42:54Z","snapshot_observed_at":"2026-07-06T21:56:31.058246Z","submitted_at":"2025-07-13T21:15:11Z","title":"Joint Scheduling of Deferrable and Nondeferrable Demand with Colocated Stochastic Supply","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-19T04:49:54.452877Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2507.09794"},"observation_digest":"sha256:de140623bce98001938b1bb5d7d952758d4ad63dc144f3f6408305bd8914c03e","observation_id":"1ecd2410-400d-4ea5-9193-50e0c50907ba","resolution":{"observed_at":"2026-05-19T04:52:03.701273Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":"1812.05905","doi":"10.48550/arxiv.1812.05905","metadata_source":"pith","pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Soft Actor-Critic Algorithms and Applications","venue":"cs.LG","work_id":"bb49c9fb-03b2-4226-9edb-50186b8193e4","year":2018},"citing_paper":{"arxiv_id":"2507.11019","last_updated":"2026-04-10T20:59:50Z","snapshot_observed_at":"2026-07-31T18:10:16.153395Z","submitted_at":"2025-07-15T06:24:07Z","title":"Relative Entropy Pathwise Policy Optimization","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-19T04:19:15.018380Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2507.11019"},"observation_digest":"sha256:7a79edfdcf5d58c4d0333867d9fef2c7a0c16dc864c6a847f1f68ba2f95cc03f","observation_id":"0926d32f-33a8-4238-a6a1-9a2b6d55eefe","resolution":{"observed_at":"2026-05-19T04:22:04.030185Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":"1812.05905","doi":"10.48550/arxiv.1812.05905","metadata_source":"pith","pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Soft Actor-Critic Algorithms and Applications","venue":"cs.LG","work_id":"bb49c9fb-03b2-4226-9edb-50186b8193e4","year":2018},"citing_paper":{"arxiv_id":"2507.23501","last_updated":"2026-05-06T14:50:11Z","snapshot_observed_at":"2026-07-31T14:58:14.768285Z","submitted_at":"2025-07-31T12:40:50Z","title":"Adaptive Ensemble Aggregation for Actor-Critics","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-19T02:14:26.752215Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2507.23501"},"observation_digest":"sha256:d061e5e17104bd9c0b3780cc6d142273feb4bc59cbdc183e6f7309b7a854d867","observation_id":"3c12a234-e4d3-4de2-b97d-61f99e7fb5d7","resolution":{"observed_at":"2026-05-19T02:16:59.354135Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":"1812.05905","doi":"10.48550/arxiv.1812.05905","metadata_source":"pith","pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Soft Actor-Critic Algorithms and Applications","venue":"cs.LG","work_id":"bb49c9fb-03b2-4226-9edb-50186b8193e4","year":2018},"citing_paper":{"arxiv_id":"2508.01049","last_updated":"2026-05-13T06:44:44Z","snapshot_observed_at":"2026-08-03T03:51:19.181251Z","submitted_at":"2025-08-01T20:07:25Z","title":"Centralized Adaptive Sampling for Reliable Co-Training of Independent Multi-Agent Policies","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-19T01:05:17.086399Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2508.01049"},"observation_digest":"sha256:e542296f05ff83b06aa9b1f6008b4f4b61619ba72db29e6b78b2aabfa7290589","observation_id":"532e41a7-e47f-452f-afcb-f6236261a1d2","resolution":{"observed_at":"2026-05-19T01:06:57.426948Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-05T23:13:49.027688Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.16589","last_updated":"2025-08-07T21:50:30Z","snapshot_observed_at":"2026-08-05T23:13:46.050130Z","submitted_at":"2025-08-07T21:50:30Z","title":"ARL-Based Multi-Action Market Making with Hawkes Processes and Variable Volatility","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T23:13:49.027688Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2508.16589"},"observation_digest":"sha256:c997c3dbb66ec4ce5455d8a5af3396be7d6d4f9baa37c647b91647a6b7cc619c","observation_id":"038baf6d-51ab-4cd8-91cc-f340ef3d6b4d","resolution":{"observed_at":"2026-08-05T23:13:49.027688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-05T13:55:18.610364Z","title":"Haarnoja, A","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.00215","last_updated":"2025-09-04T12:46:04Z","snapshot_observed_at":"2026-08-05T13:55:17.025009Z","submitted_at":"2025-08-29T19:55:25Z","title":"First Order Model-Based RL through Decoupled Backpropagation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T13:55:18.610364Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2509.00215"},"observation_digest":"sha256:f4e7706a956b216a9e074ae60025822ef0cec455cb01330512f16895be9518ec","observation_id":"dacb7721-7cc3-412a-aec8-d89b4dd0d079","resolution":{"observed_at":"2026-08-05T13:55:18.610364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-05T00:07:52.792545Z","title":"Soft actor-critic algorithms and applications,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.06170","last_updated":"2025-09-07T18:41:54Z","snapshot_observed_at":"2026-08-05T00:07:50.895525Z","submitted_at":"2025-09-07T18:41:54Z","title":"Pinching Antenna System (PASS) Enhanced Covert Communications: Against Warden via Sensing","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T00:07:52.792545Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2509.06170"},"observation_digest":"sha256:fe281b0e8358b7ac5e391630dd31415c3906e20eb74b6185a0d11f3f5599a5b6","observation_id":"f4ab26b5-cdc7-4628-ab95-277411eca475","resolution":{"observed_at":"2026-08-05T00:07:52.792545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-04T22:18:03.122664Z","title":"Soft actor-critic algorithms and applications,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.07412","last_updated":"2025-09-09T05:49:46Z","snapshot_observed_at":"2026-08-04T22:18:01.957486Z","submitted_at":"2025-09-09T05:49:46Z","title":"Attention and Risk-Aware Decision Framework for Safe Autonomous Driving","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T22:18:03.122664Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2509.07412"},"observation_digest":"sha256:7e91e11c9da04041143a20a306d6ade453c217e41fa679576c15b6914b9925b0","observation_id":"c81b2da2-632d-453e-b65a-b60dc87ec669","resolution":{"observed_at":"2026-08-04T22:18:03.122664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":"1812.05905","doi":"10.48550/arxiv.1812.05905","metadata_source":"pith","pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Soft Actor-Critic Algorithms and Applications","venue":"cs.LG","work_id":"bb49c9fb-03b2-4226-9edb-50186b8193e4","year":2018},"citing_paper":{"arxiv_id":"2509.09838","last_updated":"2026-05-11T21:29:26Z","snapshot_observed_at":"2026-07-06T22:29:01.585836Z","submitted_at":"2025-09-11T20:34:08Z","title":"Dissecting Discrete Soft Actor-Critic: Limitations and Principled Alternatives","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-05-18T17:05:36.100114Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2509.09838"},"observation_digest":"sha256:d4fa3d4229175c81f6f118fe4063a36607e806e3c44c4e214cfbe242736db858","observation_id":"ecb03fdc-7934-4344-b447-05ecf8c4d8c3","resolution":{"observed_at":"2026-05-18T17:06:39.748856Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":"1812.05905","doi":"10.48550/arxiv.1812.05905","metadata_source":"pith","pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Soft Actor-Critic Algorithms and Applications","venue":"cs.LG","work_id":"bb49c9fb-03b2-4226-9edb-50186b8193e4","year":2018},"citing_paper":{"arxiv_id":"2509.11002","last_updated":"2026-05-14T21:50:15Z","snapshot_observed_at":"2026-08-01T06:34:48.520047Z","submitted_at":"2025-09-13T23:03:51Z","title":"Real-time reinforcement learning for turbulent state-dependent control in a bluff-body wake","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-21T22:42:00.056915Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2509.11002"},"observation_digest":"sha256:f2697c69bc46cdf8c2b1e19135f64c426864d12155232942624baf53864b18db","observation_id":"cb6c0065-2f26-432c-a2fa-7dd6b8c9e369","resolution":{"observed_at":"2026-05-21T22:44:24.425922Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-04T16:56:47.457432Z","title":"Soft actor-critic algorithms and applications,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.11240","last_updated":"2025-09-14T12:33:17Z","snapshot_observed_at":"2026-08-04T16:56:45.596039Z","submitted_at":"2025-09-14T12:33:17Z","title":"CORB-Planner: Corridor as Observations for RL Planning in High-Speed Flight","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T16:56:47.457432Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2509.11240"},"observation_digest":"sha256:81076c6fb83679f3c869ac2d0f37ecf3a930c34055ec7ad93a78955aee7a2e2a","observation_id":"05af16a5-ca92-4f9a-8214-d4dd341bcb93","resolution":{"observed_at":"2026-08-04T16:56:47.457432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":"1812.05905","doi":"10.48550/arxiv.1812.05905","metadata_source":"pith","pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Soft Actor-Critic Algorithms and Applications","venue":"cs.LG","work_id":"bb49c9fb-03b2-4226-9edb-50186b8193e4","year":2018},"citing_paper":{"arxiv_id":"2509.17387","last_updated":"2025-09-22T06:51:53Z","snapshot_observed_at":"2026-07-06T22:30:26.679189Z","submitted_at":"2025-09-22T06:51:53Z","title":"High-Precision and High-Efficiency Trajectory Tracking for Excavators Based on Closed-Loop Dynamics","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-18T15:30:19.253933Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2509.17387"},"observation_digest":"sha256:02260a30417721977f05abb5dc53090af9dbcbe41f93b3fd64c36bf7d2e26b5e","observation_id":"c6996be6-81ad-4798-8b84-3b0317f39487","resolution":{"observed_at":"2026-05-18T15:31:33.450845Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":"1812.05905","doi":"10.48550/arxiv.1812.05905","metadata_source":"pith","pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Soft Actor-Critic Algorithms and Applications","venue":"cs.LG","work_id":"bb49c9fb-03b2-4226-9edb-50186b8193e4","year":2018},"citing_paper":{"arxiv_id":"2509.25284","last_updated":"2026-04-07T12:37:14Z","snapshot_observed_at":"2026-08-05T23:20:08.051375Z","submitted_at":"2025-09-29T09:48:00Z","title":"Optimisation of Resource Allocation in Heterogeneous Wireless Networks Using Deep Reinforcement Learning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-18T12:15:50.805708Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2509.25284"},"observation_digest":"sha256:c05fe3759ac2890451cc395b4abd0910c9a61a2e580cb79dcd867ecce9665a84","observation_id":"bfb88eb3-2014-44bd-b51e-3d4650a46604","resolution":{"observed_at":"2026-05-18T12:16:21.599517Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":"1812.05905","doi":"10.48550/arxiv.1812.05905","metadata_source":"pith","pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Soft Actor-Critic Algorithms and Applications","venue":"cs.LG","work_id":"bb49c9fb-03b2-4226-9edb-50186b8193e4","year":2018},"citing_paper":{"arxiv_id":"2509.25284","last_updated":"2026-04-07T12:37:14Z","snapshot_observed_at":"2026-08-05T23:20:08.051375Z","submitted_at":"2025-09-29T09:48:00Z","title":"Optimisation of Resource Allocation in Heterogeneous Wireless Networks Using Deep Reinforcement Learning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-18T12:15:50.805708Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2509.25284"},"observation_digest":"sha256:31cc037a06105ba626a78cf71a4d55aa9ab068ef2da39df50a84b11577c58c84","observation_id":"358cb053-1672-455c-8516-d252540d03e6","resolution":{"observed_at":"2026-05-18T12:16:21.481489Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":"1812.05905","doi":"10.48550/arxiv.1812.05905","metadata_source":"pith","pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Soft Actor-Critic Algorithms and Applications","venue":"cs.LG","work_id":"bb49c9fb-03b2-4226-9edb-50186b8193e4","year":2018},"citing_paper":{"arxiv_id":"2510.02590","last_updated":"2026-05-18T11:40:07Z","snapshot_observed_at":"2026-08-02T16:31:11.111154Z","submitted_at":"2025-10-02T21:48:01Z","title":"Use the Online Network If You Can: Towards Fast and Stable Reinforcement Learning","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-21T21:33:40.229376Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2510.02590"},"observation_digest":"sha256:cec91542fe81f67e3c3d649fd0f87e48b858a8e456ca7ec4d4910f1dfe9cf3a0","observation_id":"f473e237-c902-4191-878e-2294cefac0a7","resolution":{"observed_at":"2026-05-21T21:34:22.323552Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":"1812.05905","doi":"10.48550/arxiv.1812.05905","metadata_source":"pith","pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Soft Actor-Critic Algorithms and Applications","venue":"cs.LG","work_id":"bb49c9fb-03b2-4226-9edb-50186b8193e4","year":2018},"citing_paper":{"arxiv_id":"2511.08717","last_updated":"2026-05-04T18:26:22Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-11T19:27:14Z","title":"Optimal control of the future via prospective learning with control","version":4},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-17T23:04:54.956095Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2511.08717"},"observation_digest":"sha256:58a5d38fe8114f42ac7ac0bb05661f437b2eb05d59e42028ed0d34f48350946e","observation_id":"9e3c1d92-83e3-4ca5-88ba-e1ecd28a8324","resolution":{"observed_at":"2026-05-17T23:05:25.321470Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":"1812.05905","doi":"10.48550/arxiv.1812.05905","metadata_source":"pith","pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Soft Actor-Critic Algorithms and Applications","venue":"cs.LG","work_id":"bb49c9fb-03b2-4226-9edb-50186b8193e4","year":2018},"citing_paper":{"arxiv_id":"2511.14427","last_updated":"2026-06-10T11:22:17Z","snapshot_observed_at":"2026-08-03T21:40:38.191878Z","submitted_at":"2025-11-18T12:32:23Z","title":"Self-Supervised Multisensory Pretraining for Contact-Rich Robot Reinforcement Learning","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-17T21:04:41.766964Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2511.14427"},"observation_digest":"sha256:1d3800ea5cf0368f70c1435c32acaac86765dcbcb253a44bf8f8ddcd363211cd","observation_id":"73d398b9-9885-420e-993b-52bf937ebf85","resolution":{"observed_at":"2026-05-17T21:05:15.565069Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-03T21:40:43.870053Z","title":"Soft Actor- Critic Algorithms and Applications,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2511.14427","last_updated":"2026-06-10T11:22:17Z","snapshot_observed_at":"2026-08-03T21:40:38.191878Z","submitted_at":"2025-11-18T12:32:23Z","title":"Self-Supervised Multisensory Pretraining for Contact-Rich Robot Reinforcement Learning","version":4},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-03T21:40:43.870053Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2511.14427"},"observation_digest":"sha256:68f124f50ef98271af6e8d69f83f1e13ffda8e309a20db79b084c913250ddcd9","observation_id":"f6c6dc51-1296-4c12-98e6-e1a0679284c3","resolution":{"observed_at":"2026-08-03T21:40:43.870053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":"1812.05905","doi":"10.48550/arxiv.1812.05905","metadata_source":"pith","pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Soft Actor-Critic Algorithms and Applications","venue":"cs.LG","work_id":"bb49c9fb-03b2-4226-9edb-50186b8193e4","year":2018},"citing_paper":{"arxiv_id":"2511.17171","last_updated":"2026-05-22T12:44:18Z","snapshot_observed_at":"2026-08-02T04:31:50.136077Z","submitted_at":"2025-11-21T11:45:22Z","title":"FireScope: Wildfire Risk Raster Prediction with a Chain-of-Thought Oracle","version":5},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-17T20:45:15.034196Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2511.17171"},"observation_digest":"sha256:0c756fd02f1164488b07edf7f143c909f0d996f94db3549d52c3aef454a67579","observation_id":"fcdc9dcd-3e93-43ce-bb7e-19946af7fa7c","resolution":{"observed_at":"2026-05-17T20:50:15.261334Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":"1812.05905","doi":"10.48550/arxiv.1812.05905","metadata_source":"pith","pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Soft Actor-Critic Algorithms and Applications","venue":"cs.LG","work_id":"bb49c9fb-03b2-4226-9edb-50186b8193e4","year":2018},"citing_paper":{"arxiv_id":"2511.17171","last_updated":"2026-05-22T12:44:18Z","snapshot_observed_at":"2026-08-02T04:31:50.136077Z","submitted_at":"2025-11-21T11:45:22Z","title":"FireScope: Wildfire Risk Raster Prediction with a Chain-of-Thought Oracle","version":6},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-25T07:17:26.381232Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2511.17171"},"observation_digest":"sha256:913c412349e2a84010ece11c3d66cccaee480ecb085dcd135e97e9f1b87b2cf5","observation_id":"a1643d85-eec6-468e-87a1-d17242d0dd14","resolution":{"observed_at":"2026-05-25T07:20:28.851507Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":"1812.05905","doi":"10.48550/arxiv.1812.05905","metadata_source":"pith","pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Soft Actor-Critic Algorithms and Applications","venue":"cs.LG","work_id":"bb49c9fb-03b2-4226-9edb-50186b8193e4","year":2018},"citing_paper":{"arxiv_id":"2511.17367","last_updated":"2026-05-14T11:57:30Z","snapshot_observed_at":"2026-08-05T22:02:12.858510Z","submitted_at":"2025-11-21T16:34:00Z","title":"R2PS: Worst-Case Robust Real-Time Pursuit Strategies under Partial Observability","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-17T20:19:24.841090Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2511.17367"},"observation_digest":"sha256:b03b5470d9b614df241a9a1d1318b10f5cf4073fa4261fe8235d84335c40d42b","observation_id":"95d99f5d-bda2-4a7c-b026-08f969a348f9","resolution":{"observed_at":"2026-05-17T20:20:11.604219Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":"1812.05905","doi":"10.48550/arxiv.1812.05905","metadata_source":"pith","pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Soft Actor-Critic Algorithms and Applications","venue":"cs.LG","work_id":"bb49c9fb-03b2-4226-9edb-50186b8193e4","year":2018},"citing_paper":{"arxiv_id":"2512.08411","last_updated":"2026-05-13T07:02:09Z","snapshot_observed_at":"2026-08-02T21:03:40.872307Z","submitted_at":"2025-12-09T09:40:34Z","title":"Prismatic World Model: Learning Compositional Dynamics for Planning in Hybrid Systems","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-17T00:36:26.202547Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2512.08411"},"observation_digest":"sha256:9e4fcd60611c7e650a1b5561a468a52c38ec4eda4303dff75802c3b0db78a1d8","observation_id":"b69198c5-b6ba-4006-961e-e3c6265b7ae8","resolution":{"observed_at":"2026-05-17T00:38:44.983292Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":"1812.05905","doi":"10.48550/arxiv.1812.05905","metadata_source":"pith","pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Soft Actor-Critic Algorithms and Applications","venue":"cs.LG","work_id":"bb49c9fb-03b2-4226-9edb-50186b8193e4","year":2018},"citing_paper":{"arxiv_id":"2601.05249","last_updated":"2026-07-08T14:49:18Z","snapshot_observed_at":"2026-08-03T11:45:39.803338Z","submitted_at":"2026-01-08T18:59:55Z","title":"RL-AWB: Deep Reinforcement Learning for Auto White Balance Correction in Low-Light Night-time Scenes","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-16T16:00:10.425309Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2601.05249"},"observation_digest":"sha256:90731f2f3fbc63d304230ef2ee87bd2c3dd49930df09516249adf54f281c96fe","observation_id":"9e980c30-3165-4cd3-bca0-3ba4620548e6","resolution":{"observed_at":"2026-05-16T16:01:04.877390Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-03T11:45:47.594375Z","title":"arXiv preprint arXiv:1812.05905 (2018)","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2601.05249","last_updated":"2026-07-08T14:49:18Z","snapshot_observed_at":"2026-08-03T11:45:39.803338Z","submitted_at":"2026-01-08T18:59:55Z","title":"RL-AWB: Deep Reinforcement Learning for Auto White Balance Correction in Low-Light Night-time Scenes","version":4},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-03T11:45:47.594375Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2601.05249"},"observation_digest":"sha256:98ba35cab25b8cf680dc9d2f3a4e896865594c0c89d1b74d2811ab5be7e5c3be","observation_id":"f68c516d-3a0b-4499-8585-60b1fd0c7a06","resolution":{"observed_at":"2026-08-03T11:45:47.594375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-03T11:28:07.479935Z","title":", author Zhou, A","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2601.06485","last_updated":"2026-01-10T08:42:24Z","snapshot_observed_at":"2026-08-03T12:19:53.967414Z","submitted_at":"2026-01-10T08:42:24Z","title":"Coupling Smoothed Particle Hydrodynamics with Multi-Agent Deep Reinforcement Learning for Cooperative Control of Point Absorbers","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-03T11:28:07.479935Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2601.06485"},"observation_digest":"sha256:0c0a854032ed5b5956ef03624e2bc1c41e6dcfe6966149ae5298f01c1891ef06","observation_id":"74b6f97a-63fa-4c28-9916-1c04bc9487b0","resolution":{"observed_at":"2026-08-03T11:28:07.479935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-03T10:52:32.302308Z","title":"Soft actor-critic algorithms and appli- cations.arXiv preprint arXiv:1812.05905, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2601.08662","last_updated":"2026-07-20T11:43:20Z","snapshot_observed_at":"2026-08-03T10:52:30.370865Z","submitted_at":"2026-01-13T15:40:55Z","title":"From Classical to Quantum Reinforcement Learning and Its Applications in Quantum Control: A Beginner's Tutorial","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-03T10:52:32.302308Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2601.08662"},"observation_digest":"sha256:cc4c0753f25d8632c3dd6f2176ea39e03e6ca0b08c5c739a397752c4073eb119","observation_id":"17303f39-74c6-4d13-8187-ce9fbfcc348b","resolution":{"observed_at":"2026-08-03T10:52:32.302308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-03T06:57:05.568437Z","title":"Soft actor- critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2601.21778","last_updated":"2026-07-23T14:57:14Z","snapshot_observed_at":"2026-08-03T06:57:04.157627Z","submitted_at":"2026-01-29T14:28:00Z","title":"Error Amplification Limits ANN-to-SNN Conversion in Continuous Control","version":3},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-03T06:57:05.568437Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2601.21778"},"observation_digest":"sha256:32a104cd99203f499fcb8be2762ceb6a6cbb4d1d71baeef5d981c8b2271ca2f5","observation_id":"eefce765-f798-4859-8b44-f3855decb498","resolution":{"observed_at":"2026-08-03T06:57:05.568437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-03T06:13:00.293028Z","title":"Han, S., Mao, H., and Dally, W","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.23225","last_updated":"2026-06-27T19:54:11Z","snapshot_observed_at":"2026-08-03T13:58:34.969644Z","submitted_at":"2026-01-30T17:47:36Z","title":"Agile Reinforcement Learning through Separable Neural Architecture and Applications","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T06:13:00.293028Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2601.23225"},"observation_digest":"sha256:7d6ea5bae213bd746c4e08524c2c158af0746a7064ff59bcacba6bbae87491cc","observation_id":"b401733e-c3c8-42a7-8dbd-bdf11baa7076","resolution":{"observed_at":"2026-08-03T06:13:00.293028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-03T04:47:40.482295Z","title":"Soft actor-critic algorithms and applications,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2602.04132","last_updated":"2026-06-01T20:53:26Z","snapshot_observed_at":"2026-08-04T11:16:02.112288Z","submitted_at":"2026-02-04T01:51:05Z","title":"LC-SAC: Lyapunov-Constrained Soft Actor-Critic via Koopman Operator Theory for Trajectory Tracking and Stabilization","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T04:47:40.482295Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2602.04132"},"observation_digest":"sha256:22a332be3e99dea7c82c1a478ff6d0f640767f9bf0bef3e2bf9a68b5a6e71334","observation_id":"246dd066-841b-41c7-a065-a2bd62a92113","resolution":{"observed_at":"2026-08-03T04:47:40.482295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-03T04:03:56.421007Z","title":"Soft actor-critic algorithms and applications","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2602.06219","last_updated":"2026-06-01T20:55:42Z","snapshot_observed_at":"2026-08-03T04:03:55.072444Z","submitted_at":"2026-02-05T21:57:41Z","title":"Coupled Local and Global World Models for Efficient First Order RL","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T04:03:56.421007Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2602.06219"},"observation_digest":"sha256:39804310be8484ebadd7904b864619dfbb62cb8a1d6ac9c1a98ef6c9edbc7253","observation_id":"f273cae3-e53d-4d1c-8099-b10c5b7bf316","resolution":{"observed_at":"2026-08-03T04:03:56.421007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":"1812.05905","doi":"10.48550/arxiv.1812.05905","metadata_source":"pith","pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Soft Actor-Critic Algorithms and Applications","venue":"cs.LG","work_id":"bb49c9fb-03b2-4226-9edb-50186b8193e4","year":2018},"citing_paper":{"arxiv_id":"2602.14191","last_updated":"2026-05-15T12:34:56Z","snapshot_observed_at":"2026-07-06T22:45:58.457005Z","submitted_at":"2026-02-15T15:37:10Z","title":"Robust SAC-Enabled UAV-RIS Assisted Secure MISO Systems With Untrusted EH Receivers","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-21T12:51:58.851812Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2602.14191"},"observation_digest":"sha256:058bee886412b4df2609d2c13198f37690bd1cb38b6b06b454510d6040e253e5","observation_id":"7789059b-9a07-42cb-a407-bdfedfc5dea1","resolution":{"observed_at":"2026-05-21T12:54:10.623520Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":"1812.05905","doi":"10.48550/arxiv.1812.05905","metadata_source":"pith","pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Soft Actor-Critic Algorithms and Applications","venue":"cs.LG","work_id":"bb49c9fb-03b2-4226-9edb-50186b8193e4","year":2018},"citing_paper":{"arxiv_id":"2603.14094","last_updated":"2026-05-12T11:36:55Z","snapshot_observed_at":"2026-08-03T09:41:34.641448Z","submitted_at":"2026-03-14T19:40:39Z","title":"Maximin Robust Bayesian Experimental Design","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-15T11:13:06.058747Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2603.14094"},"observation_digest":"sha256:29065432b10a2370500fc6383ec2a7dcfb65359fd4bb5faa3a1a6bc4c0a5bf65","observation_id":"612cc045-a79b-4a03-ad1e-82dd76e199ed","resolution":{"observed_at":"2026-05-15T11:15:30.097235Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":"1812.05905","doi":"10.48550/arxiv.1812.05905","metadata_source":"pith","pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Soft Actor-Critic Algorithms and Applications","venue":"cs.LG","work_id":"bb49c9fb-03b2-4226-9edb-50186b8193e4","year":2018},"citing_paper":{"arxiv_id":"2603.15759","last_updated":"2026-05-12T15:04:33Z","snapshot_observed_at":"2026-07-06T22:49:19.323519Z","submitted_at":"2026-03-16T18:00:23Z","title":"Simulation Distillation: Pretraining World Models in Simulation for Rapid Real-World Adaptation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-15T09:49:03.333757Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2603.15759"},"observation_digest":"sha256:245538fedd08e05228c090ece9c73f3fa84e4621c21a57a6acc494fc22d2f079","observation_id":"486c2dc2-3e05-461c-86b7-7b244acf5b49","resolution":{"observed_at":"2026-05-15T09:49:54.458492Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-02T17:28:25.739838Z","title":"Soft actor-critic algorithms and applications,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2603.25332","last_updated":"2026-07-29T13:02:23Z","snapshot_observed_at":"2026-08-02T17:58:36.026175Z","submitted_at":"2026-03-26T11:20:49Z","title":"DRL-Based Spectrum Sharing for RIS-Aided Local High-Quality Wireless Networks","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T17:28:25.739838Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2603.25332"},"observation_digest":"sha256:81a1d0fa42f8bf00e23360331074bb92652f06c08391eca4bbfa69441744aa4d","observation_id":"95851a73-591a-427b-802f-61c734bfc990","resolution":{"observed_at":"2026-08-02T17:28:25.739838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":"1812.05905","doi":"10.48550/arxiv.1812.05905","metadata_source":"pith","pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Soft Actor-Critic Algorithms and Applications","venue":"cs.LG","work_id":"bb49c9fb-03b2-4226-9edb-50186b8193e4","year":2018},"citing_paper":{"arxiv_id":"2604.03641","last_updated":"2026-05-02T05:53:33Z","snapshot_observed_at":"2026-07-31T22:09:03.939107Z","submitted_at":"2026-04-04T08:38:52Z","title":"Delayed homomorphic reinforcement learning for environments with delayed feedback","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-13T18:44:26.633008Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2604.03641"},"observation_digest":"sha256:df00863086fe95702237c626b227d61c0dbf481fa3607748d1bd09a8329f62de","observation_id":"7f36c4ba-1005-4714-82f6-deffa8506f90","resolution":{"observed_at":"2026-05-13T18:48:08.241230Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":"1812.05905","doi":"10.48550/arxiv.1812.05905","metadata_source":"pith","pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Soft Actor-Critic Algorithms and Applications","venue":"cs.LG","work_id":"bb49c9fb-03b2-4226-9edb-50186b8193e4","year":2018},"citing_paper":{"arxiv_id":"2604.07945","last_updated":"2026-06-24T02:54:08Z","snapshot_observed_at":"2026-07-13T00:08:52.364953Z","submitted_at":"2026-04-09T08:08:37Z","title":"Incremental Residual Reinforcement Learning Toward Real-World Learning for Social Navigation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-10T17:48:36.372298Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2604.07945"},"observation_digest":"sha256:b289afea5fb1d76a4a9a7d0e614b3d806e8917d062bc2d3179566b86d9a9fb1e","observation_id":"d4321f1b-bd07-41da-ab1b-6dc4d73471b0","resolution":{"observed_at":"2026-05-13T14:32:42.077468Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-07-13T00:08:53.253285Z","title":"abs/1812.05905, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2604.07945","last_updated":"2026-06-24T02:54:08Z","snapshot_observed_at":"2026-07-13T00:08:52.364953Z","submitted_at":"2026-04-09T08:08:37Z","title":"Incremental Residual Reinforcement Learning Toward Real-World Learning for Social Navigation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-13T00:08:53.253285Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2604.07945"},"observation_digest":"sha256:04315e03af20e225b896370159b42cb451361f113e65b18cc985364f0540ffd6","observation_id":"e3da9749-3322-4bf0-b126-e5faa8493991","resolution":{"observed_at":"2026-07-13T00:08:53.253285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":"1812.05905","doi":"10.48550/arxiv.1812.05905","metadata_source":"pith","pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Soft Actor-Critic Algorithms and Applications","venue":"cs.LG","work_id":"bb49c9fb-03b2-4226-9edb-50186b8193e4","year":2018},"citing_paper":{"arxiv_id":"2604.09474","last_updated":"2026-04-10T16:33:32Z","snapshot_observed_at":"2026-07-06T22:58:21.624968Z","submitted_at":"2026-04-10T16:33:32Z","title":"SafeMind: A Risk-Aware Differentiable Control Framework for Adaptive and Safe Quadruped Locomotion","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T17:00:42.108837Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2604.09474"},"observation_digest":"sha256:98765914b593c1d7c14f7edd216584a3b3593195b8413e793200564f37135a16","observation_id":"ad244b88-38e9-479f-a4f9-8c82dd39c708","resolution":{"observed_at":"2026-05-13T14:32:42.077468Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-07-12T23:09:48.353960Z","title":"Soft actor-critic algorithms and applications,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2604.09498","last_updated":"2026-06-21T16:06:34Z","snapshot_observed_at":"2026-08-02T12:29:58.133590Z","submitted_at":"2026-04-10T17:08:44Z","title":"New Scheme Adaption Strategy for Hyperbolic Conservation Laws","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-12T23:09:48.353960Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2604.09498"},"observation_digest":"sha256:e69399cb64197f0cf5c6877a7b237d658a8434ca2deded7e140ce4038abd2363","observation_id":"161cb248-9b4a-4ba7-a6b3-3289aa1add26","resolution":{"observed_at":"2026-07-12T23:09:48.353960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":"1812.05905","doi":"10.48550/arxiv.1812.05905","metadata_source":"pith","pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Soft Actor-Critic Algorithms and Applications","venue":"cs.LG","work_id":"bb49c9fb-03b2-4226-9edb-50186b8193e4","year":2018},"citing_paper":{"arxiv_id":"2604.09499","last_updated":"2026-04-10T17:12:07Z","snapshot_observed_at":"2026-07-06T22:58:21.624968Z","submitted_at":"2026-04-10T17:12:07Z","title":"Physics-Informed Reinforcement Learning of Spatial Density Velocity Potentials for Map-Free Racing","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-10T16:47:38.002725Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2604.09499"},"observation_digest":"sha256:a46630966673158538c9021b9a36a7cb60baf9948e1d58c0d0679e16ceacb387","observation_id":"6a25bd6b-59ec-4436-a3dc-1a4cc8762a3f","resolution":{"observed_at":"2026-05-13T14:32:42.077468Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":"1812.05905","doi":"10.48550/arxiv.1812.05905","metadata_source":"pith","pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Soft Actor-Critic Algorithms and Applications","venue":"cs.LG","work_id":"bb49c9fb-03b2-4226-9edb-50186b8193e4","year":2018},"citing_paper":{"arxiv_id":"2604.10548","last_updated":"2026-04-16T03:00:59Z","snapshot_observed_at":"2026-08-02T18:43:14.044846Z","submitted_at":"2026-04-12T09:38:00Z","title":"Simple but Stable, Fast and Safe: Achieve End-to-end Control by High-Fidelity Differentiable Simulation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-10T16:27:25.150807Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2604.10548"},"observation_digest":"sha256:37be1ba2cca1599ebf4d0f8f591b2b4cfcc8d7be5d9b677a74226bace22c2efb","observation_id":"7e004d75-46f9-47e9-9147-4cd2a2c46b10","resolution":{"observed_at":"2026-05-13T14:32:42.077468Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":"1812.05905","doi":"10.48550/arxiv.1812.05905","metadata_source":"pith","pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Soft Actor-Critic Algorithms and Applications","venue":"cs.LG","work_id":"bb49c9fb-03b2-4226-9edb-50186b8193e4","year":2018},"citing_paper":{"arxiv_id":"2604.11773","last_updated":"2026-04-13T17:42:19Z","snapshot_observed_at":"2026-07-06T23:00:03.762376Z","submitted_at":"2026-04-13T17:42:19Z","title":"Autonomous Diffractometry Enabled by Visual Reinforcement Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T16:03:35.110730Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2604.11773"},"observation_digest":"sha256:6dec41576ad38081310ec592b3d8db8f15d98675bd6b8814ab797378d3ca9983","observation_id":"bcd90826-73e6-42d1-a4e3-db7bc3fc3c28","resolution":{"observed_at":"2026-05-13T14:32:42.077468Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":"1812.05905","doi":"10.48550/arxiv.1812.05905","metadata_source":"pith","pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Soft Actor-Critic Algorithms and Applications","venue":"cs.LG","work_id":"bb49c9fb-03b2-4226-9edb-50186b8193e4","year":2018},"citing_paper":{"arxiv_id":"2604.15614","last_updated":"2026-04-17T01:41:52Z","snapshot_observed_at":"2026-08-04T05:59:07.745295Z","submitted_at":"2026-04-17T01:41:52Z","title":"Flexible Empowerment at Reasoning with Extended Best-of-N Sampling","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T09:39:29.875977Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2604.15614"},"observation_digest":"sha256:98e8d2e48adcfc77f7d39dd4073e3ccb041851b6ce8ee7d92d6594b0c9250f98","observation_id":"246ae235-502a-4748-8ab8-5f186da7c2d8","resolution":{"observed_at":"2026-05-13T14:32:42.077468Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":"1812.05905","doi":"10.48550/arxiv.1812.05905","metadata_source":"pith","pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Soft Actor-Critic Algorithms and Applications","venue":"cs.LG","work_id":"bb49c9fb-03b2-4226-9edb-50186b8193e4","year":2018},"citing_paper":{"arxiv_id":"2604.21130","last_updated":"2026-04-22T22:40:11Z","snapshot_observed_at":"2026-07-06T23:07:47.244208Z","submitted_at":"2026-04-22T22:40:11Z","title":"Self-Predictive Representation for Autonomous UAV Object-Goal Navigation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-09T23:31:49.766698Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2604.21130"},"observation_digest":"sha256:7238e679d0c64fa4e115b3c58e32dd4cf462e3a3789ed3134f1d5e5492dfe0d6","observation_id":"f429daf2-bae0-43f2-8041-b6cc0bf7ff14","resolution":{"observed_at":"2026-05-13T14:32:42.077468Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":"1812.05905","doi":"10.48550/arxiv.1812.05905","metadata_source":"pith","pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Soft Actor-Critic Algorithms and Applications","venue":"cs.LG","work_id":"bb49c9fb-03b2-4226-9edb-50186b8193e4","year":2018},"citing_paper":{"arxiv_id":"2604.25788","last_updated":"2026-05-04T04:14:46Z","snapshot_observed_at":"2026-07-06T23:11:34.854305Z","submitted_at":"2026-04-28T15:58:09Z","title":"KinDER: A Physical Reasoning Benchmark for Robot Learning and Planning","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-07T15:39:17.505374Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2604.25788"},"observation_digest":"sha256:a07890ee6d9bf366bef3e94cf4d6a15878e0a2b28066a690a54bb187e945bee7","observation_id":"08555fc4-88c0-4ca8-baca-aee0bf2a8c7d","resolution":{"observed_at":"2026-05-13T14:32:42.077468Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":"1812.05905","doi":"10.48550/arxiv.1812.05905","metadata_source":"pith","pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Soft Actor-Critic Algorithms and Applications","venue":"cs.LG","work_id":"bb49c9fb-03b2-4226-9edb-50186b8193e4","year":2018},"citing_paper":{"arxiv_id":"2604.26689","last_updated":"2026-05-06T02:54:16Z","snapshot_observed_at":"2026-07-06T23:12:19.460065Z","submitted_at":"2026-04-29T13:56:11Z","title":"Atomic-Probe Governance for Skill Updates in Compositional Robot Policies","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-07T11:12:30.501043Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2604.26689"},"observation_digest":"sha256:683e99134a8bdc47b2f8c80ba9390f8fddd423d25c67c6a914d8250780e85015","observation_id":"0dfdda28-ccf0-44f6-b255-fcc7cc77e079","resolution":{"observed_at":"2026-05-13T14:32:42.077468Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":"1812.05905","doi":"10.48550/arxiv.1812.05905","metadata_source":"pith","pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Soft Actor-Critic Algorithms and Applications","venue":"cs.LG","work_id":"bb49c9fb-03b2-4226-9edb-50186b8193e4","year":2018},"citing_paper":{"arxiv_id":"2604.26689","last_updated":"2026-05-06T02:54:16Z","snapshot_observed_at":"2026-07-06T23:12:19.460065Z","submitted_at":"2026-04-29T13:56:11Z","title":"Atomic-Probe Governance for Skill Updates in Compositional Robot Policies","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-08T03:25:26.291747Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2604.26689"},"observation_digest":"sha256:20caf5abe0b2cc1ca264046f7c56fde1eee903515a0446cc16439b2b0b82c4fd","observation_id":"a8d20b2b-5a54-45d8-b892-a8e20b0a844b","resolution":{"observed_at":"2026-05-13T14:32:42.077468Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":"1812.05905","doi":"10.48550/arxiv.1812.05905","metadata_source":"pith","pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Soft Actor-Critic Algorithms and Applications","venue":"cs.LG","work_id":"bb49c9fb-03b2-4226-9edb-50186b8193e4","year":2018},"citing_paper":{"arxiv_id":"2605.00347","last_updated":"2026-05-01T02:05:56Z","snapshot_observed_at":"2026-07-06T23:13:47.082550Z","submitted_at":"2026-05-01T02:05:56Z","title":"Odysseus: Scaling VLMs to 100+ Turn Decision-Making in Games via Reinforcement Learning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-09T20:22:58.061772Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2605.00347"},"observation_digest":"sha256:c3cdde282635571fb099bc15066f090f8bd69264037bd85b14f39a6dfee5079a","observation_id":"50b569e9-fbc3-4852-9b7e-873121f41dbf","resolution":{"observed_at":"2026-05-13T14:32:42.077468Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":"1812.05905","doi":"10.48550/arxiv.1812.05905","metadata_source":"pith","pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Soft Actor-Critic Algorithms and Applications","venue":"cs.LG","work_id":"bb49c9fb-03b2-4226-9edb-50186b8193e4","year":2018},"citing_paper":{"arxiv_id":"2605.04555","last_updated":"2026-05-06T06:58:41Z","snapshot_observed_at":"2026-08-02T16:09:51.631796Z","submitted_at":"2026-05-06T06:58:41Z","title":"Counter-Dyna: Data-Efficient RL-Based HVAC Control using Counterfactual Building Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-08T16:38:22.468101Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2605.04555"},"observation_digest":"sha256:4f2f80a142c5739da4fb6eed69eef60cafaf259f50c8c421a04e6fa415b09493","observation_id":"c64ff3a5-6cab-4554-a6d5-fdbca793c2f5","resolution":{"observed_at":"2026-05-13T14:32:42.077468Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":"1812.05905","doi":"10.48550/arxiv.1812.05905","metadata_source":"pith","pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Soft Actor-Critic Algorithms and Applications","venue":"cs.LG","work_id":"bb49c9fb-03b2-4226-9edb-50186b8193e4","year":2018},"citing_paper":{"arxiv_id":"2605.05857","last_updated":"2026-06-09T16:00:28Z","snapshot_observed_at":"2026-08-01T16:34:36.444040Z","submitted_at":"2026-05-07T08:26:59Z","title":"Offline Reinforcement Learning for Rotation Profile Control in Tokamaks","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-08T14:49:07.819928Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2605.05857"},"observation_digest":"sha256:80283498fa00dbda7737ba61453a1252e765ec54279d6521732b0e122e39bc22","observation_id":"3edbc64a-2ec4-4ecc-ac04-2cc95416e8ad","resolution":{"observed_at":"2026-05-13T14:32:42.077468Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":"1812.05905","doi":"10.48550/arxiv.1812.05905","metadata_source":"pith","pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Soft Actor-Critic Algorithms and Applications","venue":"cs.LG","work_id":"bb49c9fb-03b2-4226-9edb-50186b8193e4","year":2018},"citing_paper":{"arxiv_id":"2605.08202","last_updated":"2026-05-06T01:21:53Z","snapshot_observed_at":"2026-07-06T23:20:28.875586Z","submitted_at":"2026-05-06T01:21:53Z","title":"Beyond Penalization: Diffusion-based Out-of-Distribution Detection and Selective Regularization in Offline Reinforcement Learning","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-05-12T02:17:25.783688Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2605.08202"},"observation_digest":"sha256:cd1ede8452444a9bc677f1c6e26ec5a60712996b907894bfa03beb66c110211b","observation_id":"46b446e5-9acb-40bb-bceb-fb78c2e2e1cf","resolution":{"observed_at":"2026-05-13T14:32:42.077468Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":"1812.05905","doi":"10.48550/arxiv.1812.05905","metadata_source":"pith","pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Soft Actor-Critic Algorithms and Applications","venue":"cs.LG","work_id":"bb49c9fb-03b2-4226-9edb-50186b8193e4","year":2018},"citing_paper":{"arxiv_id":"2605.08713","last_updated":"2026-05-09T05:50:40Z","snapshot_observed_at":"2026-07-29T19:10:22.533302Z","submitted_at":"2026-05-09T05:50:40Z","title":"REAP: Reinforcement-Learning End-to-End Autonomous Parking with Gaussian Splatting Simulator for Real2Sim2Real Transfer","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-12T01:30:06.120140Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2605.08713"},"observation_digest":"sha256:8994bac76153435400e4ab46642a73a6bcad6642eeb9ad705e6aac3bf65fcaba","observation_id":"7f6539ee-7775-4f35-8318-14e0b1b27013","resolution":{"observed_at":"2026-05-13T14:32:42.077468Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":"1812.05905","doi":"10.48550/arxiv.1812.05905","metadata_source":"pith","pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Soft Actor-Critic Algorithms and Applications","venue":"cs.LG","work_id":"bb49c9fb-03b2-4226-9edb-50186b8193e4","year":2018},"citing_paper":{"arxiv_id":"2605.08733","last_updated":"2026-05-09T06:36:32Z","snapshot_observed_at":"2026-07-06T23:20:57.084438Z","submitted_at":"2026-05-09T06:36:32Z","title":"Generative Actor-Critic with Soft Bridge Policies","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-12T04:01:08.896356Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2605.08733"},"observation_digest":"sha256:a16744554d6a866b23b976518c714ae60082fe367a764bdcb6ef3c599792e387","observation_id":"f728f5d6-0d94-4980-8799-36e8b2609b69","resolution":{"observed_at":"2026-05-13T14:32:42.077468Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":"1812.05905","doi":"10.48550/arxiv.1812.05905","metadata_source":"pith","pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Soft Actor-Critic Algorithms and Applications","venue":"cs.LG","work_id":"bb49c9fb-03b2-4226-9edb-50186b8193e4","year":2018},"citing_paper":{"arxiv_id":"2605.08946","last_updated":"2026-05-09T13:35:50Z","snapshot_observed_at":"2026-07-06T23:21:06.773761Z","submitted_at":"2026-05-09T13:35:50Z","title":"A Single Deep Preference-Conditioned Policy for Learning Pareto Coverage Sets","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-12T02:21:30.413575Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2605.08946"},"observation_digest":"sha256:8b76853ae9f6ddd9824a84a254803bd7c78c80b15cbf562533970eb54a6f0120","observation_id":"e11322e0-4c08-4519-9884-45916e93b863","resolution":{"observed_at":"2026-05-13T14:32:42.077468Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":"1812.05905","doi":"10.48550/arxiv.1812.05905","metadata_source":"pith","pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Soft Actor-Critic Algorithms and Applications","venue":"cs.LG","work_id":"bb49c9fb-03b2-4226-9edb-50186b8193e4","year":2018},"citing_paper":{"arxiv_id":"2605.09157","last_updated":"2026-05-09T20:37:52Z","snapshot_observed_at":"2026-08-02T18:03:50.564757Z","submitted_at":"2026-05-09T20:37:52Z","title":"Revisiting Mixture Policies in Entropy-Regularized Actor-Critic","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:08.990277Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2605.09157"},"observation_digest":"sha256:dc2734acced21d5fcea8ff04a32f946ac281b3da94064dfb04e0305f351dff7e","observation_id":"ab3fee38-09ea-4d14-8349-e644b5aee0e6","resolution":{"observed_at":"2026-05-13T14:32:42.077468Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":"1812.05905","doi":"10.48550/arxiv.1812.05905","metadata_source":"pith","pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Soft Actor-Critic Algorithms and Applications","venue":"cs.LG","work_id":"bb49c9fb-03b2-4226-9edb-50186b8193e4","year":2018},"citing_paper":{"arxiv_id":"2605.11375","last_updated":"2026-05-12T00:58:42Z","snapshot_observed_at":"2026-07-06T23:23:11.928199Z","submitted_at":"2026-05-12T00:58:42Z","title":"TuniQ: Autotuning Compilation Passes for Quantum Workloads at Scale for Effectiveness and Efficiency","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-13T02:50:20.040271Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2605.11375"},"observation_digest":"sha256:fb139ef86596e64343b8b7be4ec429b447d74bdf391ba369ed5045829ad5c3a3","observation_id":"7e07ff32-fd7a-4938-90f1-87ac4ebf505a","resolution":{"observed_at":"2026-05-13T14:32:42.077468Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":"1812.05905","doi":"10.48550/arxiv.1812.05905","metadata_source":"pith","pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Soft Actor-Critic Algorithms and Applications","venue":"cs.LG","work_id":"bb49c9fb-03b2-4226-9edb-50186b8193e4","year":2018},"citing_paper":{"arxiv_id":"2605.11665","last_updated":"2026-07-28T11:54:22Z","snapshot_observed_at":"2026-08-02T14:19:47.159631Z","submitted_at":"2026-05-12T07:26:39Z","title":"Nautilus: From One Prompt to Plug-and-Play Robot Learning","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-05-13T01:05:44.188530Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2605.11665"},"observation_digest":"sha256:c82c77f5acbafa593a6e3c673a1313a8b533b77c7564fbf5c3f5f0762c6ada91","observation_id":"90e442bd-16f2-4b8b-8e18-88ce7c9cc47c","resolution":{"observed_at":"2026-05-13T14:32:42.077468Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-02T14:19:55.810377Z","title":": a} # optional: chunk policy -> per-step server policy = ActionChunkBroker( MyPolicy(ckpt), action_horizon=H, ) WebsocketPolicyServer(# serve over ws:// policy=policy, host=","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2605.11665","last_updated":"2026-07-28T11:54:22Z","snapshot_observed_at":"2026-08-02T14:19:47.159631Z","submitted_at":"2026-05-12T07:26:39Z","title":"Nautilus: From One Prompt to Plug-and-Play Robot Learning","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-02T14:19:55.810377Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2605.11665"},"observation_digest":"sha256:371022f2843c52a079ffd316cb998e401d95c0510cb78cdef68357849957c873","observation_id":"c059de7c-b138-4742-8226-202d6bbb6492","resolution":{"observed_at":"2026-08-02T14:19:55.810377Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":"1812.05905","doi":"10.48550/arxiv.1812.05905","metadata_source":"pith","pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Soft Actor-Critic Algorithms and Applications","venue":"cs.LG","work_id":"bb49c9fb-03b2-4226-9edb-50186b8193e4","year":2018},"citing_paper":{"arxiv_id":"2605.11711","last_updated":"2026-05-12T08:02:34Z","snapshot_observed_at":"2026-07-06T23:23:30.499023Z","submitted_at":"2026-05-12T08:02:34Z","title":"Debiased Model-based Representations for Sample-efficient Continuous Control","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-13T07:09:01.132424Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2605.11711"},"observation_digest":"sha256:007d23ba48c4989ffd28e6197d0fce38dfd6eb2d82ea2b58e919a2e0613ef43b","observation_id":"8dbbcbc8-35ec-49d4-ad5d-bdbd6a21e90f","resolution":{"observed_at":"2026-05-13T14:32:42.077468Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":"1812.05905","doi":"10.48550/arxiv.1812.05905","metadata_source":"pith","pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Soft Actor-Critic Algorithms and Applications","venue":"cs.LG","work_id":"bb49c9fb-03b2-4226-9edb-50186b8193e4","year":2018},"citing_paper":{"arxiv_id":"2605.13554","last_updated":"2026-05-13T13:58:49Z","snapshot_observed_at":"2026-08-01T19:52:28.213526Z","submitted_at":"2026-05-13T13:58:49Z","title":"Self-Supervised On-Policy Reinforcement Learning via Contrastive Proximal Policy Optimisation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-14T20:12:07.920183Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2605.13554"},"observation_digest":"sha256:86bc33e332b13bc64c1b522457ccea8a73e2e362f006d5545b8afc78ffd86019","observation_id":"7dbaf19c-c29e-41af-a8bc-c7fbe3ff6ca9","resolution":{"observed_at":"2026-05-14T20:12:55.209929Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":"1812.05905","doi":"10.48550/arxiv.1812.05905","metadata_source":"pith","pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Soft Actor-Critic Algorithms and Applications","venue":"cs.LG","work_id":"bb49c9fb-03b2-4226-9edb-50186b8193e4","year":2018},"citing_paper":{"arxiv_id":"2605.14026","last_updated":"2026-05-13T18:38:32Z","snapshot_observed_at":"2026-08-02T23:59:46.117570Z","submitted_at":"2026-05-13T18:38:32Z","title":"R2R2: Robust Representation for Intensive Experience Reuse via Redundancy Reduction in Self-Predictive Learning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-05-15T05:39:23.297684Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2605.14026"},"observation_digest":"sha256:07d94a84c51cb9cd97ede562abb6c45997f7e6543656839a7945e2d215cd78ac","observation_id":"60af9d34-8a1a-4a3a-b563-8b928eb23b68","resolution":{"observed_at":"2026-05-15T05:39:47.541673Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":"1812.05905","doi":"10.48550/arxiv.1812.05905","metadata_source":"pith","pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Soft Actor-Critic Algorithms and Applications","venue":"cs.LG","work_id":"bb49c9fb-03b2-4226-9edb-50186b8193e4","year":2018},"citing_paper":{"arxiv_id":"2605.14297","last_updated":"2026-05-14T02:59:45Z","snapshot_observed_at":"2026-08-03T16:38:23.916206Z","submitted_at":"2026-05-14T02:59:45Z","title":"Policy Optimization in Hybrid Discrete-Continuous Action Spaces via Mixed Gradients","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-15T02:12:58.603012Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2605.14297"},"observation_digest":"sha256:6ce473962b4fa175a56548750519fa2f4775e40c8d8dd8b60648968c55a6465b","observation_id":"e5f0bbdb-9bdf-46a2-825c-660402716ff9","resolution":{"observed_at":"2026-05-15T02:13:30.162045Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":"1812.05905","doi":"10.48550/arxiv.1812.05905","metadata_source":"pith","pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Soft Actor-Critic Algorithms and Applications","venue":"cs.LG","work_id":"bb49c9fb-03b2-4226-9edb-50186b8193e4","year":2018},"citing_paper":{"arxiv_id":"2605.14350","last_updated":"2026-05-14T04:22:24Z","snapshot_observed_at":"2026-07-06T23:25:49.545418Z","submitted_at":"2026-05-14T04:22:24Z","title":"Distributionally Robust Multi-Task Reinforcement Learning via Adaptive Task Sampling","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-05-15T03:05:36.871497Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2605.14350"},"observation_digest":"sha256:db7400ecada7072b7fa0fc7149272597f6b92223e154d02ca6f330fe02d4251b","observation_id":"9c5eccaa-60df-4a4e-a737-9e2a990171ff","resolution":{"observed_at":"2026-05-15T03:08:59.492498Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":"1812.05905","doi":"10.48550/arxiv.1812.05905","metadata_source":"pith","pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Soft Actor-Critic Algorithms and Applications","venue":"cs.LG","work_id":"bb49c9fb-03b2-4226-9edb-50186b8193e4","year":2018},"citing_paper":{"arxiv_id":"2605.16692","last_updated":"2026-05-19T14:58:07Z","snapshot_observed_at":"2026-07-06T23:27:48.303599Z","submitted_at":"2026-05-15T23:08:02Z","title":"EfficientTDMPC: Improved MPC Objectives for Sample-Efficient Continuous Control","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-20T19:00:09.451593Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2605.16692"},"observation_digest":"sha256:a3d435644a79e49085d61cdb6186fd435cc33cf9f406644a81cac2d49141091c","observation_id":"be7ff438-f973-4d72-b57e-75db7d7bf3c0","resolution":{"observed_at":"2026-05-20T19:03:39.761378Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":"1812.05905","doi":"10.48550/arxiv.1812.05905","metadata_source":"pith","pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Soft Actor-Critic Algorithms and Applications","venue":"cs.LG","work_id":"bb49c9fb-03b2-4226-9edb-50186b8193e4","year":2018},"citing_paper":{"arxiv_id":"2605.18675","last_updated":"2026-05-18T17:15:27Z","snapshot_observed_at":"2026-07-06T23:29:29.105126Z","submitted_at":"2026-05-18T17:15:27Z","title":"COOPO: Cyclic Offline-Online Policy Optimization Algorithm","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-20T13:11:16.568415Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2605.18675"},"observation_digest":"sha256:e9d13c3eb805df15b241d1b2aa4b9ce2b2693737031b19825df98b304ed60aa5","observation_id":"f764aca8-ad6f-40ba-9bc5-752ad0dff51b","resolution":{"observed_at":"2026-05-20T13:13:18.043222Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":"1812.05905","doi":"10.48550/arxiv.1812.05905","metadata_source":"pith","pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Soft Actor-Critic Algorithms and Applications","venue":"cs.LG","work_id":"bb49c9fb-03b2-4226-9edb-50186b8193e4","year":2018},"citing_paper":{"arxiv_id":"2605.19108","last_updated":"2026-05-18T20:50:47Z","snapshot_observed_at":"2026-07-06T23:29:52.061489Z","submitted_at":"2026-05-18T20:50:47Z","title":"Unleashing the Power of Tree-of-Thoughts for Edge-Enabled AIGC Service Provisioning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-20T07:07:44.112674Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2605.19108"},"observation_digest":"sha256:8a60308ac620d74b03a7ec928db7c9b5410ef3b38c699a73d54cd8a3ad108772","observation_id":"68510778-92a3-4b7a-95d0-7640fa2cc6e5","resolution":{"observed_at":"2026-05-20T07:08:06.979925Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":"1812.05905","doi":"10.48550/arxiv.1812.05905","metadata_source":"pith","pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Soft Actor-Critic Algorithms and Applications","venue":"cs.LG","work_id":"bb49c9fb-03b2-4226-9edb-50186b8193e4","year":2018},"citing_paper":{"arxiv_id":"2605.22350","last_updated":"2026-07-21T09:25:57Z","snapshot_observed_at":"2026-08-02T13:30:35.551341Z","submitted_at":"2026-05-21T11:36:16Z","title":"Partial Fusion of Neural Networks: Efficient Tradeoffs Between Ensembles and Weight Aggregation","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-05-22T06:59:09.799156Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2605.22350"},"observation_digest":"sha256:a9024f2bce295112b83024e4a9d7cceb23e7a8566330d5d2fe41948896ff2e71","observation_id":"c1d18125-8e2e-43bd-8c0e-ead9a19d46fc","resolution":{"observed_at":"2026-05-22T07:01:11.761823Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":"1812.05905","doi":"10.48550/arxiv.1812.05905","metadata_source":"pith","pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Soft Actor-Critic Algorithms and Applications","venue":"cs.LG","work_id":"bb49c9fb-03b2-4226-9edb-50186b8193e4","year":2018},"citing_paper":{"arxiv_id":"2605.23415","last_updated":"2026-06-04T07:02:27Z","snapshot_observed_at":"2026-07-06T23:33:39.204744Z","submitted_at":"2026-05-22T09:24:44Z","title":"Reflex: Reinforcement Learning with Reflection Symmetry Exploitation in State-Based Continuous Control","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-25T04:57:20.268613Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2605.23415"},"observation_digest":"sha256:24ceb8da1a551bc526f4bf4ec4c97f85a976e9e281d0910117bebf7a229f3e2b","observation_id":"b0840afa-5357-4aab-939a-6edec6a4c150","resolution":{"observed_at":"2026-05-25T05:00:22.305127Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":"1812.05905","doi":"10.48550/arxiv.1812.05905","metadata_source":"pith","pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Soft Actor-Critic Algorithms and Applications","venue":"cs.LG","work_id":"bb49c9fb-03b2-4226-9edb-50186b8193e4","year":2018},"citing_paper":{"arxiv_id":"2605.23551","last_updated":"2026-05-22T12:17:09Z","snapshot_observed_at":"2026-07-06T23:33:44.335185Z","submitted_at":"2026-05-22T12:17:09Z","title":"Goal-Conditioned Agents that Learn Everything All at Once","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-05-25T04:59:48.867927Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2605.23551"},"observation_digest":"sha256:674f6b8ebccca303d974a31793c0cbbce361583690dffbf863e8584fffcbbd80","observation_id":"eacdfee5-c726-48e8-9c5e-b414eb30ab37","resolution":{"observed_at":"2026-05-25T05:00:21.526534Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":"1812.05905","doi":"10.48550/arxiv.1812.05905","metadata_source":"pith","pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Soft Actor-Critic Algorithms and Applications","venue":"cs.LG","work_id":"bb49c9fb-03b2-4226-9edb-50186b8193e4","year":2018},"citing_paper":{"arxiv_id":"2605.23565","last_updated":"2026-05-22T12:31:18Z","snapshot_observed_at":"2026-07-06T23:33:44.335185Z","submitted_at":"2026-05-22T12:31:18Z","title":"Understanding Goal Generalisation in Sequential Reinforcement Learning","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-25T04:49:50.034743Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2605.23565"},"observation_digest":"sha256:60abb7e0ecbc20d98145ffaeff3f6a9908c47908878deab5ed8c09add069ed7e","observation_id":"a7e7025e-882f-41bf-8b02-e1785d540b8e","resolution":{"observed_at":"2026-05-25T04:50:20.678853Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":"1812.05905","doi":"10.48550/arxiv.1812.05905","metadata_source":"pith","pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Soft Actor-Critic Algorithms and Applications","venue":"cs.LG","work_id":"bb49c9fb-03b2-4226-9edb-50186b8193e4","year":2018},"citing_paper":{"arxiv_id":"2605.24585","last_updated":"2026-05-23T13:55:09Z","snapshot_observed_at":"2026-07-06T23:34:38.098785Z","submitted_at":"2026-05-23T13:55:09Z","title":"Word Class Representations Spontaneously Emerge from Successor Representations Trained on Natural Language","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-30T13:46:16.645506Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2605.24585"},"observation_digest":"sha256:ffd88a5cba8b4f14ed2b070a58a067be251c3310b7465d5ec5dc9451e4940278","observation_id":"346445e5-14e9-4adf-812b-2e032678a10c","resolution":{"observed_at":"2026-06-30T13:54:44.099998Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":"1812.05905","doi":"10.48550/arxiv.1812.05905","metadata_source":"pith","pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Soft Actor-Critic Algorithms and Applications","venue":"cs.LG","work_id":"bb49c9fb-03b2-4226-9edb-50186b8193e4","year":2018},"citing_paper":{"arxiv_id":"2605.24975","last_updated":"2026-05-24T10:04:11Z","snapshot_observed_at":"2026-07-06T23:34:57.148983Z","submitted_at":"2026-05-24T10:04:11Z","title":"Bridging the Gap: Enabling Soft Actor Critic for High Performance Legged Locomotion","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-30T00:54:12.099045Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2605.24975"},"observation_digest":"sha256:ef800f836188ad56143dae642fcb46c9e609cd8d6b3c90ef225f2784c4f95f81","observation_id":"a6b07761-01a5-4046-a14f-e24972cf40f7","resolution":{"observed_at":"2026-07-01T16:05:49.704942Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":"1812.05905","doi":"10.48550/arxiv.1812.05905","metadata_source":"pith","pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Soft Actor-Critic Algorithms and Applications","venue":"cs.LG","work_id":"bb49c9fb-03b2-4226-9edb-50186b8193e4","year":2018},"citing_paper":{"arxiv_id":"2605.25029","last_updated":"2026-05-26T07:39:20Z","snapshot_observed_at":"2026-08-02T03:12:06.012812Z","submitted_at":"2026-05-24T12:09:53Z","title":"ParkingWorld: End-to-End Autonomous Parking Reinforcement Learning from Corrective Experience in 3DGS Simulation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-30T00:26:22.777878Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2605.25029"},"observation_digest":"sha256:5df55b6ad06c0d3ea48a34fd92ed3a8ffa58592cd29e93b529855915ea62a934","observation_id":"a3802ecb-525b-4e2a-b5d7-ad2cb187694e","resolution":{"observed_at":"2026-07-01T16:35:50.717714Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":"1812.05905","doi":"10.48550/arxiv.1812.05905","metadata_source":"pith","pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Soft Actor-Critic Algorithms and Applications","venue":"cs.LG","work_id":"bb49c9fb-03b2-4226-9edb-50186b8193e4","year":2018},"citing_paper":{"arxiv_id":"2605.25477","last_updated":"2026-05-25T06:31:03Z","snapshot_observed_at":"2026-07-06T23:35:26.687529Z","submitted_at":"2026-05-25T06:31:03Z","title":"EXPO-FT: Sample-Efficient Reinforcement Learning Finetuning for Vision-Language-Action Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-29T22:10:08.682307Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2605.25477"},"observation_digest":"sha256:cfec2640029faa115bf818fb1bf430d5291df9415fd7f5ead1289e4fa0aaa60c","observation_id":"d809ab9a-ecb5-4227-8481-a457ed53e326","resolution":{"observed_at":"2026-06-29T22:13:59.948067Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":"1812.05905","doi":"10.48550/arxiv.1812.05905","metadata_source":"pith","pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Soft Actor-Critic Algorithms and Applications","venue":"cs.LG","work_id":"bb49c9fb-03b2-4226-9edb-50186b8193e4","year":2018},"citing_paper":{"arxiv_id":"2605.26282","last_updated":"2026-05-25T19:06:51Z","snapshot_observed_at":"2026-08-02T12:16:30.744884Z","submitted_at":"2026-05-25T19:06:51Z","title":"Scaling World-Model Reinforcement Learning Through Diffusion Policy Optimization","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-06-29T22:46:27.179341Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2605.26282"},"observation_digest":"sha256:f5172382a5383f3ba95fcbca4988e59d3cc8f5af4226f1e7a6255667542cf18c","observation_id":"1af66703-cc0f-47dd-b29e-8b324fe69872","resolution":{"observed_at":"2026-06-29T22:54:01.334824Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":"1812.05905","doi":"10.48550/arxiv.1812.05905","metadata_source":"pith","pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Soft Actor-Critic Algorithms and Applications","venue":"cs.LG","work_id":"bb49c9fb-03b2-4226-9edb-50186b8193e4","year":2018},"citing_paper":{"arxiv_id":"2605.26471","last_updated":"2026-05-26T02:28:36Z","snapshot_observed_at":"2026-08-03T13:18:44.656364Z","submitted_at":"2026-05-26T02:28:36Z","title":"Heterogeneous AAV Logistics Task Allocation: A Reinforcement Learning Enhanced Overlapping Coalition Formation Game Approach","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-29T17:38:35.614870Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2605.26471"},"observation_digest":"sha256:3a85c30c0cca65e072a92537eb7fe15b3dc45d5d7c49ac3f4bbd007c217c719c","observation_id":"2f4f78f1-c0fa-4fbf-8729-9d23ad3aec25","resolution":{"observed_at":"2026-06-29T17:43:45.091597Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":"1812.05905","doi":"10.48550/arxiv.1812.05905","metadata_source":"pith","pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Soft Actor-Critic Algorithms and Applications","venue":"cs.LG","work_id":"bb49c9fb-03b2-4226-9edb-50186b8193e4","year":2018},"citing_paper":{"arxiv_id":"2605.26478","last_updated":"2026-05-26T02:35:08Z","snapshot_observed_at":"2026-08-02T15:14:06.593016Z","submitted_at":"2026-05-26T02:35:08Z","title":"Efficient On-policy Visual-RL via Stochastic Decoupled Policy Gradient","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-06-29T17:34:41.053725Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2605.26478"},"observation_digest":"sha256:20f7f156eb78a81e194eab89786d09166c179ee558726e77005e40dcacff7286","observation_id":"f7fa21a0-6846-4e33-b6cc-81b67887081e","resolution":{"observed_at":"2026-06-29T18:03:48.614373Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":"1812.05905","doi":"10.48550/arxiv.1812.05905","metadata_source":"pith","pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Soft Actor-Critic Algorithms and Applications","venue":"cs.LG","work_id":"bb49c9fb-03b2-4226-9edb-50186b8193e4","year":2018},"citing_paper":{"arxiv_id":"2605.26925","last_updated":"2026-05-26T12:20:55Z","snapshot_observed_at":"2026-07-06T23:36:43.912215Z","submitted_at":"2026-05-26T12:20:55Z","title":"Adaptive Reinforcement Learning for Robust Open Quantum System Control: A Multi-Task Framework with Temporal Optimization","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-29T17:01:28.972549Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2605.26925"},"observation_digest":"sha256:f613055547509ca64347790597ae6bcabc725908c797d9ad80c8490c73f2f3fd","observation_id":"75d29eb4-16df-438c-b73d-d77b161a34f6","resolution":{"observed_at":"2026-06-29T17:03:40.725954Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":"1812.05905","doi":"10.48550/arxiv.1812.05905","metadata_source":"pith","pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Soft Actor-Critic Algorithms and Applications","venue":"cs.LG","work_id":"bb49c9fb-03b2-4226-9edb-50186b8193e4","year":2018},"citing_paper":{"arxiv_id":"2605.30612","last_updated":"2026-07-08T22:55:05Z","snapshot_observed_at":"2026-07-31T22:46:33.047309Z","submitted_at":"2026-05-28T22:05:08Z","title":"ZAPS-DA: Zero-Phase Action Policy Smoothing with Decoupled Actor for Continuous Control in Reinforcement Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-29T06:37:52.331084Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2605.30612"},"observation_digest":"sha256:303bea983a005da71b3eb34a02649ea7c4c4b72ff983cf5d9e80d461f95f0188","observation_id":"9642b65c-f81c-4540-b7d6-0277269d4224","resolution":{"observed_at":"2026-06-29T14:33:31.068975Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-07-12T15:37:48.987092Z","title":"Haarnoja, A","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2605.30612","last_updated":"2026-07-08T22:55:05Z","snapshot_observed_at":"2026-07-31T22:46:33.047309Z","submitted_at":"2026-05-28T22:05:08Z","title":"ZAPS-DA: Zero-Phase Action Policy Smoothing with Decoupled Actor for Continuous Control in Reinforcement Learning","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-07-12T15:37:48.987092Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2605.30612"},"observation_digest":"sha256:cd11eefb2264c459e41a9d9602f8aa4fb8dd65c4bdc4b548c97fa933bee2c41f","observation_id":"5add10f4-062f-4cc2-a46e-fcc1e5c470c2","resolution":{"observed_at":"2026-07-12T15:37:48.987092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":"1812.05905","doi":"10.48550/arxiv.1812.05905","metadata_source":"pith","pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Soft Actor-Critic Algorithms and Applications","venue":"cs.LG","work_id":"bb49c9fb-03b2-4226-9edb-50186b8193e4","year":2018},"citing_paper":{"arxiv_id":"2606.07349","last_updated":"2026-06-05T14:59:22Z","snapshot_observed_at":"2026-07-06T23:47:00.425715Z","submitted_at":"2026-06-05T14:59:22Z","title":"Direct High-Magnetic-Field Coupling to Stripe Order in a Cuprate Superconductor","version":1},"reference_index":137,"source":"arxiv_source","source_observed_at":"2026-06-27T20:31:38.157391Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2606.07349"},"observation_digest":"sha256:fc0018ef93b41a3c80f785e7d7b9c30fe6e8f9940a61b49853be5472a73d0261","observation_id":"908e6a21-0cb5-4c9d-93c0-24de49ec733a","resolution":{"observed_at":"2026-06-27T20:41:15.192580Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":"1812.05905","doi":"10.48550/arxiv.1812.05905","metadata_source":"pith","pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Soft Actor-Critic Algorithms and Applications","venue":"cs.LG","work_id":"bb49c9fb-03b2-4226-9edb-50186b8193e4","year":2018},"citing_paper":{"arxiv_id":"2606.11797","last_updated":"2026-06-10T08:30:04Z","snapshot_observed_at":"2026-08-05T07:10:14.168524Z","submitted_at":"2026-06-10T08:30:04Z","title":"Space-sampled Value Decay: Forgetting Mechanisms for Non-stationary Deep Reinforcement Learning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-06-27T10:56:31.877119Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2606.11797"},"observation_digest":"sha256:0ac7055e2ea535a998a7029c380577f72849bc6f876e8d4f34f9633c704225ad","observation_id":"852670b4-f74e-4d17-bb46-63804936b03f","resolution":{"observed_at":"2026-07-03T08:17:45.106659Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":"1812.05905","doi":"10.48550/arxiv.1812.05905","metadata_source":"pith","pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Soft Actor-Critic Algorithms and Applications","venue":"cs.LG","work_id":"bb49c9fb-03b2-4226-9edb-50186b8193e4","year":2018},"citing_paper":{"arxiv_id":"2606.12078","last_updated":"2026-06-10T13:43:19Z","snapshot_observed_at":"2026-07-30T00:29:04.678847Z","submitted_at":"2026-06-10T13:43:19Z","title":"Deep Reinforcement Learning for Adaptive Power Allocation in ISAC Systems with Mobile Target","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-27T08:45:09.342362Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2606.12078"},"observation_digest":"sha256:0eb0504cb8ac9b41530f4c4abd9ff6a24cbebab4af7d033a633d6e31458f416d","observation_id":"709adedb-9564-40d2-9354-47072441e2ad","resolution":{"observed_at":"2026-07-03T12:48:11.807231Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":"1812.05905","doi":"10.48550/arxiv.1812.05905","metadata_source":"pith","pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Soft Actor-Critic Algorithms and Applications","venue":"cs.LG","work_id":"bb49c9fb-03b2-4226-9edb-50186b8193e4","year":2018},"citing_paper":{"arxiv_id":"2606.17900","last_updated":"2026-06-16T13:26:51Z","snapshot_observed_at":"2026-08-03T15:02:44.269913Z","submitted_at":"2026-06-16T13:26:51Z","title":"Time-Slotted Multi-Cluster UAV AirComp with Energy-Awareness: A Pointer Network-Assisted Soft Actor-Critic Learning Framework","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-26T22:59:54.788705Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2606.17900"},"observation_digest":"sha256:411439c6a8776a84f39fe1bb2b73cb52ab0e6d340ca5913fa59bcce84b171dec","observation_id":"96c91ba2-5833-4094-aa8d-80ab9e5d1b00","resolution":{"observed_at":"2026-07-03T23:09:01.091259Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":"1812.05905","doi":"10.48550/arxiv.1812.05905","metadata_source":"pith","pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Soft Actor-Critic Algorithms and Applications","venue":"cs.LG","work_id":"bb49c9fb-03b2-4226-9edb-50186b8193e4","year":2018},"citing_paper":{"arxiv_id":"2606.20210","last_updated":"2026-06-18T13:23:19Z","snapshot_observed_at":"2026-08-04T19:51:23.601002Z","submitted_at":"2026-06-18T13:23:19Z","title":"Augmenting Game AI with Deep Reinforcement Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-26T17:28:00.929990Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2606.20210"},"observation_digest":"sha256:5786d02f857698d027801de9c35a412884bad1d1518be4a8f1934b5727b16081","observation_id":"199b1bbe-590a-4160-abb5-1ba3ecfa0379","resolution":{"observed_at":"2026-07-04T03:59:33.025466Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":"1812.05905","doi":"10.48550/arxiv.1812.05905","metadata_source":"pith","pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Soft Actor-Critic Algorithms and Applications","venue":"cs.LG","work_id":"bb49c9fb-03b2-4226-9edb-50186b8193e4","year":2018},"citing_paper":{"arxiv_id":"2606.20832","last_updated":"2026-06-18T18:19:32Z","snapshot_observed_at":"2026-07-06T23:55:57.945000Z","submitted_at":"2026-06-18T18:19:32Z","title":"ReLaTS: a Reinforcement Learning-based method for dynamically determining the coupling Time Step in multi-scale simulations of self-gravitating systems","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-06-26T15:17:55.188215Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2606.20832"},"observation_digest":"sha256:4694b6f314c3c135dc426dfa90b6172beb46ae00c580587b40431eb0666d6ef6","observation_id":"631f69be-bbcb-42b8-8a4f-ffa630c6ebc2","resolution":{"observed_at":"2026-07-04T05:49:38.233933Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":"1812.05905","doi":"10.48550/arxiv.1812.05905","metadata_source":"pith","pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Soft Actor-Critic Algorithms and Applications","venue":"cs.LG","work_id":"bb49c9fb-03b2-4226-9edb-50186b8193e4","year":2018},"citing_paper":{"arxiv_id":"2606.21271","last_updated":"2026-06-19T09:47:38Z","snapshot_observed_at":"2026-07-06T23:56:17.293417Z","submitted_at":"2026-06-19T09:47:38Z","title":"Reward-free Pretraining for Reinforcement Learning via Occupancy Coverage Maximization","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-26T14:48:19.683101Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2606.21271"},"observation_digest":"sha256:f67c51fe53fc44b72e4d6f8b489b9fe2f592c434df365196ddd3da49a9ddfb99","observation_id":"8fd919cc-c036-4be4-8388-ec4d777416f7","resolution":{"observed_at":"2026-07-04T06:09:37.590741Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/1812.05905/citation-record","integrity":"/paper/1812.05905/integrity","json":"/paper/1812.05905/citation-record.json","paper":"/paper/1812.05905"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1806.06920","last_updated":"2018-06-14T12:46:23Z","snapshot_observed_at":"2026-07-06T06:45:27.162265Z","submitted_at":"2018-06-14T12:46:23Z","title":"Maximum a Posteriori Policy Optimisation","version":1},"cited_work":{"arxiv_id":"1806.06920","doi":null,"metadata_source":"pith","pith_arxiv_id":"1806.06920","snapshot_observed_at":"2026-06-30T23:45:08.145951Z","title":"Maximum a Posteriori Policy Optimisation","venue":"cs.LG","work_id":"cb0e49f6-4417-4c5e-b4a8-567d7e9e76a7","year":2018},"citing_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-13T14:32:41.948156Z"},"links":{"cited_paper":"/paper/1806.06920","citing_paper":"/paper/1812.05905"},"observation_digest":"sha256:c807f0582382f8688c24d6dbfb40f93d40c5a1ad2b45a88f0002e096c2fd7ee7","observation_id":"120c6f10-402a-451f-a694-cd7837bfd158","resolution":{"observed_at":"2026-05-13T14:32:41.989748Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.01540","last_updated":"2016-06-05T17:54:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-06-05T17:54:48Z","title":"OpenAI Gym","version":1},"cited_work":{"arxiv_id":"1606.01540","doi":"10.1109/jssc.2019","metadata_source":"pith","pith_arxiv_id":"1606.01540","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"OpenAI Gym","venue":"cs.LG","work_id":"6af98f3f-f074-41ae-a689-7dd7b4b8efde","year":2016},"citing_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-13T14:32:41.948156Z"},"links":{"cited_paper":"/paper/1606.01540","citing_paper":"/paper/1812.05905"},"observation_digest":"sha256:a2c02d9bfab35547470d6e630a822ab10f27f0f6cd4c8a87918a98bf447ff6fa","observation_id":"db963ab7-95cf-4745-a90f-af682c73a1b5","resolution":{"observed_at":"2026-05-13T14:32:42.037081Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1802.09477","last_updated":"2018-10-22T17:37:07Z","snapshot_observed_at":"2026-07-06T06:25:26.844090Z","submitted_at":"2018-02-26T17:54:49Z","title":"Addressing Function Approximation Error in Actor-Critic Methods","version":3},"cited_work":{"arxiv_id":"1802.09477","doi":"10.48550/arxiv.1802.09477","metadata_source":"pith","pith_arxiv_id":"1802.09477","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Addressing Function Approximation Error in Actor-Critic Methods","venue":"cs.AI","work_id":"129bee39-1830-4ff5-a7c3-f8ecae60f370","year":2018},"citing_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-13T14:32:41.948156Z"},"links":{"cited_paper":"/paper/1802.09477","citing_paper":"/paper/1812.05905"},"observation_digest":"sha256:97ce3f8cdcb1f94ce248d8baad842f86c6d4b65e2f722f200a85e34ec6c887f8","observation_id":"3c434479-d9c5-428f-8cd0-956793b96077","resolution":{"observed_at":"2026-05-13T14:32:42.002405Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1704.04651","last_updated":"2018-06-19T15:32:15Z","snapshot_observed_at":"2026-07-06T05:37:59.050725Z","submitted_at":"2017-04-15T15:38:23Z","title":"The Reactor: A fast and sample-efficient Actor-Critic agent for Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"1704.04651","doi":null,"metadata_source":"pith","pith_arxiv_id":"1704.04651","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The Reactor: A fast and sample-efficient Actor-Critic agent for Reinforcement Learning","venue":"cs.AI","work_id":"2b8d4fd3-3479-478a-bc44-f6d493e0616c","year":2017},"citing_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-13T14:32:41.948156Z"},"links":{"cited_paper":"/paper/1704.04651","citing_paper":"/paper/1812.05905"},"observation_digest":"sha256:a1a3225c8d64101b60d4ab892f97812cacb5a5a21f61d2f0fa6e8a89f53ead28","observation_id":"6214e5e7-2d98-4b8c-a768-3ca46054c422","resolution":{"observed_at":"2026-05-13T14:32:42.013123Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1611.02247","last_updated":"2017-02-27T21:48:25Z","snapshot_observed_at":"2026-08-05T02:32:37.025915Z","submitted_at":"2016-11-07T20:09:16Z","title":"Q-Prop: Sample-Efficient Policy Gradient with An Off-Policy Critic","version":3},"cited_work":{"arxiv_id":"1611.02247","doi":null,"metadata_source":"pith","pith_arxiv_id":"1611.02247","snapshot_observed_at":"2026-07-03T09:57:56.229006Z","title":"Q-Prop: Sample-Efficient Policy Gradient with An Off-Policy Critic","venue":"cs.LG","work_id":"3570547f-d4c5-4808-a945-f27a73bb7d90","year":2016},"citing_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-13T14:32:41.948156Z"},"links":{"cited_paper":"/paper/1611.02247","citing_paper":"/paper/1812.05905"},"observation_digest":"sha256:89c5e78c2cf0cc46e0235496ae7770de8591987c97c18e5d93da4f40b87bee3a","observation_id":"9a3daa3f-8c80-4580-aaf7-70243aa818dc","resolution":{"observed_at":"2026-05-13T14:32:42.020468Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1709.06560","last_updated":"2019-01-30T04:21:41Z","snapshot_observed_at":"2026-07-06T06:00:20.967053Z","submitted_at":"2017-09-19T06:09:47Z","title":"Deep Reinforcement Learning that Matters","version":3},"cited_work":{"arxiv_id":"1709.06560","doi":"10.48550/arxiv.1709.06560","metadata_source":"pith","pith_arxiv_id":"1709.06560","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Deep Reinforcement Learning that Matters","venue":"cs.LG","work_id":"aaf8cbbc-43f9-41cb-be22-4ed140b3a2dd","year":2017},"citing_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-13T14:32:41.948156Z"},"links":{"cited_paper":"/paper/1709.06560","citing_paper":"/paper/1812.05905"},"observation_digest":"sha256:5e8816548d7bc3690a5bb70368701ad251de2f2986fd81523adcea60a2568e67","observation_id":"4d1bfb09-22c5-4c4d-9d21-488274632bc0","resolution":{"observed_at":"2026-05-13T14:32:42.027745Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"41f0e63e-40db-48f7-970a-5d71183214ed","year":2005},"citing_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-13T14:32:41.948156Z"},"links":{"citing_paper":"/paper/1812.05905"},"observation_digest":"sha256:43929f86b2b04195245aae6f24932ff3a2e03efbb5c2dd68e38a7618ab1d750c","observation_id":"c649c500-bee0-4e4b-b875-47f8f39a874f","resolution":{"observed_at":"2026-05-13T14:32:42.076074Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1509.02971","last_updated":"2019-07-05T10:47:27Z","snapshot_observed_at":"2026-07-06T04:29:24.362640Z","submitted_at":"2015-09-09T23:01:36Z","title":"Continuous control with deep reinforcement learning","version":6},"cited_work":{"arxiv_id":"1509.02971","doi":"10.1137/22m1480409","metadata_source":"pith","pith_arxiv_id":"1509.02971","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Continuous control with deep reinforcement learning","venue":"cs.LG","work_id":"41a65444-c819-4303-a1f1-b075aa86d40c","year":2015},"citing_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-13T14:32:41.948156Z"},"links":{"cited_paper":"/paper/1509.02971","citing_paper":"/paper/1812.05905"},"observation_digest":"sha256:cb3625387e6aaeb59eccf63e4e763235d9abda9ead963f5574068cb3067d8256","observation_id":"6b3b9993-beef-4bd2-8bc5-0ae548031259","resolution":{"observed_at":"2026-05-13T14:32:42.043067Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1312.5602","last_updated":"2013-12-19T16:00:08Z","snapshot_observed_at":"2026-07-06T03:31:23.521122Z","submitted_at":"2013-12-19T16:00:08Z","title":"Playing Atari with Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1312.5602","doi":"10.48550/arxiv.1312.5602","metadata_source":"pith","pith_arxiv_id":"1312.5602","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Playing Atari with Deep Reinforcement Learning","venue":"cs.LG","work_id":"736a8ddf-e365-4940-ad58-4699fddedb86","year":2013},"citing_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-13T14:32:41.948156Z"},"links":{"cited_paper":"/paper/1312.5602","citing_paper":"/paper/1812.05905"},"observation_digest":"sha256:4d38d71798bf9afce8bfc45429fc14533e35a0d48f905235cd810e2ac6e13c8b","observation_id":"a60cd17a-8fb2-439a-a9cb-89331ef8be1b","resolution":{"observed_at":"2026-05-13T14:32:42.050839Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.01891","last_updated":"2018-02-22T21:28:57Z","snapshot_observed_at":"2026-07-06T05:50:03.544515Z","submitted_at":"2017-07-06T17:50:19Z","title":"Trust-PCL: An Off-Policy Trust Region Method for Continuous Control","version":3},"cited_work":{"arxiv_id":"1707.01891","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1707.01891","snapshot_observed_at":"2026-07-04T22:34:15.110658Z","title":"Trust-pcl: An oﬀ-policy trust region method for continuous control.arXiv preprint arXiv:1707.01891","venue":null,"work_id":"5cb596c4-ef5a-4966-a45b-586f7412ad6d","year":2017},"citing_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-13T14:32:41.948156Z"},"links":{"cited_paper":"/paper/1707.01891","citing_paper":"/paper/1812.05905"},"observation_digest":"sha256:b8632ee167bf8c5a0a1f79fcc9bb0922f7a9a849538746c7685284ca71d82a43","observation_id":"e9513ef5-76ce-46d4-aa1f-fe42ab84d8da","resolution":{"observed_at":"2026-07-04T22:34:15.110658Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1704.06440","last_updated":"2018-10-14T22:54:38Z","snapshot_observed_at":"2026-08-05T07:10:19.910840Z","submitted_at":"2017-04-21T08:33:59Z","title":"Equivalence Between Policy Gradients and Soft Q-Learning","version":4},"cited_work":{"arxiv_id":"1704.06440","doi":"10.48550/arxiv.1704.06440.url:https://arxiv.org/abs/1704.06440","metadata_source":"pith","pith_arxiv_id":"1704.06440","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Equivalence Between Policy Gradients and Soft Q-Learning","venue":"cs.LG","work_id":"4ce87d9d-fea7-4dba-b8e0-412ce7c0417f","year":2017},"citing_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-13T14:32:41.948156Z"},"links":{"cited_paper":"/paper/1704.06440","citing_paper":"/paper/1812.05905"},"observation_digest":"sha256:282bfeade74d8cd2cef78db49d14c860df807f67a5847ca46201d23db907e97c","observation_id":"ed83ccbc-3954-48cc-bde3-f1919af2aca1","resolution":{"observed_at":"2026-05-13T14:32:42.065863Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.06045","last_updated":"2018-10-14T15:26:24Z","snapshot_observed_at":"2026-07-06T07:07:58.413172Z","submitted_at":"2018-10-14T15:26:24Z","title":"Dexterous Manipulation with Deep Reinforcement Learning: Efficient, General, and Low-Cost","version":1},"cited_work":{"arxiv_id":"1810.06045","doi":null,"metadata_source":"pith","pith_arxiv_id":"1810.06045","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dexterous Manipulation with Deep Reinforcement Learning: Efficient, General, and Low-Cost","venue":"cs.AI","work_id":"b32dcbf0-18a7-40a7-a59a-f6dcc6f2c12a","year":2018},"citing_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-13T14:32:41.948156Z"},"links":{"cited_paper":"/paper/1810.06045","citing_paper":"/paper/1812.05905"},"observation_digest":"sha256:6c771916b043ca3928a1b9e8ed1d1d6c09bf886bd734f2bb35f163343cc723f9","observation_id":"c4c0db9e-1043-4521-a4a0-8772abbadb48","resolution":{"observed_at":"2026-05-13T14:32:41.977302Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In that sense, discounted policy gradients typically do not optimize the true discounted objective","venue":null,"work_id":"21f48f40-ddb4-4378-9bf6-60927cccfb22","year":2014},"citing_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-13T14:32:41.948156Z"},"links":{"citing_paper":"/paper/1812.05905"},"observation_digest":"sha256:7fe95b584b54f469e6d99570e040b4cf85040f821a041b9236ae1cc5e6b8600c","observation_id":"37a23961-452a-4e81-8400-e5b869491c7f","resolution":{"observed_at":"2026-05-13T14:32:42.070812Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications"},"reference_resolution":{"displayed":13,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":1,"verified_exact":10,"verified_fuzzy":1},"total_outbound_references":13},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 13 of 13 outbound references and 100 inbound Pith citation observations for arXiv:1812.05905."}