{"as_of":"2026-08-08T19:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9699ae16d609bdafa611ad0f8b2417f13d9a3c602225e58c7947ec9e29ab260c","coverage":[{"denominator":108,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T21:36:33.708676Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2502.09417/citation-record","integrity":"/paper/2502.09417/integrity","json":"/paper/2502.09417/citation-record.json","paper":"/paper/2502.09417"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:33.190447Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-07T21:32:46.428389Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.190447Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:0d42527b67001b756fbd9b702a4926809e853845ba4fcc6c8a33e569f44b4a0a","observation_id":"e1228a0a-e975-45b3-960b-cd68601ca37f","resolution":{"observed_at":"2026-08-07T21:36:33.190447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:33.196234Z","title":"Human-level control through deep reinforcement learning,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-07T21:32:46.428389Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.196234Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:2cbe9f73d166205f2a1dbb4804a83c5c3aa0a369e251592a6d576da0856f31ab","observation_id":"49bbd95e-d178-4c57-b174-75b2ce8d4323","resolution":{"observed_at":"2026-08-07T21:36:33.196234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:33.201565Z","title":"Deep reinforcement learning in smart manufacturing: A review and prospects,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-07T21:32:46.428389Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.201565Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:93ec3ade2ee97471764934f2c713156b8f4fd8fa7e5acfdaf4625800b2f3e31f","observation_id":"17c45300-98f1-4106-ab17-45ef09da20fb","resolution":{"observed_at":"2026-08-07T21:36:33.201565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:33.207234Z","title":"Applications of reinforcement learning in energy systems,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-07T21:32:46.428389Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.207234Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:4547f3437972fd743a4b699aeb724bfadccb372a697aeb2db3142e03f6d5a576","observation_id":"02c5188b-dbf8-4d96-83f4-55d8b8b03173","resolution":{"observed_at":"2026-08-07T21:36:33.207234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:33.212197Z","title":"Reinforcement learning in robotics: A survey,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-07T21:32:46.428389Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.212197Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:238595f6f07fb53f38a340174657976367c46d7a2231d7bb3c819f49d7de354b","observation_id":"1ed9865d-c7da-4b76-89e6-ed0b164afe0d","resolution":{"observed_at":"2026-08-07T21:36:33.212197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:33.217564Z","title":"Reinforcement learning applied to production planning and control,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-07T21:32:46.428389Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.217564Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:584677feeb92a4a27d30afc6d69d5ece89fc9851105df6473c718def2177f884","observation_id":"be8b5044-338f-4630-9e31-11e3c918caf5","resolution":{"observed_at":"2026-08-07T21:36:33.217564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:33.223245Z","title":"A review on reinforcement learning: Introduction and applications in industrial process control,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-07T21:32:46.428389Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.223245Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:fe2d22689f799f04749364c7822eee319f9a2e2205ef9b31447aa8599911befb","observation_id":"4f3c26f1-ea9a-4db5-94b2-03e80f7a6e12","resolution":{"observed_at":"2026-08-07T21:36:33.223245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:33.228590Z","title":"Deep reinforcement learning for inventory control: A roadmap,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-07T21:32:46.428389Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.228590Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:d2b0e61bbb9a3ad0e0344dcd96193ca90f62e0c213fec3137c5a01bd52764727","observation_id":"77ac5118-00f6-4e3a-bb4f-7f65f900aa6f","resolution":{"observed_at":"2026-08-07T21:36:33.228590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:33.233323Z","title":"Metaheuristics in combinatorial optimization: Overview and conceptual comparison,","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-07T21:32:46.428389Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.233323Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:5310b3872bfb1501bd69790ecff6b57341273dbb1275b65413ec5d9c02ce35f7","observation_id":"98f87576-114b-4095-b2d5-197db06aa285","resolution":{"observed_at":"2026-08-07T21:36:33.233323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1701.07274","last_updated":"2018-11-26T04:56:31Z","snapshot_observed_at":"2026-07-06T05:27:30.168672Z","submitted_at":"2017-01-25T11:52:11Z","title":"Deep Reinforcement Learning: An Overview","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1701.07274","snapshot_observed_at":"2026-08-07T21:36:33.238458Z","title":"Deep reinforcement learning: An overview,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-07T21:32:46.428389Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.238458Z"},"links":{"cited_paper":"/paper/1701.07274","citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:2a063324a260d886e770957f4cdb3f953297b72806ed43b4642b6a8eaf7b642c","observation_id":"07806f6f-635b-41ba-b86c-0454111b9039","resolution":{"observed_at":"2026-08-07T21:36:33.238458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:33.243952Z","title":"Deep reinforcement learning: A brief survey,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-07T21:32:46.428389Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.243952Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:a3eef77d4433aa4e14d3dc2f28297fdf1c37640d253d13c110e2c4d19ab7fc83","observation_id":"c2c0afd4-2d13-4cd1-a148-bdb8649ddbd8","resolution":{"observed_at":"2026-08-07T21:36:33.243952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:33.249382Z","title":"A deep reinforcement learning approach for chemical production scheduling,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-07T21:32:46.428389Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.249382Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:25b34b3dbd397b6a0cb1bf6d20052b8de60c0097d3c823e269cb2e101521b202","observation_id":"1f4390e4-f241-46f6-bf72-c8dc936162ed","resolution":{"observed_at":"2026-08-07T21:36:33.249382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:33.254402Z","title":"Intelligent scheduling of discrete automated production line via deep reinforcement learning,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-07T21:32:46.428389Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.254402Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:27ea4c351037c7810186d64ab079991d0198d60222233d2abc8020b3eff6f00f","observation_id":"092bbfb2-5b62-4176-9742-e3faa75bcac5","resolution":{"observed_at":"2026-08-07T21:36:33.254402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:33.259514Z","title":"A reinforcement learning method to scheduling problem of steel production process,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-07T21:32:46.428389Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.259514Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:8f393052fa065ca9b430610b6d79a0e73e76afa3b000446043122104f0b9014b","observation_id":"8f581a0b-572f-41da-aa4c-22dbd3f697de","resolution":{"observed_at":"2026-08-07T21:36:33.259514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.00636","last_updated":"2022-03-09T21:16:42Z","snapshot_observed_at":"2026-07-06T12:42:59.343294Z","submitted_at":"2022-03-01T17:25:40Z","title":"Distributional Reinforcement Learning for Scheduling of Chemical Production Processes","version":2},"cited_work":{"arxiv_id":"2203.00636","doi":null,"metadata_source":"pith","pith_arxiv_id":"2203.00636","snapshot_observed_at":"2026-08-07T21:36:34.145440Z","title":"Distributional Reinforcement Learning for Scheduling of Chemical Production Processes","venue":"eess.SY","work_id":"5f4659ae-612d-464a-893d-4f635ef44d03","year":2022},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-07T21:32:46.428389Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.264933Z"},"links":{"cited_paper":"/paper/2203.00636","citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:4643d0f35ead4987c64ff2fda66217d16c0e0ad55b1e7f73e4b2f5535e5e577c","observation_id":"e85d2636-7391-4951-88ac-b4fe01ec0ec8","resolution":{"observed_at":"2026-08-07T21:36:34.150530Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04037","last_updated":"2020-06-07T04:02:59Z","snapshot_observed_at":"2026-07-06T09:26:41.108280Z","submitted_at":"2020-06-07T04:02:59Z","title":"Reinforcement Learning for Multi-Product Multi-Node Inventory Management in Supply Chains","version":1},"cited_work":{"arxiv_id":"2006.04037","doi":null,"metadata_source":"pith","pith_arxiv_id":"2006.04037","snapshot_observed_at":"2026-08-07T21:36:34.123449Z","title":"Reinforcement Learning for Multi-Product Multi-Node Inventory Management in Supply Chains","venue":"cs.LG","work_id":"1d8b4090-27dd-41af-b2b2-4f3bb35113ce","year":2020},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-07T21:32:46.428389Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.270606Z"},"links":{"cited_paper":"/paper/2006.04037","citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:3acc8f848dd136c4628a82d1469334ba5c4e87a34805b44f9c4d4f0baaa80f9c","observation_id":"50c6bcaf-e1fa-497e-8c4c-20836238db5d","resolution":{"observed_at":"2026-08-07T21:36:34.128913Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:33.276066Z","title":"Reward shaping to improve the performance of deep reinforcement learning in perishable inventory management,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-07T21:32:46.428389Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.276066Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:58c0388ea8029cbb03bf2743295468ec7603a7a52f2e1478436c53a2714113a3","observation_id":"bd0797c2-3e08-459d-80e3-6980351a603c","resolution":{"observed_at":"2026-08-07T21:36:33.276066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:33.280831Z","title":"Cooperative multi-agent reinforcement learning for inventory man- agement,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-07T21:32:46.428389Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.280831Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:853b0af577beea2a353a0de571a777a817ee6c0c69fe86550d2038c09770738e","observation_id":"1e673c8e-0458-415c-af6f-d97e8da66250","resolution":{"observed_at":"2026-08-07T21:36:33.280831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01649","last_updated":"2023-08-03T09:31:45Z","snapshot_observed_at":"2026-07-06T16:02:03.144875Z","submitted_at":"2023-08-03T09:31:45Z","title":"MARLIM: Multi-Agent Reinforcement Learning for Inventory Management","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01649","snapshot_observed_at":"2026-08-07T21:36:33.285873Z","title":"Marlim: Multi-agent reinforcement learning for inventory management,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-07T21:32:46.428389Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.285873Z"},"links":{"cited_paper":"/paper/2308.01649","citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:35c3cdb60004b9568bfbd691c6a17d26af520fa0e2e246330de49661151d23e6","observation_id":"3173f6d7-6862-4fac-bd11-dad2466e3ed0","resolution":{"observed_at":"2026-08-07T21:36:33.285873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:33.291435Z","title":"Reinforcement and deep reinforce- ment learning-based solutions for machine maintenance planning, scheduling policies, and optimization,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-07T21:32:46.428389Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.291435Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:4b71460b2adb29baa97bd9a9c413d77cbc1f57e1968c8977bcd184561d083b58","observation_id":"4ed62436-cd2f-4f9a-a31c-af7d2e58250a","resolution":{"observed_at":"2026-08-07T21:36:33.291435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:33.296552Z","title":"Reinforcement learning for dynamic condition-based maintenance of a system with individually repairable components,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-07T21:32:46.428389Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.296552Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:c4a8ad2407824f5c458c327ff7942cf9eb7b23f58af395f28cbf1efb83ab958b","observation_id":"dc6b4fd7-8851-4360-b2b2-040359d522b5","resolution":{"observed_at":"2026-08-07T21:36:33.296552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:33.301291Z","title":"Dynamic maintenance model for a repairable multi-component system using deep reinforcement learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-07T21:32:46.428389Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.301291Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:105f2d4c960c4beebce95934751b13458246dbe614ae5f2fdc2635f0c3747701","observation_id":"75427182-3295-43c2-9978-b96a43c1e503","resolution":{"observed_at":"2026-08-07T21:36:33.301291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:33.306212Z","title":"Aircraft main- tenance check scheduling using reinforcement learning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-07T21:32:46.428389Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.306212Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:5a4f61c2f5730e5195a3031b306cd674e8cf9ad2766c2c2d2fdb6fa413d606a8","observation_id":"7d4924d7-3694-44d6-a8f0-1ff7f70a7980","resolution":{"observed_at":"2026-08-07T21:36:33.306212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:33.310870Z","title":"Network maintenance planning via multi-agent reinforcement learn- ing,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-07T21:32:46.428389Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.310870Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:6111266a689b607c4bb7a07821ef98111481610b980a381d89b51f5bf0a4e58b","observation_id":"1fff148a-67d5-4091-8c5c-df02609849ec","resolution":{"observed_at":"2026-08-07T21:36:33.310870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:33.315478Z","title":"Reinforcement learning for statistical process control in manufacturing,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-07T21:32:46.428389Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.315478Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:115a4919b8dc253a80eb687bd1854e1fb6bcb0a67152bccd444bcc5cde633098","observation_id":"6a0797b0-6f65-465a-9067-0a38339cc954","resolution":{"observed_at":"2026-08-07T21:36:33.315478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:33.320310Z","title":"Explainable reinforcement learning in production control of job shop manufacturing system,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-07T21:32:46.428389Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.320310Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:2b497dc02e2013ebeb7d9a2b61dec3998410f9ba3569a4e0f6c092a06a4bbec8","observation_id":"3faed340-6296-4a10-a72c-96f169277563","resolution":{"observed_at":"2026-08-07T21:36:33.320310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:33.325114Z","title":"Using process data to generate an optimal control policy via apprenticeship and reinforcement learning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-07T21:32:46.428389Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.325114Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:a9d03dee029c9311255cbd468ed7c22c26c0a9c2f632d9260600758d382f586a","observation_id":"80ed8307-ae0e-4cb1-aae9-2471e4c02f33","resolution":{"observed_at":"2026-08-07T21:36:33.325114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:33.330402Z","title":"Reinforcement learning for process control with application in semiconductor manufacturing,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-07T21:32:46.428389Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.330402Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:0dccc4df88f50f51ab7405fdc72453b40226c9c864241fa610fe706935542168","observation_id":"5da87fee-4c7d-4885-9322-685a70ebdbeb","resolution":{"observed_at":"2026-08-07T21:36:33.330402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:33.335588Z","title":"Reinforcement learning for whole-building hvac control and demand response,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-07T21:32:46.428389Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.335588Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:3229240e5a89aeccd0471d371caea762a31479ce4b1d7226b46f1978166dea98","observation_id":"4d6d80e1-92ca-4cbb-827a-2a2d409815cb","resolution":{"observed_at":"2026-08-07T21:36:33.335588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:33.340446Z","title":"Using meta reinforcement learning to bridge the gap between simulation and experiment in energy demand response,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-07T21:32:46.428389Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.340446Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:7de11dbe325bf6178486fca2b2973b7e7b13799423963c00e197b8360b7a0784","observation_id":"42893808-7b3d-40aa-803c-21b0fb442131","resolution":{"observed_at":"2026-08-07T21:36:33.340446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:33.345556Z","title":"Multiagent reinforce- ment learning for energy management in residential buildings,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-07T21:32:46.428389Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.345556Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:98c5739d4cf820138132adee31d2afc98c651a28fdaca1050a03491a5af1520f","observation_id":"64b59504-e520-4cbb-821e-c4a41865e3b8","resolution":{"observed_at":"2026-08-07T21:36:33.345556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:33.350303Z","title":"Deep reinforcement learning-based demand response for smart facilities energy management,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-07T21:32:46.428389Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.350303Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:3c62bd1f5e1e02bbba9245272b8f03ad5f424a40afbb2ccbe54782b62ed653fe","observation_id":"a2cfac70-59a5-4229-bec6-c0c34a896022","resolution":{"observed_at":"2026-08-07T21:36:33.350303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:35.118425Z","title":"Multi-agent deep rein- forcement learning based demand response for discrete manufacturing systems energy management,","venue":null,"work_id":"d32cac77-f217-43e6-a341-20025e8800c5","year":2020},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-07T21:32:46.428389Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.354947Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:304bfb9726c4c2ee3950401fd12f12bcfaf9d1530372b2ea3a5755abbceab8ae","observation_id":"1cf0221b-edd3-4756-bef8-a223f754e4ad","resolution":{"observed_at":"2026-08-07T21:36:35.123388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:35.103221Z","title":"Testbed implementation of reinforcement learning-based demand response energy management system,","venue":null,"work_id":"6cb21e45-d1c3-4eb8-a4f5-e0994247cce7","year":2021},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-07T21:32:46.428389Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.359644Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:6325071a97ae8fde659ca0540000238c94662dcad1e4a2844bf4ff952d975a9a","observation_id":"347e4ab7-b9d9-4049-b8e7-f82367b9c081","resolution":{"observed_at":"2026-08-07T21:36:35.108220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:35.087457Z","title":"Deep reinforcement learning for energy management in a microgrid with flexible demand,","venue":null,"work_id":"b9082d67-0094-4e41-995e-a017515b984a","year":2021},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-07T21:32:46.428389Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.364648Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:5573bdab8272be8610d87667ea8e11bf68a64a6f46ea9716379a03788400ad67","observation_id":"99a2c2d1-40b7-4ffb-8db0-4c5c106cf971","resolution":{"observed_at":"2026-08-07T21:36:35.092659Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:35.071803Z","title":"Energy management for microgrids using a reinforcement learning algorithm,","venue":null,"work_id":"d49c199e-be12-4c6b-bd0a-3ab0831d06f1","year":2021},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-07T21:32:46.428389Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.369901Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:1e95f979b21675a661e13cd1b8da1a8da41a375100aa636046d6e439eefb5ef7","observation_id":"7ccde4fa-612d-479f-9c90-c41d7797235d","resolution":{"observed_at":"2026-08-07T21:36:35.076898Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:35.056464Z","title":"Deep reinforcement learning- based energy management strategy for a microgrid with flexible loads,","venue":null,"work_id":"4ffe9946-aa52-422b-8ff8-efdba7e6571f","year":2023},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-07T21:32:46.428389Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.374847Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:28664f8ecdf560e42332788b8a7623334bd6b5e966ed92b2bc5f6a5c03aa379a","observation_id":"48958e56-0e98-44f3-9545-839af3dfbfaa","resolution":{"observed_at":"2026-08-07T21:36:35.061494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:35.039290Z","title":"Energy management in microgrid based on deep rein- forcement learning with expert knowledge,","venue":null,"work_id":"66620c41-d61c-46ba-a5aa-af3bd3bbee4f","year":2022},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-07T21:32:46.428389Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.379915Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:9745cb319018803f1c1c59052b143f36218208def66fb1f9941257c187d5b113","observation_id":"6bd8f1a8-8698-4f64-9c64-07cf32505de1","resolution":{"observed_at":"2026-08-07T21:36:35.045222Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:35.021660Z","title":"Weather-aware data-driven microgrid energy manage- ment using deep reinforcement learning,","venue":null,"work_id":"6c4979cd-09fa-4209-a1b8-e5e67156fee0","year":2021},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-07T21:32:46.428389Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.385787Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:c2a27c8f0ba296b0067f743bd7de810b12fa1aae45425bb4e5095f6a7c522979","observation_id":"40c6fcb0-efbd-4dc9-9645-8c7c9f416923","resolution":{"observed_at":"2026-08-07T21:36:35.026912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:35.005500Z","title":"Intelligent multi-microgrid energy management based on deep neural network and model-free reinforcement learning,","venue":null,"work_id":"b6f8d43f-d550-47cb-a130-056e280b0e9c","year":2019},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-07T21:32:46.428389Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.390987Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:6f0a388938230aa7a6dcb105548e8f0c536c6b0a2bee078a924b4ecddec7657e","observation_id":"11dd84d0-b1e5-44d9-8672-f173fb2df57e","resolution":{"observed_at":"2026-08-07T21:36:35.010835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:34.988614Z","title":"Reinforcement learning in sustainable energy and electric systems: A survey,","venue":null,"work_id":"39668a4e-8a6b-4f0e-907a-962eb15d3fb3","year":2020},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-07T21:32:46.428389Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.396006Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:17cef0ca79cded78e8f3d481c3c1e8cf283d7f77a1bf17e74b4f8ea630b8f28c","observation_id":"f61c2f09-028e-424e-ae15-6307a217de58","resolution":{"observed_at":"2026-08-07T21:36:34.994185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:34.970926Z","title":"Reinforcement learning and its applications in modern power and energy systems: A review,","venue":null,"work_id":"941b7288-4a56-465c-8f5f-40b3f8112c72","year":2020},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-07T21:32:46.428389Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.400680Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:92c79b46b0c7cb56a700175fbf53437c7c1c078c6401c5992c160f6a43e0806e","observation_id":"1d31bb53-e907-4d2e-8514-a98310da4b04","resolution":{"observed_at":"2026-08-07T21:36:34.976513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:34.954311Z","title":"Reinforcement learning for selective key applications in power systems: Recent advances and future challenges,","venue":null,"work_id":"d37066d6-b4e2-4ca9-a91f-4c6bb3d017f2","year":2022},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-07T21:32:46.428389Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.406012Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:3a018ab763749f7798f47db38768df342d66e9586ca4e8669822596802fb281a","observation_id":"30c87fc8-0488-4274-ad9f-8a1135833591","resolution":{"observed_at":"2026-08-07T21:36:34.959177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:33.411370Z","title":"A systematic study on reinforcement learning based applications,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-07T21:32:46.428389Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.411370Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:9c21ccb4c586838b4b67b2f2d077fe8b9686e33413685d104f2818eef771868c","observation_id":"dff334e1-0be3-4ba1-bf81-5b18b5b9b0af","resolution":{"observed_at":"2026-08-07T21:36:33.411370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:34.927834Z","title":"End-to-end deep reinforcement learning control for hvac systems in office buildings,","venue":null,"work_id":"3adf3d38-4ae9-45bf-a3b5-d12c0be26a09","year":2022},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-07T21:32:46.428389Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.416302Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:7b599526f0105a502af3d27d9a6f598c6aeec5bf97fbc67d2ddd2a7f08a1a272","observation_id":"324fb30e-43f3-468e-a472-472e03a0c28c","resolution":{"observed_at":"2026-08-07T21:36:34.932097Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:34.914496Z","title":"A review of reinforcement learn- ing applications to control of heating, ventilation and air conditioning systems,","venue":null,"work_id":"3408377d-0848-4b8f-81a5-fa54b9c79174","year":2022},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-07T21:32:46.428389Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.421280Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:b5fbb626464c2cc50391606898eef8c62aba94283cb32f51f39ca413bf91a5b0","observation_id":"a9ebe5fc-d33a-4eeb-bd93-074165404b49","resolution":{"observed_at":"2026-08-07T21:36:34.918676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:34.901085Z","title":"Safe hvac control via batch reinforcement learning,","venue":null,"work_id":"85b4f596-1c0d-42ee-8fdc-49abd5ddc6de","year":2022},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-07T21:32:46.428389Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.426203Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:ca34a2a6695ae508b7b16f9a4877fcc5bfab292b8583a8cf0e00d5848dce3940","observation_id":"e0fcbf14-b415-459d-95fd-f187f1a7eff5","resolution":{"observed_at":"2026-08-07T21:36:34.905324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:34.886151Z","title":"Study on the application of reinforcement learning in the operation optimization of hvac system,","venue":null,"work_id":"9f7543a4-fe1a-4865-b5c5-9493cef06acc","year":2021},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-07T21:32:46.428389Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.431027Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:3eb6e5104fe30b4e2325f2b00a10836e4f521075aa3510bdc23d6eb4a240a9f2","observation_id":"a6327798-805b-4e04-9d6f-2739c85483b2","resolution":{"observed_at":"2026-08-07T21:36:34.891041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:34.870971Z","title":"Experimental evalu- ation of model-free reinforcement learning algorithms for continuous hvac control,","venue":null,"work_id":"6c1c98a6-c4a6-45ea-ad1a-8e62121941f2","year":2021},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-07T21:32:46.428389Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.436271Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:8297d5eca57d65269b34050557818f5433a0c0a8b80d2ea217f3824a4ff29547","observation_id":"b1da68b9-e07e-446b-8f1a-7cf744b9d80b","resolution":{"observed_at":"2026-08-07T21:36:34.875809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:34.856262Z","title":"Robotic arm motion planning based on curriculum reinforcement learning,","venue":null,"work_id":"bf25b649-cc22-4664-be9f-04bf48549c39","year":2021},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-07T21:32:46.428389Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.441081Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:6dbec520cc4a8e52d8145ddd4a5f157c08bfdf8a39970eea22d099528e5faa08","observation_id":"5698b67f-3bc1-494b-88a5-0200a1c37d8e","resolution":{"observed_at":"2026-08-07T21:36:34.860984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.00492","last_updated":"2022-07-01T15:26:36Z","snapshot_observed_at":"2026-07-06T13:26:52.235619Z","submitted_at":"2022-07-01T15:26:36Z","title":"Reinforcement Learning Based User-Guided Motion Planning for Human-Robot Collaboration","version":1},"cited_work":{"arxiv_id":"2207.00492","doi":null,"metadata_source":"pith","pith_arxiv_id":"2207.00492","snapshot_observed_at":"2026-08-07T21:36:34.084340Z","title":"Reinforcement Learning Based User-Guided Motion Planning for Human-Robot Collaboration","venue":"eess.SY","work_id":"59dedb01-5c0a-4c43-b816-5610cc3d6542","year":2022},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-07T21:32:46.428389Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.445979Z"},"links":{"cited_paper":"/paper/2207.00492","citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:7f584d98e6adfd07bdf49a69ac18371ac8f89379f7b8bf9a249e01252c5823a7","observation_id":"70703579-d103-4c26-b4bf-d060840369dc","resolution":{"observed_at":"2026-08-07T21:36:34.090096Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:34.841293Z","title":"Reinforcement learning with prior policy guidance for motion planning of dual-arm free-floating space robot,","venue":null,"work_id":"71cba3bb-3cb4-4634-ac2e-e4a7fe35df15","year":2023},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-07T21:32:46.428389Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.451666Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:68610c211fc4686b80193f58bff34733bb7187b4d523ca2453fd1aa84b8a292f","observation_id":"8833ca38-04e6-464c-b349-7c238eb01ae6","resolution":{"observed_at":"2026-08-07T21:36:34.846502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.13966","last_updated":"2022-06-28T12:35:21Z","snapshot_observed_at":"2026-07-06T13:25:27.826746Z","submitted_at":"2022-06-28T12:35:21Z","title":"Dext-Gen: Dexterous Grasping in Sparse Reward Environments with Full Orientation Control","version":1},"cited_work":{"arxiv_id":"2206.13966","doi":null,"metadata_source":"pith","pith_arxiv_id":"2206.13966","snapshot_observed_at":"2026-08-07T21:36:34.060349Z","title":"Dext-Gen: Dexterous Grasping in Sparse Reward Environments with Full Orientation Control","venue":"cs.RO","work_id":"49dc6504-6a1a-4624-b991-96bcedf17e1c","year":2022},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-07T21:32:46.428389Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.456710Z"},"links":{"cited_paper":"/paper/2206.13966","citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:84ab8f91b18c1d77a4da59dd468f917ea26f1b89277c8e0f9bd16bca8be9748b","observation_id":"7dc13f4f-04f4-4dd0-abad-6f1e55ef17bc","resolution":{"observed_at":"2026-08-07T21:36:34.065513Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:34.826795Z","title":"Robotic grasping using deep reinforcement learning,","venue":null,"work_id":"bcf8ca69-65c4-4a30-bb8f-0796ba9cbc0a","year":2020},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-07T21:32:46.428389Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.461980Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:420a9abc9713c96034552612107027a2bfe8d6d1f175864f0191813d4da2e235","observation_id":"6618b32d-3e96-4ce5-a2f6-11defec4054b","resolution":{"observed_at":"2026-08-07T21:36:34.831637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:34.812131Z","title":"Mrcdrl: Multi-robot coordination with deep reinforcement learning,","venue":null,"work_id":"8676d1c6-a167-4579-a260-fcc9e1467ad0","year":2020},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-07T21:32:46.428389Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.467164Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:7c0fc56c911317ef8eb784c0436b0c79b3383a12f2372d8e08df533d8a9b56da","observation_id":"9fbf6898-67ec-4459-8a8b-a17efeaa3f37","resolution":{"observed_at":"2026-08-07T21:36:34.817018Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:34.796825Z","title":"Towards pick and place multi robot coordination using multi-agent deep reinforcement learning,","venue":null,"work_id":"ce5d3cbb-151d-4a4d-bd3f-9fdafae48fe2","year":2021},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-07T21:32:46.428389Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.472557Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:b13d038103aca34a69af618fcd6039c906b820884cc181192b86234723dd8fe0","observation_id":"304cb149-2520-4a71-b5f9-6dda9c93cd03","resolution":{"observed_at":"2026-08-07T21:36:34.801866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:34.781889Z","title":"Human-centered collaborative robots with deep reinforcement learn- ing,","venue":null,"work_id":"f9165283-44de-46a4-bfd3-d44dddcb30ae","year":2020},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-07T21:32:46.428389Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.477393Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:ae6fa13969099a2efbe7a86346deaf95fdb380f2cea6314f3741670cac27070a","observation_id":"e26e0375-1e66-4b32-93e4-defe3ed8697e","resolution":{"observed_at":"2026-08-07T21:36:34.786998Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:34.766634Z","title":"Explainable reinforcement learning for human-robot collaboration,","venue":null,"work_id":"5850502f-e3fc-4baf-8aa4-afb57b51152f","year":2021},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-07T21:32:46.428389Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.482259Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:9f21e3e2d1761cd3ca94744eeacc1e8509df57b97a83c15476d95017fef214bc","observation_id":"a5329fba-cc14-4147-9432-8827cc9de23a","resolution":{"observed_at":"2026-08-07T21:36:34.771673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:34.750955Z","title":"Real-world human-robot collaborative reinforcement learning,","venue":null,"work_id":"1bba76bf-3634-4ae9-9994-989847b71f78","year":2020},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-07T21:32:46.428389Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.487077Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:4b47bfca09ee62414e12d962dded08ca2aea48330707824d774ecb38115f2734","observation_id":"e9c26b50-51b6-46d4-a109-54ad10613235","resolution":{"observed_at":"2026-08-07T21:36:34.755910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06208","last_updated":"2024-06-25T11:11:00Z","snapshot_observed_at":"2026-07-06T16:30:12.703492Z","submitted_at":"2023-10-09T23:34:09Z","title":"Human-Robot Gym: Benchmarking Reinforcement Learning in Human-Robot Collaboration","version":2},"cited_work":{"arxiv_id":"2310.06208","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.06208","snapshot_observed_at":"2026-08-07T21:36:34.038742Z","title":"Human-Robot Gym: Benchmarking Reinforcement Learning in Human-Robot Collaboration","venue":"cs.RO","work_id":"fba44a56-7f82-4873-b967-b21f34aa50b1","year":2023},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-07T21:32:46.428389Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.492184Z"},"links":{"cited_paper":"/paper/2310.06208","citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:59db74231433c11934cfb421f211099756507332ad248d64a998cdb908e1e38c","observation_id":"a3cebd9a-7306-41e0-980e-e3be2a21d1e0","resolution":{"observed_at":"2026-08-07T21:36:34.043976Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:34.736129Z","title":"Towards safe human-robot collaboration using deep reinforcement learning,","venue":null,"work_id":"91baae6b-9ca2-4d7f-a787-16af7251251c","year":2020},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-07T21:32:46.428389Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.497527Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:a610c32491a810269e8bee482ac957022f9509b4e4eb47ffe22029d3e716a410","observation_id":"1d975f13-1b8d-4322-bc7c-b8b386f7c0f1","resolution":{"observed_at":"2026-08-07T21:36:34.741221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:34.720639Z","title":"A framework and algorithm for human-robot collaboration based on multimodal reinforcement learning,","venue":null,"work_id":"b30bb85f-5958-4c64-ab9b-a2b5d97eb340","year":2022},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-07T21:32:46.428389Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.502565Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:f1f2cdf6dddf1e73fa00fef16fe43145d28a5c3fb0ea7abee82a05fbee978d26","observation_id":"4d24db4b-5d3e-4ce4-808a-72c701bc2497","resolution":{"observed_at":"2026-08-07T21:36:34.726034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:34.706611Z","title":"A survey of learning-based robot motion planning,","venue":null,"work_id":"791b41b8-34cc-45d9-8785-d793fbe2e2fe","year":2021},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-07T21:32:46.428389Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.507880Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:d6179a89617c2935e3228f42bf7b6e03c1ef31377627f454a56f3669eb7aa649","observation_id":"07085747-d61d-4340-a188-6e10b03d593c","resolution":{"observed_at":"2026-08-07T21:36:34.711109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:34.692383Z","title":"A survey on deep reinforcement learning algorithms for robotic manipulation,","venue":null,"work_id":"81919ccf-e99d-4b35-939c-cb79ebad1a30","year":2023},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-07T21:32:46.428389Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.512848Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:6abe6b7d7611d9b23bada83a1bc3d122206a715c7b069fddedff1b5bb5d64d95","observation_id":"b5f86b26-6acf-48ce-aa1f-5f4094a570ea","resolution":{"observed_at":"2026-08-07T21:36:34.696771Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:34.677868Z","title":"Reward shaping to learn natural object manipulation with an anthropomorphic robotic hand and hand pose priors via on- policy reinforcement learning,","venue":null,"work_id":"405bf655-ce31-42a1-a5ab-ee0ea2972f83","year":2021},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-07T21:32:46.428389Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.517671Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:30e24210ac5096a786ac618501e25a7d36a1052eb10d01c368bd4a9ab47729c8","observation_id":"a6ade5fc-00bc-479d-a77f-8bf827705595","resolution":{"observed_at":"2026-08-07T21:36:34.682569Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:34.662286Z","title":"Enhancing robotic grasping of free-floating targets with soft actor-critic algorithm and tactile sensors: a focus on the pre-grasp stage,","venue":null,"work_id":"b1840859-64e6-40fe-80ca-3fe6d0f82e7b","year":2024},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-07T21:32:46.428389Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.522486Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:769973ce4cc2d49de006c8d68b206d678ee24977f3d66f99841f614a3fa90419","observation_id":"544cbe48-d6e9-47b8-8218-3278f40e9633","resolution":{"observed_at":"2026-08-07T21:36:34.667452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:34.645480Z","title":"Reinforcement learning for multi-robot system: A review,","venue":null,"work_id":"9413c418-19eb-49ae-b8a3-ebf2b33bd004","year":2021},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-07T21:32:46.428389Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.528484Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:66018e5ac0b52d549f81570aa302b8eba68288f6dcc8a5961f747fd3e1328a68","observation_id":"4e1ef3d1-d871-46c9-9656-25a006853d42","resolution":{"observed_at":"2026-08-07T21:36:34.651171Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:34.627898Z","title":"Coordination of a multi robot system for pick and place using reinforcement learning,","venue":null,"work_id":"5be00235-4ee2-4343-97a4-7432e2c0f649","year":2022},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-07T21:32:46.428389Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.534696Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:53141065c0adc60d41303388b4dc3d979df707383c4d56cb5483733b31744a7b","observation_id":"ce4dd452-ff06-4335-8d09-119c9fbe2f4e","resolution":{"observed_at":"2026-08-07T21:36:34.633058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:34.612296Z","title":null,"venue":null,"work_id":"efbbcf3c-ea69-48b6-a148-12d87cb339a9","year":2020},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-07T21:32:46.428389Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.540512Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:2b70f2fdc0bec7dec2db4005dfc8af5f2f5df4d8f6f215d9b6ab3c5acda9e1a9","observation_id":"501b8719-94cd-4d3c-bf9b-104c37ee22c8","resolution":{"observed_at":"2026-08-07T21:36:34.617407Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:34.596010Z","title":"Adaptive coordination of multiple learning strategies in brains and robots,","venue":null,"work_id":"c38406b2-3fce-463c-ac36-efc79aa85d41","year":2020},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-07T21:32:46.428389Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.546869Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:97a9cfc32ef117986d4dc4f8078691afa41f45f4721c52e3f9cae5a5722440d2","observation_id":"16a6ebd3-002d-4a7a-ad9d-7b483a9f128d","resolution":{"observed_at":"2026-08-07T21:36:34.601441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:34.580133Z","title":"Study of sample efficiency improvements for reinforcement learning algorithms,","venue":null,"work_id":"e7a2eb87-17e2-48fa-aa7e-796e5a62482f","year":2020},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-07T21:32:46.428389Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.552190Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:b7c300367e37d7aadefe0aca596ac3564cb32651b761a052100c3c57248efee0","observation_id":"550ce57c-396e-4014-87b6-9c82f2c81f7d","resolution":{"observed_at":"2026-08-07T21:36:34.585485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.04881","last_updated":"2021-02-09T15:27:47Z","snapshot_observed_at":"2026-07-06T10:39:49.134574Z","submitted_at":"2021-02-09T15:27:47Z","title":"Measuring Progress in Deep Reinforcement Learning Sample Efficiency","version":1},"cited_work":{"arxiv_id":"2102.04881","doi":null,"metadata_source":"pith","pith_arxiv_id":"2102.04881","snapshot_observed_at":"2026-08-07T21:36:34.017731Z","title":"Measuring Progress in Deep Reinforcement Learning Sample Efficiency","venue":"cs.LG","work_id":"b08ed17e-f267-4ddf-ab7b-537d6374a4ce","year":2021},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-07T21:32:46.428389Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.558901Z"},"links":{"cited_paper":"/paper/2102.04881","citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:a3aa47d3974eeb627efba026b7d493cef66f365de551b74ae72c9b34ea58dc3c","observation_id":"9fdb04d5-b5d0-4e98-b5ec-1b0ff458c82b","resolution":{"observed_at":"2026-08-07T21:36:34.022989Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2007.13690","last_updated":"2021-01-16T23:51:53Z","snapshot_observed_at":"2026-07-06T09:42:10.136647Z","submitted_at":"2020-07-24T16:29:19Z","title":"Maximum Mutation Reinforcement Learning for Scalable Control","version":7},"cited_work":{"arxiv_id":"2007.13690","doi":null,"metadata_source":"pith","pith_arxiv_id":"2007.13690","snapshot_observed_at":"2026-08-07T21:36:33.996132Z","title":"Maximum Mutation Reinforcement Learning for Scalable Control","venue":"cs.LG","work_id":"6fc1ba24-63db-4212-a912-f475e4215a25","year":2020},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-07T21:32:46.428389Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.565054Z"},"links":{"cited_paper":"/paper/2007.13690","citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:c583ffed4389d2a77f16bf5c268273f0f38c5ac9adf2fa6ffb8d36dd162bd4d9","observation_id":"d842fd78-6b4b-4bf4-9c6a-6f5c545a560e","resolution":{"observed_at":"2026-08-07T21:36:34.001403Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:34.563687Z","title":"Sample efficient reinforcement learning method via high efficient episodic memory,","venue":null,"work_id":"4e8ac095-8f7a-488d-97f7-982935265e54","year":2020},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-07T21:32:46.428389Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.570915Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:3ffda5be6f887e1d1081900355928678e17670c38c25363bb49960b542b15ace","observation_id":"b3b6ec98-e4c1-4072-a26f-c0d1023d67c7","resolution":{"observed_at":"2026-08-07T21:36:34.569138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:33.576696Z","title":"Efficient online reinforcement learning with offline data,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-07T21:32:46.428389Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.576696Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:5fa00eebef9094ec4595f081d5c958e3391fc56271e264040085e73e12a55480","observation_id":"1b547937-483b-4429-9ad4-4913ae6e7ab8","resolution":{"observed_at":"2026-08-07T21:36:33.576696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:34.533811Z","title":"Breaking the sample size barrier in model-based reinforcement learning with a generative model,","venue":null,"work_id":"bfa26062-527b-4e67-9950-8c9ea0004497","year":2020},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-07T21:32:46.428389Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.582695Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:485257afcf6fb7534d6ee65dbed2ecb6b3384d01bd67ee9569eb7b68bc5461d3","observation_id":"5bc23ff2-040c-4f99-929c-b7fbd140bfed","resolution":{"observed_at":"2026-08-07T21:36:34.539665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:34.516699Z","title":"Elastic step ddpg: Multi-step reinforcement learning for improved sample efficiency,","venue":null,"work_id":"3fc42c58-7295-4bc1-911f-fa5a78025a65","year":2023},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-07T21:32:46.428389Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.587857Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:7b20518ec6ba1e6db245a863866d9d8de26995abf47026ae42a882d07d8c700f","observation_id":"97b57b1d-a763-40ee-ad38-fa8bdd7c3e30","resolution":{"observed_at":"2026-08-07T21:36:34.522087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:34.499915Z","title":"Sample-efficient reinforcement learning via conservative model-based actor-critic,","venue":null,"work_id":"6c16c1d9-57d9-454c-aeb0-633eabf39d82","year":2022},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-07T21:32:46.428389Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.593984Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:5884e7a0719087cfc0b8d60c5c16c50dcddfda6ea813044c037dc4cbc5a219e7","observation_id":"ee8173eb-355a-4df7-848d-84d4bd778d6b","resolution":{"observed_at":"2026-08-07T21:36:34.505362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:34.485662Z","title":"Safety robustness of reinforcement learning policies: A view from robust control,","venue":null,"work_id":"dde4ccd9-92a0-432a-a573-34b5c7d079f7","year":2021},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-07T21:32:46.428389Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.599188Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:2fba2021932a8176508cf1b1c97b8aaa08417d3c48920271fa400d54254d78d2","observation_id":"0ddf61cb-00a0-4b3c-8ec3-9aebb00f6f46","resolution":{"observed_at":"2026-08-07T21:36:34.490108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06835","last_updated":"2023-09-13T09:34:21Z","snapshot_observed_at":"2026-07-06T16:17:50.837748Z","submitted_at":"2023-09-13T09:34:21Z","title":"Safe Reinforcement Learning with Dual Robustness","version":1},"cited_work":{"arxiv_id":"2309.06835","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.06835","snapshot_observed_at":"2026-08-07T21:36:33.974124Z","title":"Safe Reinforcement Learning with Dual Robustness","venue":"cs.LG","work_id":"e183010d-3c36-44b9-ad79-d440c1c4d8fc","year":2023},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-07T21:32:46.428389Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.604825Z"},"links":{"cited_paper":"/paper/2309.06835","citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:32e4d7c4e3eecb6a079a46da67d53aa7a31649ce2f37fac97727619046acba5e","observation_id":"2cc06383-7502-4214-af5e-5a22cf820ace","resolution":{"observed_at":"2026-08-07T21:36:33.979594Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.14691","last_updated":"2023-03-02T02:56:47Z","snapshot_observed_at":"2026-07-06T13:15:10.457884Z","submitted_at":"2022-05-29T15:25:03Z","title":"On the Robustness of Safe Reinforcement Learning under Observational Perturbations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.14691","snapshot_observed_at":"2026-08-07T21:36:33.610142Z","title":"On the robustness of safe reinforcement learning under observational perturbations,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-07T21:32:46.428389Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.610142Z"},"links":{"cited_paper":"/paper/2205.14691","citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:270233add4670647c7fc702bacd7976a64d7a3830a8c742957ab5598b2fe5360","observation_id":"d9c98fea-5183-47eb-b67d-026444cd6663","resolution":{"observed_at":"2026-08-07T21:36:33.610142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:34.471174Z","title":"Safe reinforcement learning using robust control barrier functions,","venue":null,"work_id":"c3785d34-42bb-4b9a-b5e8-53ac35ff7f0c","year":2022},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-07T21:32:46.428389Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.616906Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:314e667c09a422c6aaaadfad4c1352ab5751f6244c442bd501c076908ae2eaed","observation_id":"5457f1a7-3bd7-47a5-bc78-5d901f1baab8","resolution":{"observed_at":"2026-08-07T21:36:34.475887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:34.457149Z","title":"Safe reinforcement learning using robust action governor,","venue":null,"work_id":"7d5a2348-b8e1-4f75-b312-148a3b39ea27","year":2021},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-07T21:32:46.428389Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.621836Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:47883c915686c80da0cdec647610a1cc6b21d491e3ecaaf964fe5dad54be9931","observation_id":"9c128383-c9dc-4c0d-8e04-0710731d6ad2","resolution":{"observed_at":"2026-08-07T21:36:34.461578Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:33.626931Z","title":"Safe reinforcement learning using robust mpc,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-07T21:32:46.428389Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.626931Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:20d931d7e3b30b98e37de39f5ad37f7ba9e5dac4d0a5f8d75fb298ab51ff29a6","observation_id":"226086d9-4c0c-49b2-9579-c358e5e98367","resolution":{"observed_at":"2026-08-07T21:36:33.626931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.13375","last_updated":"2024-03-28T16:08:43Z","snapshot_observed_at":"2026-07-06T14:46:23.137171Z","submitted_at":"2023-01-31T02:39:52Z","title":"Optimal Transport Perturbations for Safe Reinforcement Learning with Robustness Guarantees","version":2},"cited_work":{"arxiv_id":"2301.13375","doi":null,"metadata_source":"pith","pith_arxiv_id":"2301.13375","snapshot_observed_at":"2026-08-07T21:36:33.933889Z","title":"Optimal Transport Perturbations for Safe Reinforcement Learning with Robustness Guarantees","venue":"cs.LG","work_id":"14844fdb-21ee-48da-a21e-419128dfb79d","year":2023},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-07T21:32:46.428389Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.631729Z"},"links":{"cited_paper":"/paper/2301.13375","citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:e6239f8388fac7e06388bffae8a9e7385466170d2856b6c38fcd1e9ea7f4a6ad","observation_id":"0d91ed9e-980d-42b9-8eca-41f78d83e390","resolution":{"observed_at":"2026-08-07T21:36:33.939102Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:34.433725Z","title":"Task-agnostic safety for rein- forcement learning,","venue":null,"work_id":"c74b8ef6-fdfa-48d9-82d2-878fef4cc969","year":2023},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-07T21:32:46.428389Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.637192Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:52233cc9d7fcbd58c74298b8f3e5ed5220a48487772b0f4e0cf82d47ea478875","observation_id":"dff55c0a-093b-4d0a-90fe-d9344f031119","resolution":{"observed_at":"2026-08-07T21:36:34.438028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:34.418868Z","title":"Falsification-based robust ad- versarial reinforcement learning,","venue":null,"work_id":"f102cf26-9eca-4b25-b084-d94eb9c02997","year":2020},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-07T21:32:46.428389Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.641895Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:e05c741612e66c2393db001350a30cdf94c3aa6879ab2aa194d3496386755cfd","observation_id":"29b3ce88-d0b3-4d8a-9a68-69d81ff0f06d","resolution":{"observed_at":"2026-08-07T21:36:34.423999Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.13112","last_updated":"2022-02-24T10:32:08Z","snapshot_observed_at":"2026-07-06T12:22:17.012426Z","submitted_at":"2021-12-24T17:26:57Z","title":"A Survey on Interpretable Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.13112","snapshot_observed_at":"2026-08-07T21:36:33.646549Z","title":"A survey on interpretable reinforcement learning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-07T21:32:46.428389Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.646549Z"},"links":{"cited_paper":"/paper/2112.13112","citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:1e734cd10f52ddf4145349303de8c89446e25ecee1912ce6a101718cc79fb95e","observation_id":"503dd278-7361-4b56-8667-d90b26627b8f","resolution":{"observed_at":"2026-08-07T21:36:33.646549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.11417","last_updated":"2021-06-21T21:30:08Z","snapshot_observed_at":"2026-08-07T12:51:40.590589Z","submitted_at":"2021-06-21T21:30:08Z","title":"Interpretable Model-based Hierarchical Reinforcement Learning using Inductive Logic Programming","version":1},"cited_work":{"arxiv_id":"2106.11417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.11417","snapshot_observed_at":"2026-08-07T21:36:33.895145Z","title":"Interpretable Model-based Hierarchical Reinforcement Learning using Inductive Logic Programming","venue":"cs.LG","work_id":"aec605e3-76dd-41f4-9771-0b6be59788d9","year":2021},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-07T21:32:46.428389Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.651576Z"},"links":{"cited_paper":"/paper/2106.11417","citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:c60b35c5f07173ee0cbd2d2d32a357907fd6f16328072487511ab87b19e3a932","observation_id":"36328faf-762e-4051-a9a9-6e03687c19f5","resolution":{"observed_at":"2026-08-07T21:36:33.900439Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04266","last_updated":"2022-06-09T04:23:26Z","snapshot_observed_at":"2026-07-06T13:18:57.269780Z","submitted_at":"2022-06-09T04:23:26Z","title":"There is no Accuracy-Interpretability Tradeoff in Reinforcement Learning for Mazes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.04266","snapshot_observed_at":"2026-08-07T21:36:33.656651Z","title":"There is no accuracy- interpretability tradeoff in reinforcement learning for mazes,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-07T21:32:46.428389Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.656651Z"},"links":{"cited_paper":"/paper/2206.04266","citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:6a27037bece654dd8015902e266f3958a62d798568334778a5e2e76d53b48fab","observation_id":"039c8826-59dd-45a1-86d0-63e374e46491","resolution":{"observed_at":"2026-08-07T21:36:33.656651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:34.402286Z","title":"What do rein- forcement learning models measure? interpreting model parameters in cognition and neuroscience,","venue":null,"work_id":"4a71098e-8a22-4e71-a86f-f00d9327634f","year":2021},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-07T21:32:46.428389Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.661666Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:1bd51254e83520066b5421bfc34041bc3fc13bf453a1dae7f82501fca6bd30cd","observation_id":"060a3d21-8994-4ba3-9c77-72db014205a7","resolution":{"observed_at":"2026-08-07T21:36:34.407812Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:34.385472Z","title":"Reinforcement learning interpretation methods: A survey,","venue":null,"work_id":"6eec3b83-6657-418c-adc3-508e516d3d0f","year":2020},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-07T21:32:46.428389Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.666689Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:c4c62c1f644e0eab9c1ba91f33f79945f67ff2fbc67f0f2987eedbe1b9cdd294","observation_id":"3f9ff627-597a-4669-a12c-dd8d83ed650e","resolution":{"observed_at":"2026-08-07T21:36:34.390612Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:34.369664Z","title":"Self- supervised discovering of interpretable features for reinforcement learning,","venue":null,"work_id":"2dc780e9-4302-49eb-bfae-0892f3ff8a70","year":2020},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-07T21:32:46.428389Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.671778Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:bb2dc65aa77c38fdf5436e24ab564b93ffb5db90c3ed73b0606c594370009ffd","observation_id":"b4292e42-6ae8-4514-a3d1-19e206c1950a","resolution":{"observed_at":"2026-08-07T21:36:34.374926Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:34.353223Z","title":"Learning sparse evidence-driven interpretation to understand deep reinforcement learning agents,","venue":null,"work_id":"5e426a53-4d25-4641-ac76-56ca6541846a","year":2021},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-07T21:32:46.428389Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.676726Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:1772d83542da9281c13c071c607de2c75d1e8656ca5bac3d409c14e5b8a24c8c","observation_id":"9f8389df-804e-4f18-8799-c8c09b7af67c","resolution":{"observed_at":"2026-08-07T21:36:34.358993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:34.337161Z","title":"Meta- learning in neural networks: A survey,","venue":null,"work_id":"8c412206-0464-4d62-9505-f5948a7d50ab","year":2021},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-07T21:32:46.428389Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.681931Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:56e1c904bda5a2cbdbea6e3049f3bc79c1702f4e5f001d5808189d6bc701717f","observation_id":"cc37d66b-bf1a-460c-824d-7a63bbd33147","resolution":{"observed_at":"2026-08-07T21:36:34.342061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:34.320918Z","title":"Learning action translator for meta reinforcement learning on sparse-reward tasks,","venue":null,"work_id":"02d76e78-051b-47ea-b398-9145fee6311a","year":2022},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-07T21:32:46.428389Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.687168Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:6c84ae77564eaa1be9a74c5e47dc23f9934c37c79461c43f16be626fafcf9250","observation_id":"a5e3b93f-c857-4a58-bed6-1a4378ac9865","resolution":{"observed_at":"2026-08-07T21:36:34.325714Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:33.692403Z","title":"Curriculum learning for reinforcement learning domains: A framework and survey,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-07T21:32:46.428389Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.692403Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:810f334cc13ac05ba5a556aa2944d38f5f50474e8a36dacff4cd3812faa745ec","observation_id":"126117cc-c59f-4078-8cbd-3923a748c2a5","resolution":{"observed_at":"2026-08-07T21:36:33.692403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:34.294614Z","title":"Effective reinforcement learning using transfer learning,","venue":null,"work_id":"1cf8fcca-b454-44fa-9f42-3cd9a6021aca","year":2022},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-07T21:32:46.428389Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.697555Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:aa5273b4cbf6f06edc563e1a60824bf7f1270a605c4a17b26573aaa78f330f93","observation_id":"808b3c83-1777-459a-a754-3ada3a3aa015","resolution":{"observed_at":"2026-08-07T21:36:34.299553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:34.279114Z","title":"Multi-source transfer learning for deep model-based reinforcement learning,","venue":null,"work_id":"1d04e001-0047-4358-b5ae-dbe4f22e7df9","year":2021},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-07T21:32:46.428389Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.702827Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:f0c741e99a5c938dbdc42fb9200f886d2e6bcb658f9103eb24fa3a599aeccbd7","observation_id":"1268171f-12d1-4267-902c-662832d31dfe","resolution":{"observed_at":"2026-08-07T21:36:34.284441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:34.244671Z","title":"Efficient meta reinforcement learning for preference-based fast adaptation,","venue":null,"work_id":"53a48f76-5ddc-4c72-8447-8276229ab717","year":2022},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-07T21:32:46.428389Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.708676Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:f70c72c90d4f9401e2461814e73ba82b3acfbb5954fcd9831038c351240fffd2","observation_id":"1f0bd06a-6bff-4527-8419-76ff699b49a9","resolution":{"observed_at":"2026-08-07T21:36:34.266401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T21:32:46.428389Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":38,"verified_exact":10,"verified_fuzzy":52},"total_outbound_references":108},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 100 of 108 outbound references and 0 inbound Pith citation observations for arXiv:2502.09417."}