{"as_of":"2026-08-07T16:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:39c24b4488ded076398f9461968ba0b855575e9ba90ed5ea1cc294a1950dee59","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T11:34:23.413516Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.22640/citation-record","integrity":"/paper/2507.22640/integrity","json":"/paper/2507.22640/citation-record.json","paper":"/paper/2507.22640"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:34:28.875704Z","title":"Reinforcement Learning: An Introduction,","venue":null,"work_id":"bab6243a-7733-4b7e-97e5-d311e72994c7","year":2018},"citing_paper":{"arxiv_id":"2507.22640","last_updated":"2025-07-30T12:58:02Z","snapshot_observed_at":"2026-08-07T13:21:29.570088Z","submitted_at":"2025-07-30T12:58:02Z","title":"Safe Deployment of Offline Reinforcement Learning via Input Convex Action Correction","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:16.903656Z"},"links":{"citing_paper":"/paper/2507.22640"},"observation_digest":"sha256:902cb330831ac84a9fd0b90e9651408f949ef23a22cd345715e540656aa86fb2","observation_id":"47d0afb2-e201-4c9c-91b8-555d6cd64d96","resolution":{"observed_at":"2026-08-06T11:34:28.983136Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:34:28.655711Z","title":"From automated to autonomous process operations,","venue":null,"work_id":"ab92ecca-51ef-4514-afc2-ae44272360f9","year":2025},"citing_paper":{"arxiv_id":"2507.22640","last_updated":"2025-07-30T12:58:02Z","snapshot_observed_at":"2026-08-07T13:21:29.570088Z","submitted_at":"2025-07-30T12:58:02Z","title":"Safe Deployment of Offline Reinforcement Learning via Input Convex Action Correction","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:17.019529Z"},"links":{"citing_paper":"/paper/2507.22640"},"observation_digest":"sha256:289fb37a590eaa8097172bbf74dbb8eb6b2ae3c595954377372bbfe34690adda","observation_id":"774554ce-b087-4f03-8bc8-5edd85b24f8c","resolution":{"observed_at":"2026-08-06T11:34:28.773197Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.06565","last_updated":"2016-07-25T17:23:29Z","snapshot_observed_at":"2026-07-06T05:00:46.434335Z","submitted_at":"2016-06-21T13:37:05Z","title":"Concrete Problems in AI Safety","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.06565","snapshot_observed_at":"2026-08-06T11:34:17.173306Z","title":"Concrete Problems in AI Safety,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.22640","last_updated":"2025-07-30T12:58:02Z","snapshot_observed_at":"2026-08-07T13:21:29.570088Z","submitted_at":"2025-07-30T12:58:02Z","title":"Safe Deployment of Offline Reinforcement Learning via Input Convex Action Correction","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:17.173306Z"},"links":{"cited_paper":"/paper/1606.06565","citing_paper":"/paper/2507.22640"},"observation_digest":"sha256:4562f8cbe3b830e5dd5144d46f282b5206e68c24411c2d04b643966d722e0579","observation_id":"1c1f6956-1bd8-4db8-b9ec-41dfddbcc373","resolution":{"observed_at":"2026-08-06T11:34:17.173306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:34:28.450267Z","title":"Optimal grade transition for polyethylene reactors via NCO tracking,","venue":null,"work_id":"d58021b4-f025-4247-ada0-1241e1d2d179","year":2005},"citing_paper":{"arxiv_id":"2507.22640","last_updated":"2025-07-30T12:58:02Z","snapshot_observed_at":"2026-08-07T13:21:29.570088Z","submitted_at":"2025-07-30T12:58:02Z","title":"Safe Deployment of Offline Reinforcement Learning via Input Convex Action Correction","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:17.315159Z"},"links":{"citing_paper":"/paper/2507.22640"},"observation_digest":"sha256:6ebc380ab7fbf9d24dff459d11d710e87b24870dbd268c3671a5b3bbe45b5c18","observation_id":"508c8ec1-2f66-422f-a823-a991a2c02b1b","resolution":{"observed_at":"2026-08-06T11:34:28.524681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:34:28.263964Z","title":"Iterative learning control-based batch process control technique for integrated control of end product properties and transient profiles of process variables,","venue":null,"work_id":"5823f9ad-7c44-42bd-b125-a582d4153c58","year":2003},"citing_paper":{"arxiv_id":"2507.22640","last_updated":"2025-07-30T12:58:02Z","snapshot_observed_at":"2026-08-07T13:21:29.570088Z","submitted_at":"2025-07-30T12:58:02Z","title":"Safe Deployment of Offline Reinforcement Learning via Input Convex Action Correction","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:17.502796Z"},"links":{"citing_paper":"/paper/2507.22640"},"observation_digest":"sha256:70cd91f0456254ea0c625b07acfa4fc661705407c82b13d23582b76538ff415f","observation_id":"c5c74b45-b2e3-4584-8979-918730fc3169","resolution":{"observed_at":"2026-08-06T11:34:28.351490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:34:27.993824Z","title":"Integrated scheduling and dynamic optimization of grade transitions for a continuous polymerization reactor,","venue":null,"work_id":"00a15afb-7755-4c80-836f-9a830dc777a5","year":2008},"citing_paper":{"arxiv_id":"2507.22640","last_updated":"2025-07-30T12:58:02Z","snapshot_observed_at":"2026-08-07T13:21:29.570088Z","submitted_at":"2025-07-30T12:58:02Z","title":"Safe Deployment of Offline Reinforcement Learning via Input Convex Action Correction","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:17.711036Z"},"links":{"citing_paper":"/paper/2507.22640"},"observation_digest":"sha256:ea46d70ccff1d2cd7da38b7be2b817d8694ee9697429ab591f9ca46ceaa9cef1","observation_id":"ec392a86-50b6-4a89-922f-37f1aa9bb745","resolution":{"observed_at":"2026-08-06T11:34:28.139301Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:34:27.840626Z","title":"The general problem of the stability of motion,","venue":null,"work_id":"9b6706d8-0d1f-41cc-ac11-31691ad1d159","year":1992},"citing_paper":{"arxiv_id":"2507.22640","last_updated":"2025-07-30T12:58:02Z","snapshot_observed_at":"2026-08-07T13:21:29.570088Z","submitted_at":"2025-07-30T12:58:02Z","title":"Safe Deployment of Offline Reinforcement Learning via Input Convex Action Correction","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:17.887751Z"},"links":{"citing_paper":"/paper/2507.22640"},"observation_digest":"sha256:4d41b6c98e0f46ebbf7045b846028cc88a0bbf66e078a7ea393cd5bde29fce8f","observation_id":"99ea38c8-7d60-44dc-b15a-e78182ec8bf7","resolution":{"observed_at":"2026-08-06T11:34:27.895469Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:34:27.644498Z","title":null,"venue":null,"work_id":"459c24bb-2076-4e60-aeb1-674acb673930","year":1996},"citing_paper":{"arxiv_id":"2507.22640","last_updated":"2025-07-30T12:58:02Z","snapshot_observed_at":"2026-08-07T13:21:29.570088Z","submitted_at":"2025-07-30T12:58:02Z","title":"Safe Deployment of Offline Reinforcement Learning via Input Convex Action Correction","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:18.102389Z"},"links":{"citing_paper":"/paper/2507.22640"},"observation_digest":"sha256:fb422a83ab72b803961b239bd65712ba0532916d6f10f05dffd4825890900562","observation_id":"37dbd767-c63b-4c32-a7f4-cfbedc629599","resolution":{"observed_at":"2026-08-06T11:34:27.725152Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.07152","last_updated":"2017-06-14T17:59:12Z","snapshot_observed_at":"2026-08-02T02:55:29.365709Z","submitted_at":"2016-09-22T20:10:57Z","title":"Input Convex Neural Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.07152","snapshot_observed_at":"2026-08-06T11:34:18.321318Z","title":"Input Convex Neural Networks,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.22640","last_updated":"2025-07-30T12:58:02Z","snapshot_observed_at":"2026-08-07T13:21:29.570088Z","submitted_at":"2025-07-30T12:58:02Z","title":"Safe Deployment of Offline Reinforcement Learning via Input Convex Action Correction","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:18.321318Z"},"links":{"cited_paper":"/paper/1609.07152","citing_paper":"/paper/2507.22640"},"observation_digest":"sha256:8b37b768b8d9365407cbbd8d4ff9a40fa8cb6adcea450e375ecb97ebccdc567b","observation_id":"eb5cd566-8ea5-4177-b7a8-d22666238a99","resolution":{"observed_at":"2026-08-06T11:34:18.321318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1705.08551","last_updated":"2017-11-13T18:49:54Z","snapshot_observed_at":"2026-07-06T05:44:01.217829Z","submitted_at":"2017-05-23T22:20:08Z","title":"Safe Model-based Reinforcement Learning with Stability Guarantees","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.08551","snapshot_observed_at":"2026-08-06T11:34:18.448416Z","title":"Safe Model-based Reinforcement Learning with Stability Guarantees,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.22640","last_updated":"2025-07-30T12:58:02Z","snapshot_observed_at":"2026-08-07T13:21:29.570088Z","submitted_at":"2025-07-30T12:58:02Z","title":"Safe Deployment of Offline Reinforcement Learning via Input Convex Action Correction","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:18.448416Z"},"links":{"cited_paper":"/paper/1705.08551","citing_paper":"/paper/2507.22640"},"observation_digest":"sha256:056d02e1ae1383831b4a6c3d0c1bab9f2ea7bca41a65b226bea9ae364cd224ab","observation_id":"aeeaa0b7-fca2-4bff-938c-093e73a7bd10","resolution":{"observed_at":"2026-08-06T11:34:18.448416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:34:27.401597Z","title":"Control Barrier Function Based Quadratic Pro- grams for Safety Critical Systems,","venue":null,"work_id":"ef8699cb-34fc-41ce-bd02-9c74c4e840bd","year":2017},"citing_paper":{"arxiv_id":"2507.22640","last_updated":"2025-07-30T12:58:02Z","snapshot_observed_at":"2026-08-07T13:21:29.570088Z","submitted_at":"2025-07-30T12:58:02Z","title":"Safe Deployment of Offline Reinforcement Learning via Input Convex Action Correction","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:18.607406Z"},"links":{"citing_paper":"/paper/2507.22640"},"observation_digest":"sha256:7db459972160a7871b09e5e7dfe7db94f140ec6716fac1167acd32ac38de9d23","observation_id":"dc70046b-ce11-4f08-afec-de8e3b61fd2f","resolution":{"observed_at":"2026-08-06T11:34:27.486926Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:34:27.150058Z","title":"Safe and Stable RL (S2RL) Driving Policies Using Control Barrier and Control Lyapunov Functions,","venue":null,"work_id":"599edd98-a29a-4478-928b-89da77891a44","year":2023},"citing_paper":{"arxiv_id":"2507.22640","last_updated":"2025-07-30T12:58:02Z","snapshot_observed_at":"2026-08-07T13:21:29.570088Z","submitted_at":"2025-07-30T12:58:02Z","title":"Safe Deployment of Offline Reinforcement Learning via Input Convex Action Correction","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:18.749875Z"},"links":{"citing_paper":"/paper/2507.22640"},"observation_digest":"sha256:66e3ac021cbe0fe89e3630619fc09662eb132b82d91946248dcd57176ea08261","observation_id":"a584b792-8643-44bb-8e73-9c5b521064e9","resolution":{"observed_at":"2026-08-06T11:34:27.279331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.10528","last_updated":"2017-05-30T10:07:31Z","snapshot_observed_at":"2026-07-06T05:44:47.772844Z","submitted_at":"2017-05-30T10:07:31Z","title":"Constrained Policy Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.10528","snapshot_observed_at":"2026-08-06T11:34:18.893392Z","title":"Constrained Policy Optimization,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.22640","last_updated":"2025-07-30T12:58:02Z","snapshot_observed_at":"2026-08-07T13:21:29.570088Z","submitted_at":"2025-07-30T12:58:02Z","title":"Safe Deployment of Offline Reinforcement Learning via Input Convex Action Correction","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:18.893392Z"},"links":{"cited_paper":"/paper/1705.10528","citing_paper":"/paper/2507.22640"},"observation_digest":"sha256:8bd4507382395b2580fe130e4f65e628441c5dab464ee29fdc09237e42f9ba9b","observation_id":"6fbb22bf-b6ad-4ad6-a4a7-bd1ad960f3de","resolution":{"observed_at":"2026-08-06T11:34:18.893392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.08757","last_updated":"2018-01-26T11:11:18Z","snapshot_observed_at":"2026-07-06T06:20:24.181731Z","submitted_at":"2018-01-26T11:11:18Z","title":"Safe Exploration in Continuous Action Spaces","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.08757","snapshot_observed_at":"2026-08-06T11:34:19.104125Z","title":"Safe Exploration in Continuous Action Spaces,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.22640","last_updated":"2025-07-30T12:58:02Z","snapshot_observed_at":"2026-08-07T13:21:29.570088Z","submitted_at":"2025-07-30T12:58:02Z","title":"Safe Deployment of Offline Reinforcement Learning via Input Convex Action Correction","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:19.104125Z"},"links":{"cited_paper":"/paper/1801.08757","citing_paper":"/paper/2507.22640"},"observation_digest":"sha256:e6f06952e98b5544f6a27433d081fb426f306f9c3d93fe76b055a17b1f2e77b8","observation_id":"3d6583d2-0b5b-4715-98a1-3576e07c9e16","resolution":{"observed_at":"2026-08-06T11:34:19.104125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04779","last_updated":"2020-08-19T17:07:05Z","snapshot_observed_at":"2026-08-05T14:26:27.718486Z","submitted_at":"2020-06-08T17:53:42Z","title":"Conservative Q-Learning for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.04779","snapshot_observed_at":"2026-08-06T11:34:19.197355Z","title":"Conservative Q-Learning for Offline Reinforcement Learning,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.22640","last_updated":"2025-07-30T12:58:02Z","snapshot_observed_at":"2026-08-07T13:21:29.570088Z","submitted_at":"2025-07-30T12:58:02Z","title":"Safe Deployment of Offline Reinforcement Learning via Input Convex Action Correction","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:19.197355Z"},"links":{"cited_paper":"/paper/2006.04779","citing_paper":"/paper/2507.22640"},"observation_digest":"sha256:6d78e614213655188fc972d82942dfb7367edfa4789dbd7fd016f2d632610551","observation_id":"10db63f3-0676-4291-8c36-01bea85205dc","resolution":{"observed_at":"2026-08-06T11:34:19.197355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.06169","last_updated":"2021-10-12T17:05:05Z","snapshot_observed_at":"2026-08-06T15:42:21.967989Z","submitted_at":"2021-10-12T17:05:05Z","title":"Offline Reinforcement Learning with Implicit Q-Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.06169","snapshot_observed_at":"2026-08-06T11:34:19.396964Z","title":"Offline Reinforcement Learning with Implicit Q-Learning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.22640","last_updated":"2025-07-30T12:58:02Z","snapshot_observed_at":"2026-08-07T13:21:29.570088Z","submitted_at":"2025-07-30T12:58:02Z","title":"Safe Deployment of Offline Reinforcement Learning via Input Convex Action Correction","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:19.396964Z"},"links":{"cited_paper":"/paper/2110.06169","citing_paper":"/paper/2507.22640"},"observation_digest":"sha256:0e65150cb29bef19b83a700b24fad2a5984d95c0585494cfe7be23480357507d","observation_id":"c007703d-cd76-4faa-97ee-60b7af00f21f","resolution":{"observed_at":"2026-08-06T11:34:19.396964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.13239","last_updated":"2020-11-22T07:04:17Z","snapshot_observed_at":"2026-08-06T03:32:02.156770Z","submitted_at":"2020-05-27T08:46:41Z","title":"MOPO: Model-based Offline Policy Optimization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.13239","snapshot_observed_at":"2026-08-06T11:34:19.560544Z","title":"MOPO: Model-based Offline Policy Optimization,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.22640","last_updated":"2025-07-30T12:58:02Z","snapshot_observed_at":"2026-08-07T13:21:29.570088Z","submitted_at":"2025-07-30T12:58:02Z","title":"Safe Deployment of Offline Reinforcement Learning via Input Convex Action Correction","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:19.560544Z"},"links":{"cited_paper":"/paper/2005.13239","citing_paper":"/paper/2507.22640"},"observation_digest":"sha256:cc36bd6c56c03c07d7b12881c7b7746d84191de3e943d7d645daaba2482a7383","observation_id":"cf93d61e-21ef-4c72-b842-e954f85b855f","resolution":{"observed_at":"2026-08-06T11:34:19.560544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2024.34162","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:34:24.150136Z","title":"Actor–Critic Physics-Informed Neural Lyapunov Con- trol,","venue":null,"work_id":"04b8ad31-39fc-4e2d-b1eb-7a076df646b8","year":2024},"citing_paper":{"arxiv_id":"2507.22640","last_updated":"2025-07-30T12:58:02Z","snapshot_observed_at":"2026-08-07T13:21:29.570088Z","submitted_at":"2025-07-30T12:58:02Z","title":"Safe Deployment of Offline Reinforcement Learning via Input Convex Action Correction","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:19.741550Z"},"links":{"citing_paper":"/paper/2507.22640"},"observation_digest":"sha256:cc0bd4d0e54a9127a12cfbb23b483e9a1e2e3b5fef5bda65e2a7e491d5ae1a68","observation_id":"4ccfd0f9-726d-4af3-afb6-4699c5e56739","resolution":{"observed_at":"2026-08-06T11:34:24.277113Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.10044","last_updated":"2017-10-27T09:35:26Z","snapshot_observed_at":"2026-08-04T16:01:11.564656Z","submitted_at":"2017-10-27T09:35:26Z","title":"Distributional Reinforcement Learning with Quantile Regression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.10044","snapshot_observed_at":"2026-08-06T11:34:19.925848Z","title":"Distributional Reinforcement Learning with Quantile Regression,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.22640","last_updated":"2025-07-30T12:58:02Z","snapshot_observed_at":"2026-08-07T13:21:29.570088Z","submitted_at":"2025-07-30T12:58:02Z","title":"Safe Deployment of Offline Reinforcement Learning via Input Convex Action Correction","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:19.925848Z"},"links":{"cited_paper":"/paper/1710.10044","citing_paper":"/paper/2507.22640"},"observation_digest":"sha256:56cba64b014281a3259526b94ecb1df016f68ff70745283c67795f9bb7d863b1","observation_id":"96778281-0ef6-4a6c-8dc0-c64a2fd2973b","resolution":{"observed_at":"2026-08-06T11:34:19.925848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:34:26.824733Z","title":"EKG-AC: A New Paradigm for Process Indus- trial Optimization Based on Offline Reinforcement Learning With Expert Knowledge Guidance,","venue":null,"work_id":"97b4f8e3-0378-48d3-bf92-17c3e9299733","year":2025},"citing_paper":{"arxiv_id":"2507.22640","last_updated":"2025-07-30T12:58:02Z","snapshot_observed_at":"2026-08-07T13:21:29.570088Z","submitted_at":"2025-07-30T12:58:02Z","title":"Safe Deployment of Offline Reinforcement Learning via Input Convex Action Correction","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:20.077489Z"},"links":{"citing_paper":"/paper/2507.22640"},"observation_digest":"sha256:538e45accd7e715d18b4890b6256602e16fa967d07a05f5defa42604458af8e9","observation_id":"370834ac-9400-41f1-a108-4603f8744f26","resolution":{"observed_at":"2026-08-06T11:34:27.022358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1805.11835","last_updated":"2019-02-26T19:58:06Z","snapshot_observed_at":"2026-07-06T06:41:58.596353Z","submitted_at":"2018-05-30T07:23:47Z","title":"Optimal Control Via Neural Networks: A Convex Approach","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.11835","snapshot_observed_at":"2026-08-06T11:34:20.306372Z","title":"Optimal Control Via Neural Networks: A Convex Approach,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.22640","last_updated":"2025-07-30T12:58:02Z","snapshot_observed_at":"2026-08-07T13:21:29.570088Z","submitted_at":"2025-07-30T12:58:02Z","title":"Safe Deployment of Offline Reinforcement Learning via Input Convex Action Correction","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:20.306372Z"},"links":{"cited_paper":"/paper/1805.11835","citing_paper":"/paper/2507.22640"},"observation_digest":"sha256:c1362414b925c5b58c3f8d6056c97031fc6652413960c91b8d07d2a2e316b90f","observation_id":"3826ad44-7d6d-4395-9796-201a044176c5","resolution":{"observed_at":"2026-08-06T11:34:20.306372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.12430","last_updated":"2019-10-28T04:08:18Z","snapshot_observed_at":"2026-07-06T08:32:36.484059Z","submitted_at":"2019-10-28T04:08:18Z","title":"Differentiable Convex Optimization Layers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.12430","snapshot_observed_at":"2026-08-06T11:34:20.442610Z","title":"Differentiable Convex Optimization Layers,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.22640","last_updated":"2025-07-30T12:58:02Z","snapshot_observed_at":"2026-08-07T13:21:29.570088Z","submitted_at":"2025-07-30T12:58:02Z","title":"Safe Deployment of Offline Reinforcement Learning via Input Convex Action Correction","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:20.442610Z"},"links":{"cited_paper":"/paper/1910.12430","citing_paper":"/paper/2507.22640"},"observation_digest":"sha256:bb8a2ec15c870276e8891d1074bd98ee79f6d67cc7e76972bd0260a398f9e221","observation_id":"feab1efd-3c40-4dfb-9e6a-13241dd895b7","resolution":{"observed_at":"2026-08-06T11:34:20.442610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:34:26.570835Z","title":"OptNet: Differentiable Optimization as a Layer in Neural Networks,","venue":null,"work_id":"100228e5-e438-4cfb-8aca-a021774e42d5","year":null},"citing_paper":{"arxiv_id":"2507.22640","last_updated":"2025-07-30T12:58:02Z","snapshot_observed_at":"2026-08-07T13:21:29.570088Z","submitted_at":"2025-07-30T12:58:02Z","title":"Safe Deployment of Offline Reinforcement Learning via Input Convex Action Correction","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:20.590273Z"},"links":{"citing_paper":"/paper/2507.22640"},"observation_digest":"sha256:44ec312b095f55022d601dc55db3714a88c2d33587c5258bb8f8685f4af8500c","observation_id":"cb8b85ae-3c1d-4330-9859-32c9be6729d1","resolution":{"observed_at":"2026-08-06T11:34:26.677000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:34:26.304656Z","title":"Polymer grade transition control using advanced real-time optimization software,","venue":null,"work_id":"661c3c9f-1248-49f9-a953-e94ec813d639","year":2004},"citing_paper":{"arxiv_id":"2507.22640","last_updated":"2025-07-30T12:58:02Z","snapshot_observed_at":"2026-08-07T13:21:29.570088Z","submitted_at":"2025-07-30T12:58:02Z","title":"Safe Deployment of Offline Reinforcement Learning via Input Convex Action Correction","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:20.937196Z"},"links":{"citing_paper":"/paper/2507.22640"},"observation_digest":"sha256:3cf551026218190af83df7871b8f46baac8a9cdc80143ec9c4cc8b1d870958e2","observation_id":"8d8fd4b8-b759-4fe9-89ab-822f849d849d","resolution":{"observed_at":"2026-08-06T11:34:26.431238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:34:26.073120Z","title":"Polymer grade transition control via reinforcement learning trained with a physically consistent memory sequence-to-sequence digital twin,","venue":null,"work_id":"a9937a4a-cdc3-4ce4-9293-f8bd5c83a5d0","year":2023},"citing_paper":{"arxiv_id":"2507.22640","last_updated":"2025-07-30T12:58:02Z","snapshot_observed_at":"2026-08-07T13:21:29.570088Z","submitted_at":"2025-07-30T12:58:02Z","title":"Safe Deployment of Offline Reinforcement Learning via Input Convex Action Correction","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:21.154028Z"},"links":{"citing_paper":"/paper/2507.22640"},"observation_digest":"sha256:46828ad917b9f0d213d63b89bd105bc5a5fbdfcd132ffdc9f522278a7783af88","observation_id":"f69c0586-8e19-4c5e-bd61-6aebe21db289","resolution":{"observed_at":"2026-08-06T11:34:26.193384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:34:25.834634Z","title":"A benchmark environment motivated by industrial control problems,","venue":null,"work_id":"51810df8-d104-4073-a412-a98b547029a4","year":2017},"citing_paper":{"arxiv_id":"2507.22640","last_updated":"2025-07-30T12:58:02Z","snapshot_observed_at":"2026-08-07T13:21:29.570088Z","submitted_at":"2025-07-30T12:58:02Z","title":"Safe Deployment of Offline Reinforcement Learning via Input Convex Action Correction","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:21.296216Z"},"links":{"citing_paper":"/paper/2507.22640"},"observation_digest":"sha256:cbf6e60a958fce83952da20b5977afe51e8adb02eac2afedb1510be432a9b3ca","observation_id":"0ba9b1af-a386-4ca0-b2af-30e290e13a68","resolution":{"observed_at":"2026-08-06T11:34:25.938005Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-07T14:18:01.067346Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01708","snapshot_observed_at":"2026-08-06T11:34:21.442854Z","title":"Benchmarking Safe Exploration in Deep Reinforcement Learning,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.22640","last_updated":"2025-07-30T12:58:02Z","snapshot_observed_at":"2026-08-07T13:21:29.570088Z","submitted_at":"2025-07-30T12:58:02Z","title":"Safe Deployment of Offline Reinforcement Learning via Input Convex Action Correction","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:21.442854Z"},"links":{"cited_paper":"/paper/1910.01708","citing_paper":"/paper/2507.22640"},"observation_digest":"sha256:1ba6eed0b3f3504e0b36080fa3fca24719aa4c37e4026500739e12e3d7f4605f","observation_id":"9e3f99c7-1864-46b0-97c3-b30cd9b1c067","resolution":{"observed_at":"2026-08-06T11:34:21.442854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.22093","last_updated":"2024-12-05T15:35:59Z","snapshot_observed_at":"2026-07-06T19:41:32.754401Z","submitted_at":"2024-10-29T14:49:26Z","title":"PC-Gym: Benchmark Environments For Process Control Problems","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.22093","snapshot_observed_at":"2026-08-06T11:34:21.584194Z","title":"PC-Gym: Benchmark Environments For Process Control Problems,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22640","last_updated":"2025-07-30T12:58:02Z","snapshot_observed_at":"2026-08-07T13:21:29.570088Z","submitted_at":"2025-07-30T12:58:02Z","title":"Safe Deployment of Offline Reinforcement Learning via Input Convex Action Correction","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:21.584194Z"},"links":{"cited_paper":"/paper/2410.22093","citing_paper":"/paper/2507.22640"},"observation_digest":"sha256:8df474ee1b39a8feedef942c25eb31aa26b8644eb75a0b0241db2945879f15fe","observation_id":"ef465ad6-a07f-4c36-8315-f2958d7f4a43","resolution":{"observed_at":"2026-08-06T11:34:21.584194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1903.08792","last_updated":"2019-03-21T01:29:14Z","snapshot_observed_at":"2026-07-06T07:40:40.139119Z","submitted_at":"2019-03-21T01:29:14Z","title":"End-to-End Safe Reinforcement Learning through Barrier Functions for Safety-Critical Continuous Control Tasks","version":1},"cited_work":{"arxiv_id":"1903.08792","doi":null,"metadata_source":"pith","pith_arxiv_id":"1903.08792","snapshot_observed_at":"2026-08-06T11:34:23.645691Z","title":"End-to-End Safe Reinforcement Learning through Barrier Functions for Safety-Critical Continuous Control Tasks","venue":"cs.LG","work_id":"65137756-99d3-4a01-990a-52dc7ee8a819","year":2019},"citing_paper":{"arxiv_id":"2507.22640","last_updated":"2025-07-30T12:58:02Z","snapshot_observed_at":"2026-08-07T13:21:29.570088Z","submitted_at":"2025-07-30T12:58:02Z","title":"Safe Deployment of Offline Reinforcement Learning via Input Convex Action Correction","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:21.799762Z"},"links":{"cited_paper":"/paper/1903.08792","citing_paper":"/paper/2507.22640"},"observation_digest":"sha256:e16fbbc4e239dbefcd948bc6248aa9b8f5f388ed6015b82acd5a99dae64b3825","observation_id":"eb487b2f-da8a-49e3-86a9-7867a95ee095","resolution":{"observed_at":"2026-08-06T11:34:23.746247Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:34:25.602809Z","title":"Offline reinforcement learning methods for real-world problems,","venue":null,"work_id":"3fa2233a-28b9-45b5-b443-b422b14a635e","year":2024},"citing_paper":{"arxiv_id":"2507.22640","last_updated":"2025-07-30T12:58:02Z","snapshot_observed_at":"2026-08-07T13:21:29.570088Z","submitted_at":"2025-07-30T12:58:02Z","title":"Safe Deployment of Offline Reinforcement Learning via Input Convex Action Correction","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:22.030643Z"},"links":{"citing_paper":"/paper/2507.22640"},"observation_digest":"sha256:26a39895ef60ae88fdf39e51ba7dbc454a0023d01c090b14e96543c4797a8ef5","observation_id":"203fd197-31c7-47a0-99e1-e90cc81eff2c","resolution":{"observed_at":"2026-08-06T11:34:25.709828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-06T11:34:22.256553Z","title":"Offline reinforcement learning: Tutorial, review, and perspectives on open problems,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2507.22640","last_updated":"2025-07-30T12:58:02Z","snapshot_observed_at":"2026-08-07T13:21:29.570088Z","submitted_at":"2025-07-30T12:58:02Z","title":"Safe Deployment of Offline Reinforcement Learning via Input Convex Action Correction","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:22.256553Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2507.22640"},"observation_digest":"sha256:e996a7784545f16716c04f3d6a8214e44b8a652b349101c4ba6cf023afd5b7a4","observation_id":"dae50e37-7c3d-4137-9e10-976a79f04421","resolution":{"observed_at":"2026-08-06T11:34:22.256553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:34:22.483538Z","title":"A survey on offline reinforcement learning: Taxonomy, review, and open problems,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22640","last_updated":"2025-07-30T12:58:02Z","snapshot_observed_at":"2026-08-07T13:21:29.570088Z","submitted_at":"2025-07-30T12:58:02Z","title":"Safe Deployment of Offline Reinforcement Learning via Input Convex Action Correction","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:22.483538Z"},"links":{"citing_paper":"/paper/2507.22640"},"observation_digest":"sha256:b43e814a99f37ce3e4cd4bd66510b18f5542e9123a5e9387a45de28302d2b3ba","observation_id":"fe6784ac-7e2f-4dcc-b52e-8fa68cd782bf","resolution":{"observed_at":"2026-08-06T11:34:22.483538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:34:25.420026Z","title":"Stabilizing off-policy q-learning via bootstrapping error reduction,","venue":null,"work_id":"88ff1205-944f-42cc-94c7-0b05ce2d1290","year":2019},"citing_paper":{"arxiv_id":"2507.22640","last_updated":"2025-07-30T12:58:02Z","snapshot_observed_at":"2026-08-07T13:21:29.570088Z","submitted_at":"2025-07-30T12:58:02Z","title":"Safe Deployment of Offline Reinforcement Learning via Input Convex Action Correction","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:22.678861Z"},"links":{"citing_paper":"/paper/2507.22640"},"observation_digest":"sha256:1424923c01d8dc7dfb0372cfbd462912758c34ad6abb130e886413e1dc54fcba","observation_id":"dce9edd8-9547-4c5a-8e76-9faad7a9eafd","resolution":{"observed_at":"2026-08-06T11:34:25.474108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1509.06461","last_updated":"2015-12-08T21:19:16Z","snapshot_observed_at":"2026-08-07T14:09:19.448496Z","submitted_at":"2015-09-22T04:40:22Z","title":"Deep Reinforcement Learning with Double Q-learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.06461","snapshot_observed_at":"2026-08-06T11:34:22.841058Z","title":"Deep Reinforcement Learning with Double Q-learning,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.22640","last_updated":"2025-07-30T12:58:02Z","snapshot_observed_at":"2026-08-07T13:21:29.570088Z","submitted_at":"2025-07-30T12:58:02Z","title":"Safe Deployment of Offline Reinforcement Learning via Input Convex Action Correction","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:22.841058Z"},"links":{"cited_paper":"/paper/1509.06461","citing_paper":"/paper/2507.22640"},"observation_digest":"sha256:c8902f822cefeca72ad244e7d7f2fee322799eda1ee7e3ef206e978f5d0506e7","observation_id":"bf7f5e39-0013-46cb-9550-a3bcbe6650ab","resolution":{"observed_at":"2026-08-06T11:34:22.841058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:34:25.135873Z","title":"Human-level control through deep reinforcement learning,","venue":null,"work_id":"0a1c8ebc-e6a2-4b28-9248-e6147eb09005","year":2015},"citing_paper":{"arxiv_id":"2507.22640","last_updated":"2025-07-30T12:58:02Z","snapshot_observed_at":"2026-08-07T13:21:29.570088Z","submitted_at":"2025-07-30T12:58:02Z","title":"Safe Deployment of Offline Reinforcement Learning via Input Convex Action Correction","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:23.006757Z"},"links":{"citing_paper":"/paper/2507.22640"},"observation_digest":"sha256:ee8b135cdc20a782db27fc4d0167d90bbf2c192d6c4642e4c064b6cdd98ac9e2","observation_id":"f22b21aa-dcd3-4daa-a3f5-ab7a82bb7621","resolution":{"observed_at":"2026-08-06T11:34:25.347910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-07-06T08:39:58.361914Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.11361","snapshot_observed_at":"2026-08-06T11:34:23.213288Z","title":"Behavior Regularized Offline Reinforcement Learning,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.22640","last_updated":"2025-07-30T12:58:02Z","snapshot_observed_at":"2026-08-07T13:21:29.570088Z","submitted_at":"2025-07-30T12:58:02Z","title":"Safe Deployment of Offline Reinforcement Learning via Input Convex Action Correction","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:23.213288Z"},"links":{"cited_paper":"/paper/1911.11361","citing_paper":"/paper/2507.22640"},"observation_digest":"sha256:59a7facbb4abc4a81e66343a503ca1e2d88f6476625d480d15c4ce299a8d70eb","observation_id":"2d55ea92-d8cd-437c-b857-b4e5247f3f56","resolution":{"observed_at":"2026-08-06T11:34:23.213288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.00177","last_updated":"2019-10-07T20:23:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-10-01T02:23:38Z","title":"Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.00177","snapshot_observed_at":"2026-08-06T11:34:23.313489Z","title":"Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.22640","last_updated":"2025-07-30T12:58:02Z","snapshot_observed_at":"2026-08-07T13:21:29.570088Z","submitted_at":"2025-07-30T12:58:02Z","title":"Safe Deployment of Offline Reinforcement Learning via Input Convex Action Correction","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:23.313489Z"},"links":{"cited_paper":"/paper/1910.00177","citing_paper":"/paper/2507.22640"},"observation_digest":"sha256:ecb82be04a1d344fb8dae89f111937583e28dadb6e8168a2fe4fd23ad2a77ce6","observation_id":"176e6c8e-b993-44a6-a594-cc0c91212bb0","resolution":{"observed_at":"2026-08-06T11:34:23.313489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:34:24.800522Z","title":"Comparative Study of Machine Learning and System Identification for Process Systems Engineering Dynamics,","venue":null,"work_id":"fd815786-9fe1-450e-a52b-5b7eadb1be7e","year":2025},"citing_paper":{"arxiv_id":"2507.22640","last_updated":"2025-07-30T12:58:02Z","snapshot_observed_at":"2026-08-07T13:21:29.570088Z","submitted_at":"2025-07-30T12:58:02Z","title":"Safe Deployment of Offline Reinforcement Learning via Input Convex Action Correction","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:23.365230Z"},"links":{"citing_paper":"/paper/2507.22640"},"observation_digest":"sha256:3b5034ea478dc9a6cf2eb606c4666fca96c646a43fba432037a21861649e853a","observation_id":"09431ac7-47f5-49c0-a3bc-9ec13e86c089","resolution":{"observed_at":"2026-08-06T11:34:25.000267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:34:24.549358Z","title":"Polymerization reactor control using autoregressive-plus Volterra- based MPC,","venue":null,"work_id":"ff59e605-6876-48fe-bc17-f21e183c7853","year":1997},"citing_paper":{"arxiv_id":"2507.22640","last_updated":"2025-07-30T12:58:02Z","snapshot_observed_at":"2026-08-07T13:21:29.570088Z","submitted_at":"2025-07-30T12:58:02Z","title":"Safe Deployment of Offline Reinforcement Learning via Input Convex Action Correction","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:23.413516Z"},"links":{"citing_paper":"/paper/2507.22640"},"observation_digest":"sha256:ec3e61ac0433248bf5e7726b0690dd859da0b9d76d2ce501f364f2b983e9eacd","observation_id":"bc6fd994-6286-4aed-8703-3ba5690351f0","resolution":{"observed_at":"2026-08-06T11:34:24.645311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1703.00443","last_updated":"2021-12-02T17:34:50Z","snapshot_observed_at":"2026-07-06T05:31:57.481191Z","submitted_at":"2017-03-01T18:58:48Z","title":"OptNet: Differentiable Optimization as a Layer in Neural Networks","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1703.00443","snapshot_observed_at":"2026-08-06T11:34:20.749099Z","title":"Available: https://arxiv.org/abs/1703.00443","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22640","last_updated":"2025-07-30T12:58:02Z","snapshot_observed_at":"2026-08-07T13:21:29.570088Z","submitted_at":"2025-07-30T12:58:02Z","title":"Safe Deployment of Offline Reinforcement Learning via Input Convex Action Correction","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:20.749099Z"},"links":{"cited_paper":"/paper/1703.00443","citing_paper":"/paper/2507.22640"},"observation_digest":"sha256:aba3f171c9a271bfdfe730c5a85c4201508fc6f3dfad0c2175038563deaa04de","observation_id":"8ff2815d-9103-4710-be2f-c89055b741cc","resolution":{"observed_at":"2026-08-06T11:34:20.749099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.22640","last_updated":"2025-07-30T12:58:02Z","latest_version":1,"primary_category":"eess.SY","snapshot_observed_at":"2026-08-07T13:21:29.570088Z","submitted_at":"2025-07-30T12:58:02Z","title":"Safe Deployment of Offline Reinforcement Learning via Input Convex Action Correction"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":20,"verified_exact":1,"verified_fuzzy":18},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 0 inbound Pith citation observations for arXiv:2507.22640."}