{"as_of":"2026-08-13T11:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d8547c8ec810f95312be2d8a1dcc095a55eac0c3773909d16fcc50ae35044ff9","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T17:33:37.721942Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.08880/citation-record","integrity":"/paper/2412.08880/integrity","json":"/paper/2412.08880/citation-record.json","paper":"/paper/2412.08880"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:33:37.528192Z","title":"Constrained policy optimization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.08880","last_updated":"2024-12-12T02:28:50Z","snapshot_observed_at":"2026-08-13T09:30:08.901877Z","submitted_at":"2024-12-12T02:28:50Z","title":"FAWAC: Feasibility Informed Advantage Weighted Regression for Persistent Safety in Offline Reinforcement Learning","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-11T17:33:37.528192Z"},"links":{"citing_paper":"/paper/2412.08880"},"observation_digest":"sha256:dbac4f5de9b6729f250bcc461190495afbb243a2915457a77444f8f1f4954710","observation_id":"484da714-e99a-4520-b896-f63ea4633c16","resolution":{"observed_at":"2026-08-11T17:33:37.528192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:33:38.301684Z","title":"Maximum entropy inverse reinforcement learning in continuous state spaces with path integrals","venue":null,"work_id":"1fcba39b-8c0e-4f2a-98ef-bdbd88d7c0a0","year":2011},"citing_paper":{"arxiv_id":"2412.08880","last_updated":"2024-12-12T02:28:50Z","snapshot_observed_at":"2026-08-13T09:30:08.901877Z","submitted_at":"2024-12-12T02:28:50Z","title":"FAWAC: Feasibility Informed Advantage Weighted Regression for Persistent Safety in Offline Reinforcement Learning","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-11T17:33:37.534971Z"},"links":{"citing_paper":"/paper/2412.08880"},"observation_digest":"sha256:24a272ca0881017a7e088ab91e07fbdfffed691517e236c21360970fc1526c85","observation_id":"614de274-5e77-4761-80bf-c28644564dc3","resolution":{"observed_at":"2026-08-11T17:33:38.307332Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:33:38.284029Z","title":"Constrained markov decision processes with total cost criteria: Lagrangian approach and dual linear program","venue":null,"work_id":"fe7de8a1-d67e-44a5-92f2-da73b04e10f2","year":1998},"citing_paper":{"arxiv_id":"2412.08880","last_updated":"2024-12-12T02:28:50Z","snapshot_observed_at":"2026-08-13T09:30:08.901877Z","submitted_at":"2024-12-12T02:28:50Z","title":"FAWAC: Feasibility Informed Advantage Weighted Regression for Persistent Safety in Offline Reinforcement Learning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-11T17:33:37.540639Z"},"links":{"citing_paper":"/paper/2412.08880"},"observation_digest":"sha256:9e24a086bbe5ec56aea63c11605f7e8b7ea6024a4f52c2584c3b005c8f15f927","observation_id":"a791a083-db0d-40e6-93c3-9d19b8d87889","resolution":{"observed_at":"2026-08-11T17:33:38.289432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:33:37.547006Z","title":"Constrained Markov decision processes","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.08880","last_updated":"2024-12-12T02:28:50Z","snapshot_observed_at":"2026-08-13T09:30:08.901877Z","submitted_at":"2024-12-12T02:28:50Z","title":"FAWAC: Feasibility Informed Advantage Weighted Regression for Persistent Safety in Offline Reinforcement Learning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-11T17:33:37.547006Z"},"links":{"citing_paper":"/paper/2412.08880"},"observation_digest":"sha256:b05843a4d27cbf5c1c853f3c38a7c25985be680a78fa2928f53b20b06105710f","observation_id":"1db5df65-eda1-4c92-9873-86c4032d64d4","resolution":{"observed_at":"2026-08-11T17:33:37.547006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:33:37.552930Z","title":"Convex optimization","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2412.08880","last_updated":"2024-12-12T02:28:50Z","snapshot_observed_at":"2026-08-13T09:30:08.901877Z","submitted_at":"2024-12-12T02:28:50Z","title":"FAWAC: Feasibility Informed Advantage Weighted Regression for Persistent Safety in Offline Reinforcement Learning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-11T17:33:37.552930Z"},"links":{"citing_paper":"/paper/2412.08880"},"observation_digest":"sha256:95d3c02ba2a8c43e5c5e2966757b00a696cda5f505741148dd2c4371121dc115","observation_id":"636cafb2-0f7b-4233-ad75-f1032fce1913","resolution":{"observed_at":"2026-08-11T17:33:37.552930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:33:37.558683Z","title":"Decision transformer: Reinforcement learning via sequence modeling","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.08880","last_updated":"2024-12-12T02:28:50Z","snapshot_observed_at":"2026-08-13T09:30:08.901877Z","submitted_at":"2024-12-12T02:28:50Z","title":"FAWAC: Feasibility Informed Advantage Weighted Regression for Persistent Safety in Offline Reinforcement Learning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-11T17:33:37.558683Z"},"links":{"citing_paper":"/paper/2412.08880"},"observation_digest":"sha256:2ec5990f97197489f55890ab9d86d1b2a88509053cacca242f1f2da5a0465453","observation_id":"93c8ef20-0422-4cfb-86d2-28ba9d322c2a","resolution":{"observed_at":"2026-08-11T17:33:37.558683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:33:37.564869Z","title":"Pybullet, a python module for physics simulation for games, robotics and machine learning, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.08880","last_updated":"2024-12-12T02:28:50Z","snapshot_observed_at":"2026-08-13T09:30:08.901877Z","submitted_at":"2024-12-12T02:28:50Z","title":"FAWAC: Feasibility Informed Advantage Weighted Regression for Persistent Safety in Offline Reinforcement Learning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-11T17:33:37.564869Z"},"links":{"citing_paper":"/paper/2412.08880"},"observation_digest":"sha256:5b604a76e7533183e79b34691864ef57b0904a0b9bb10c2d08a2cfb7eed9c7a4","observation_id":"6b258255-db0c-43f1-a7bd-bd18cb70c4f6","resolution":{"observed_at":"2026-08-11T17:33:37.564869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:33:38.220692Z","title":"Directional differentiability of optimal solutions under slater's condition","venue":null,"work_id":"bac436f4-d800-4bff-b1fe-95a3ca0f0784","year":1993},"citing_paper":{"arxiv_id":"2412.08880","last_updated":"2024-12-12T02:28:50Z","snapshot_observed_at":"2026-08-13T09:30:08.901877Z","submitted_at":"2024-12-12T02:28:50Z","title":"FAWAC: Feasibility Informed Advantage Weighted Regression for Persistent Safety in Offline Reinforcement Learning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T17:33:37.569920Z"},"links":{"citing_paper":"/paper/2412.08880"},"observation_digest":"sha256:606f3782669ac80424807135371f26a2104c8b5bcd8f0e6ec68c98c89d7f7880","observation_id":"9256cbd1-13c6-4efa-8f2c-b3a2e828c268","resolution":{"observed_at":"2026-08-11T17:33:38.226032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1902.06766","last_updated":"2019-02-18T19:10:18Z","snapshot_observed_at":"2026-07-31T21:25:58.208547Z","submitted_at":"2019-02-18T19:10:18Z","title":"Parenting: Safe Reinforcement Learning from Human Input","version":1},"cited_work":{"arxiv_id":"1902.06766","doi":null,"metadata_source":"pith","pith_arxiv_id":"1902.06766","snapshot_observed_at":"2026-08-11T17:33:37.999325Z","title":"Parenting: Safe Reinforcement Learning from Human Input","venue":"cs.AI","work_id":"c0ca60fb-0729-4388-ba15-8eb4ad8a69ff","year":2019},"citing_paper":{"arxiv_id":"2412.08880","last_updated":"2024-12-12T02:28:50Z","snapshot_observed_at":"2026-08-13T09:30:08.901877Z","submitted_at":"2024-12-12T02:28:50Z","title":"FAWAC: Feasibility Informed Advantage Weighted Regression for Persistent Safety in Offline Reinforcement Learning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T17:33:37.574512Z"},"links":{"cited_paper":"/paper/1902.06766","citing_paper":"/paper/2412.08880"},"observation_digest":"sha256:9d53292f37ee4c3748b259aa7994f1200673a72d92d461ce2da3517a7dc2a3bb","observation_id":"71a64338-d0d0-4560-ad92-c457ed052236","resolution":{"observed_at":"2026-08-11T17:33:38.005117Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:33:37.580345Z","title":"A comprehensive survey on safe reinforcement learning","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.08880","last_updated":"2024-12-12T02:28:50Z","snapshot_observed_at":"2026-08-13T09:30:08.901877Z","submitted_at":"2024-12-12T02:28:50Z","title":"FAWAC: Feasibility Informed Advantage Weighted Regression for Persistent Safety in Offline Reinforcement Learning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-11T17:33:37.580345Z"},"links":{"citing_paper":"/paper/2412.08880"},"observation_digest":"sha256:5f86abcd6a902cdc06992c639435959b693ceeb8f89ebefe5e85f78202963f46","observation_id":"0deffe96-4c7c-4b64-bbfd-34b362135362","resolution":{"observed_at":"2026-08-11T17:33:37.580345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:33:38.194830Z","title":"A primal-dual augmented lagrangian","venue":null,"work_id":"577889bf-c127-4b36-8da1-a4ddc85ef4c7","year":2012},"citing_paper":{"arxiv_id":"2412.08880","last_updated":"2024-12-12T02:28:50Z","snapshot_observed_at":"2026-08-13T09:30:08.901877Z","submitted_at":"2024-12-12T02:28:50Z","title":"FAWAC: Feasibility Informed Advantage Weighted Regression for Persistent Safety in Offline Reinforcement Learning","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-11T17:33:37.585226Z"},"links":{"citing_paper":"/paper/2412.08880"},"observation_digest":"sha256:f699335d0f88a6d9a3f29cfe5811f1f4e52af3ce7b100024eaf28c46a8351723","observation_id":"1d1f6f5a-aa67-4549-8be7-782a782f91a4","resolution":{"observed_at":"2026-08-11T17:33:38.199580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:33:37.592440Z","title":"Bullet-safety-gym: A framework for constrained reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.08880","last_updated":"2024-12-12T02:28:50Z","snapshot_observed_at":"2026-08-13T09:30:08.901877Z","submitted_at":"2024-12-12T02:28:50Z","title":"FAWAC: Feasibility Informed Advantage Weighted Regression for Persistent Safety in Offline Reinforcement Learning","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T17:33:37.592440Z"},"links":{"citing_paper":"/paper/2412.08880"},"observation_digest":"sha256:b1eac3e2b80d68535aba6515ea1f9b7799029aad2efee34b0cf7a90019e428bd","observation_id":"c38cf8b3-58f2-4f41-9428-ffadf8c3f167","resolution":{"observed_at":"2026-08-11T17:33:37.592440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.10330","last_updated":"2024-05-24T22:33:04Z","snapshot_observed_at":"2026-08-10T17:16:29.612396Z","submitted_at":"2022-05-20T17:42:38Z","title":"A Review of Safe Reinforcement Learning: Methods, Theory and Applications","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.10330","snapshot_observed_at":"2026-08-11T17:33:37.597399Z","title":"A review of safe reinforcement learning: Methods, theory and applications","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.08880","last_updated":"2024-12-12T02:28:50Z","snapshot_observed_at":"2026-08-13T09:30:08.901877Z","submitted_at":"2024-12-12T02:28:50Z","title":"FAWAC: Feasibility Informed Advantage Weighted Regression for Persistent Safety in Offline Reinforcement Learning","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T17:33:37.597399Z"},"links":{"cited_paper":"/paper/2205.10330","citing_paper":"/paper/2412.08880"},"observation_digest":"sha256:1a15ffc889004889bae712e8f9cb11ff78c7f1a56a830e338b76f5985c162058","observation_id":"8643a124-d913-4c15-9b1b-750249d9db3b","resolution":{"observed_at":"2026-08-11T17:33:37.597399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:33:37.602358Z","title":"Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.08880","last_updated":"2024-12-12T02:28:50Z","snapshot_observed_at":"2026-08-13T09:30:08.901877Z","submitted_at":"2024-12-12T02:28:50Z","title":"FAWAC: Feasibility Informed Advantage Weighted Regression for Persistent Safety in Offline Reinforcement Learning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-11T17:33:37.602358Z"},"links":{"citing_paper":"/paper/2412.08880"},"observation_digest":"sha256:5c274bf25cec5fbb596f02e1464c9d7fc9e633640f1c585c99107ef834ed3f5b","observation_id":"5ee64d99-f8cb-4f9c-9fd2-da6482429ed3","resolution":{"observed_at":"2026-08-11T17:33:37.602358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.06169","last_updated":"2021-10-12T17:05:05Z","snapshot_observed_at":"2026-08-13T07:57:56.087944Z","submitted_at":"2021-10-12T17:05:05Z","title":"Offline Reinforcement Learning with Implicit Q-Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.06169","snapshot_observed_at":"2026-08-11T17:33:37.606897Z","title":"Offline reinforcement learning with implicit q-learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.08880","last_updated":"2024-12-12T02:28:50Z","snapshot_observed_at":"2026-08-13T09:30:08.901877Z","submitted_at":"2024-12-12T02:28:50Z","title":"FAWAC: Feasibility Informed Advantage Weighted Regression for Persistent Safety in Offline Reinforcement Learning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-11T17:33:37.606897Z"},"links":{"cited_paper":"/paper/2110.06169","citing_paper":"/paper/2412.08880"},"observation_digest":"sha256:0b31848eba93d671e772335356ddd41bcee0d9f7795c5786fd048b121ae3c1ee","observation_id":"866f1926-a3d6-47a9-aa85-735a1e3990d0","resolution":{"observed_at":"2026-08-11T17:33:37.606897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:33:37.612195Z","title":"Conservative q-learning for offline reinforcement learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.08880","last_updated":"2024-12-12T02:28:50Z","snapshot_observed_at":"2026-08-13T09:30:08.901877Z","submitted_at":"2024-12-12T02:28:50Z","title":"FAWAC: Feasibility Informed Advantage Weighted Regression for Persistent Safety in Offline Reinforcement Learning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-11T17:33:37.612195Z"},"links":{"citing_paper":"/paper/2412.08880"},"observation_digest":"sha256:604d925d16da44d304213044bd1715b5479a813e1040ba7845055733ef72690d","observation_id":"a0e80708-02c8-4cf3-8516-cc6f0c593526","resolution":{"observed_at":"2026-08-11T17:33:37.612195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:33:38.147424Z","title":"Optidice: Offline policy optimization via stationary distribution correction estimation","venue":null,"work_id":"94af0ad5-7caa-44c7-8892-d9b91d4b4722","year":2021},"citing_paper":{"arxiv_id":"2412.08880","last_updated":"2024-12-12T02:28:50Z","snapshot_observed_at":"2026-08-13T09:30:08.901877Z","submitted_at":"2024-12-12T02:28:50Z","title":"FAWAC: Feasibility Informed Advantage Weighted Regression for Persistent Safety in Offline Reinforcement Learning","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-11T17:33:37.617099Z"},"links":{"citing_paper":"/paper/2412.08880"},"observation_digest":"sha256:b463b411e1bb0cef1ff83043fe3d13163fe6e61d93a48ca6bf6365f70d864964","observation_id":"6f5cde42-7188-4a64-b4b7-cf4fa14bf058","resolution":{"observed_at":"2026-08-11T17:33:38.152117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.08957","last_updated":"2022-04-19T15:55:47Z","snapshot_observed_at":"2026-08-12T20:40:31.456442Z","submitted_at":"2022-04-19T15:55:47Z","title":"COptiDICE: Offline Constrained Reinforcement Learning via Stationary Distribution Correction Estimation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.08957","snapshot_observed_at":"2026-08-11T17:33:37.622251Z","title":"Coptidice: Offline constrained reinforcement learning via stationary distribution correction estimation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.08880","last_updated":"2024-12-12T02:28:50Z","snapshot_observed_at":"2026-08-13T09:30:08.901877Z","submitted_at":"2024-12-12T02:28:50Z","title":"FAWAC: Feasibility Informed Advantage Weighted Regression for Persistent Safety in Offline Reinforcement Learning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-11T17:33:37.622251Z"},"links":{"cited_paper":"/paper/2204.08957","citing_paper":"/paper/2412.08880"},"observation_digest":"sha256:d1a1f9e2b67641ede39f9e95d1230adb6f9872bd46839ec1727daf08b4d61b88","observation_id":"14972fe8-b442-4a3d-9485-393ac1488e1b","resolution":{"observed_at":"2026-08-11T17:33:37.622251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-11T17:33:37.628179Z","title":"Offline reinforcement learning: Tutorial, review, and perspectives on open problems","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2412.08880","last_updated":"2024-12-12T02:28:50Z","snapshot_observed_at":"2026-08-13T09:30:08.901877Z","submitted_at":"2024-12-12T02:28:50Z","title":"FAWAC: Feasibility Informed Advantage Weighted Regression for Persistent Safety in Offline Reinforcement Learning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-11T17:33:37.628179Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2412.08880"},"observation_digest":"sha256:cca1612a445dde717a323b0f2dad12ca80e2612bcf83427dce74ba3bf4ffdb5d","observation_id":"f31ca234-8c65-48e2-ae24-d88c464fbdfd","resolution":{"observed_at":"2026-08-11T17:33:37.628179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09303","last_updated":"2023-06-16T17:54:06Z","snapshot_observed_at":"2026-08-13T11:15:49.659373Z","submitted_at":"2023-06-15T17:31:26Z","title":"Datasets and Benchmarks for Offline Safe Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09303","snapshot_observed_at":"2026-08-11T17:33:37.634783Z","title":"Datasets and benchmarks for offline safe reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08880","last_updated":"2024-12-12T02:28:50Z","snapshot_observed_at":"2026-08-13T09:30:08.901877Z","submitted_at":"2024-12-12T02:28:50Z","title":"FAWAC: Feasibility Informed Advantage Weighted Regression for Persistent Safety in Offline Reinforcement Learning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-11T17:33:37.634783Z"},"links":{"cited_paper":"/paper/2306.09303","citing_paper":"/paper/2412.08880"},"observation_digest":"sha256:b961d76d236954a1931ea3bf1ef56331639346d35df79226e1100b33d8def51f","observation_id":"33bf6911-2cbc-4a33-befc-e5bf0747f0d2","resolution":{"observed_at":"2026-08-11T17:33:37.634783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:33:38.132585Z","title":"Constrained decision transformer for offline safe reinforcement learning","venue":null,"work_id":"1474f60e-f1d8-4e52-9512-f93dafbea7e7","year":2023},"citing_paper":{"arxiv_id":"2412.08880","last_updated":"2024-12-12T02:28:50Z","snapshot_observed_at":"2026-08-13T09:30:08.901877Z","submitted_at":"2024-12-12T02:28:50Z","title":"FAWAC: Feasibility Informed Advantage Weighted Regression for Persistent Safety in Offline Reinforcement Learning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-11T17:33:37.640165Z"},"links":{"citing_paper":"/paper/2412.08880"},"observation_digest":"sha256:57df5f872127c5a04392c6b117b742636ea1f2d477ee2b16954835a5c7b2676a","observation_id":"1f0345e2-16b3-4acb-9857-da80b41b1e4f","resolution":{"observed_at":"2026-08-11T17:33:38.137434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.10682","last_updated":"2021-06-14T04:07:36Z","snapshot_observed_at":"2026-07-06T11:11:48.611160Z","submitted_at":"2021-05-22T10:40:58Z","title":"Feasible Actor-Critic: Constrained Reinforcement Learning for Ensuring Statewise Safety","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.10682","snapshot_observed_at":"2026-08-11T17:33:37.645535Z","title":"Feasible actor-critic: Constrained reinforcement learning for ensuring statewise safety","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.08880","last_updated":"2024-12-12T02:28:50Z","snapshot_observed_at":"2026-08-13T09:30:08.901877Z","submitted_at":"2024-12-12T02:28:50Z","title":"FAWAC: Feasibility Informed Advantage Weighted Regression for Persistent Safety in Offline Reinforcement Learning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-11T17:33:37.645535Z"},"links":{"cited_paper":"/paper/2105.10682","citing_paper":"/paper/2412.08880"},"observation_digest":"sha256:9219ae74c5455844b0e4062317b3a738de1ce259443be1d6994db588801a9e0b","observation_id":"16d8aabc-e554-40fc-a42a-dc56489c2632","resolution":{"observed_at":"2026-08-11T17:33:37.645535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.09359","last_updated":"2021-04-24T22:39:30Z","snapshot_observed_at":"2026-07-06T09:29:45.475911Z","submitted_at":"2020-06-16T17:54:41Z","title":"AWAC: Accelerating Online Reinforcement Learning with Offline Datasets","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.09359","snapshot_observed_at":"2026-08-11T17:33:37.650823Z","title":"Awac: Accelerating online reinforcement learning with offline datasets","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2412.08880","last_updated":"2024-12-12T02:28:50Z","snapshot_observed_at":"2026-08-13T09:30:08.901877Z","submitted_at":"2024-12-12T02:28:50Z","title":"FAWAC: Feasibility Informed Advantage Weighted Regression for Persistent Safety in Offline Reinforcement Learning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-11T17:33:37.650823Z"},"links":{"cited_paper":"/paper/2006.09359","citing_paper":"/paper/2412.08880"},"observation_digest":"sha256:209b19e5817d309b608d8e823c8c25a20a56f5a7fde5851e599bf97a28be896e","observation_id":"cffaf56a-76eb-496b-89f8-c54cafa1ff6c","resolution":{"observed_at":"2026-08-11T17:33:37.650823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.00177","last_updated":"2019-10-07T20:23:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-10-01T02:23:38Z","title":"Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.00177","snapshot_observed_at":"2026-08-11T17:33:37.656127Z","title":"Advantage-weighted regression: Simple and scalable off-policy reinforcement learning","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2412.08880","last_updated":"2024-12-12T02:28:50Z","snapshot_observed_at":"2026-08-13T09:30:08.901877Z","submitted_at":"2024-12-12T02:28:50Z","title":"FAWAC: Feasibility Informed Advantage Weighted Regression for Persistent Safety in Offline Reinforcement Learning","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-11T17:33:37.656127Z"},"links":{"cited_paper":"/paper/1910.00177","citing_paper":"/paper/2412.08880"},"observation_digest":"sha256:bb8055d3fc9d7a330c8834685b1c5f8d59a8106331ade15bb5a8a179bb316baf","observation_id":"a21cab1a-23d3-4346-9d9e-152408a0540a","resolution":{"observed_at":"2026-08-11T17:33:37.656127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1502.05477","last_updated":"2017-04-20T18:04:12Z","snapshot_observed_at":"2026-07-06T04:09:39.172428Z","submitted_at":"2015-02-19T06:44:25Z","title":"Trust Region Policy Optimization","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1502.05477","snapshot_observed_at":"2026-08-11T17:33:37.661644Z","title":"Trust region policy optimization","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.08880","last_updated":"2024-12-12T02:28:50Z","snapshot_observed_at":"2026-08-13T09:30:08.901877Z","submitted_at":"2024-12-12T02:28:50Z","title":"FAWAC: Feasibility Informed Advantage Weighted Regression for Persistent Safety in Offline Reinforcement Learning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-11T17:33:37.661644Z"},"links":{"cited_paper":"/paper/1502.05477","citing_paper":"/paper/2412.08880"},"observation_digest":"sha256:b7874cd89e6875b8761a8b25874a32ba0b57276124d10c0d95a838efdacfcaea","observation_id":"e4adc729-f884-4777-bc6c-968f6d854617","resolution":{"observed_at":"2026-08-11T17:33:37.661644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1704.06440","last_updated":"2018-10-14T22:54:38Z","snapshot_observed_at":"2026-08-05T07:10:19.910840Z","submitted_at":"2017-04-21T08:33:59Z","title":"Equivalence Between Policy Gradients and Soft Q-Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.06440","snapshot_observed_at":"2026-08-11T17:33:37.667394Z","title":"Equivalence between policy gradients and soft q-learning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.08880","last_updated":"2024-12-12T02:28:50Z","snapshot_observed_at":"2026-08-13T09:30:08.901877Z","submitted_at":"2024-12-12T02:28:50Z","title":"FAWAC: Feasibility Informed Advantage Weighted Regression for Persistent Safety in Offline Reinforcement Learning","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-11T17:33:37.667394Z"},"links":{"cited_paper":"/paper/1704.06440","citing_paper":"/paper/2412.08880"},"observation_digest":"sha256:ee110df0bc784fb3017dbd13c3012a4c22137b2c21a9c350f4d7d396e89323dc","observation_id":"cccddb50-a740-4495-9b42-15adee25b7c5","resolution":{"observed_at":"2026-08-11T17:33:37.667394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:33:38.113943Z","title":"Responsive safety in reinforcement learning by pid lagrangian methods","venue":null,"work_id":"9faf2143-a64d-41f0-b862-fb64f04e22f4","year":2020},"citing_paper":{"arxiv_id":"2412.08880","last_updated":"2024-12-12T02:28:50Z","snapshot_observed_at":"2026-08-13T09:30:08.901877Z","submitted_at":"2024-12-12T02:28:50Z","title":"FAWAC: Feasibility Informed Advantage Weighted Regression for Persistent Safety in Offline Reinforcement Learning","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-11T17:33:37.672685Z"},"links":{"citing_paper":"/paper/2412.08880"},"observation_digest":"sha256:5fe9b24b3fe707a55bfca21b25d0b7d846ab9caf0b273dd5aafe5eb10792dc46","observation_id":"3e162c79-8e30-482d-a879-d855d690bc2a","resolution":{"observed_at":"2026-08-11T17:33:38.120946Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:33:38.096365Z","title":"Constraints penalized q-learning for safe offline reinforcement learning","venue":null,"work_id":"a18669f3-4226-456b-a8df-e5be628b75da","year":2022},"citing_paper":{"arxiv_id":"2412.08880","last_updated":"2024-12-12T02:28:50Z","snapshot_observed_at":"2026-08-13T09:30:08.901877Z","submitted_at":"2024-12-12T02:28:50Z","title":"FAWAC: Feasibility Informed Advantage Weighted Regression for Persistent Safety in Offline Reinforcement Learning","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-11T17:33:37.678677Z"},"links":{"citing_paper":"/paper/2412.08880"},"observation_digest":"sha256:978dfc01cf34202bb3c8b9df66e2d7699c5e9e743831109b44d6e2f3d769dc2a","observation_id":"6216db71-c306-4fbf-8ee6-4d198cb6b999","resolution":{"observed_at":"2026-08-11T17:33:38.101582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:33:38.079859Z","title":"Primal-dual stochastic gradient method for convex programs with many functional constraints","venue":null,"work_id":"7fecd402-d2d0-4454-bc7d-58bce4543412","year":2020},"citing_paper":{"arxiv_id":"2412.08880","last_updated":"2024-12-12T02:28:50Z","snapshot_observed_at":"2026-08-13T09:30:08.901877Z","submitted_at":"2024-12-12T02:28:50Z","title":"FAWAC: Feasibility Informed Advantage Weighted Regression for Persistent Safety in Offline Reinforcement Learning","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-11T17:33:37.684038Z"},"links":{"citing_paper":"/paper/2412.08880"},"observation_digest":"sha256:2ce12888e92b68efbc50c6d0b973793f630c9fc3bfcd1cfc4f8ac8ecd2c032e3","observation_id":"d0a69486-bf64-44aa-aa04-b430122cc777","resolution":{"observed_at":"2026-08-11T17:33:38.085356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14653","last_updated":"2024-07-19T20:15:00Z","snapshot_observed_at":"2026-08-12T23:18:22.147663Z","submitted_at":"2024-07-19T20:15:00Z","title":"OASIS: Conditional Distribution Shaping for Offline Safe Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2407.14653","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.14653","snapshot_observed_at":"2026-08-11T17:33:37.799089Z","title":"OASIS: Conditional Distribution Shaping for Offline Safe Reinforcement Learning","venue":"cs.LG","work_id":"882aa696-8536-4281-b93a-b1fcfa2e0342","year":2024},"citing_paper":{"arxiv_id":"2412.08880","last_updated":"2024-12-12T02:28:50Z","snapshot_observed_at":"2026-08-13T09:30:08.901877Z","submitted_at":"2024-12-12T02:28:50Z","title":"FAWAC: Feasibility Informed Advantage Weighted Regression for Persistent Safety in Offline Reinforcement Learning","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-11T17:33:37.689199Z"},"links":{"cited_paper":"/paper/2407.14653","citing_paper":"/paper/2412.08880"},"observation_digest":"sha256:d1bacf4ce054d207cd34121a153e4964183f06edbd1404d9d9c4223af1df4bc8","observation_id":"9eabaaed-dbf7-44b9-86f4-8d62f22dc0ca","resolution":{"observed_at":"2026-08-11T17:33:37.808510Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:33:38.062323Z","title":"Reachability constrained reinforcement learning","venue":null,"work_id":"c22e7122-31c6-4b18-836a-eb0095e68af5","year":2022},"citing_paper":{"arxiv_id":"2412.08880","last_updated":"2024-12-12T02:28:50Z","snapshot_observed_at":"2026-08-13T09:30:08.901877Z","submitted_at":"2024-12-12T02:28:50Z","title":"FAWAC: Feasibility Informed Advantage Weighted Regression for Persistent Safety in Offline Reinforcement Learning","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-11T17:33:37.695599Z"},"links":{"citing_paper":"/paper/2412.08880"},"observation_digest":"sha256:d406198a1528ae7240ed03b117b5626a0672d5d42a78bcd30239720dd5f9b0be","observation_id":"0e665c63-23ba-468e-a65e-3daf84174d1d","resolution":{"observed_at":"2026-08-11T17:33:38.067425Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.11814","last_updated":"2022-06-17T02:39:04Z","snapshot_observed_at":"2026-08-12T20:44:52.583449Z","submitted_at":"2022-05-24T06:15:51Z","title":"Penalized Proximal Policy Optimization for Safe Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.11814","snapshot_observed_at":"2026-08-11T17:33:37.700628Z","title":"Penalized proximal policy optimization for safe reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.08880","last_updated":"2024-12-12T02:28:50Z","snapshot_observed_at":"2026-08-13T09:30:08.901877Z","submitted_at":"2024-12-12T02:28:50Z","title":"FAWAC: Feasibility Informed Advantage Weighted Regression for Persistent Safety in Offline Reinforcement Learning","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-11T17:33:37.700628Z"},"links":{"cited_paper":"/paper/2205.11814","citing_paper":"/paper/2412.08880"},"observation_digest":"sha256:9b2ccec88afc5dcb667c7c00c3052d48897676324c38b0edda648c28a6e41130","observation_id":"8f5e93cf-c4d0-48de-afad-450c830f1720","resolution":{"observed_at":"2026-08-11T17:33:37.700628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:33:38.045190Z","title":"Evaluating model-free reinforcement learning toward safety-critical tasks","venue":null,"work_id":"804501f8-a095-46dc-b155-e68b2641b40b","year":2023},"citing_paper":{"arxiv_id":"2412.08880","last_updated":"2024-12-12T02:28:50Z","snapshot_observed_at":"2026-08-13T09:30:08.901877Z","submitted_at":"2024-12-12T02:28:50Z","title":"FAWAC: Feasibility Informed Advantage Weighted Regression for Persistent Safety in Offline Reinforcement Learning","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-11T17:33:37.706021Z"},"links":{"citing_paper":"/paper/2412.08880"},"observation_digest":"sha256:f77a3cf3d9085fc9cff057c1fce376ca67431bfcd384fb5883c8b8bed438f876","observation_id":"b5486b46-e347-47f7-9837-461c07eaa0ff","resolution":{"observed_at":"2026-08-11T17:33:38.050910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:33:38.028518Z","title":"First order constrained optimization in policy space","venue":null,"work_id":"a47a423f-a699-4093-ad00-ed01b8b8c949","year":2020},"citing_paper":{"arxiv_id":"2412.08880","last_updated":"2024-12-12T02:28:50Z","snapshot_observed_at":"2026-08-13T09:30:08.901877Z","submitted_at":"2024-12-12T02:28:50Z","title":"FAWAC: Feasibility Informed Advantage Weighted Regression for Persistent Safety in Offline Reinforcement Learning","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-11T17:33:37.711703Z"},"links":{"citing_paper":"/paper/2412.08880"},"observation_digest":"sha256:6888f0bf9f8cd2d43b116cc22cb7fcc9accefe512454c9c936b268afe885cf59","observation_id":"da699856-f6a8-4d7e-b7eb-eca65762b5af","resolution":{"observed_at":"2026-08-11T17:33:38.034039Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10700","last_updated":"2024-01-19T14:05:09Z","snapshot_observed_at":"2026-08-13T04:39:09.097544Z","submitted_at":"2024-01-19T14:05:09Z","title":"Safe Offline Reinforcement Learning with Feasibility-Guided Diffusion Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10700","snapshot_observed_at":"2026-08-11T17:33:37.716533Z","title":"Safe offline reinforcement learning with feasibility-guided diffusion model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08880","last_updated":"2024-12-12T02:28:50Z","snapshot_observed_at":"2026-08-13T09:30:08.901877Z","submitted_at":"2024-12-12T02:28:50Z","title":"FAWAC: Feasibility Informed Advantage Weighted Regression for Persistent Safety in Offline Reinforcement Learning","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-11T17:33:37.716533Z"},"links":{"cited_paper":"/paper/2401.10700","citing_paper":"/paper/2412.08880"},"observation_digest":"sha256:0904273ed22d233afa174043d81a7db4cde8e021cb9674b2431801efcdbcaef6","observation_id":"b59b261b-3528-4132-90d9-c51b8f8f0880","resolution":{"observed_at":"2026-08-11T17:33:37.716533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:33:37.721942Z","title":"Maximum entropy inverse reinforcement learning","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2412.08880","last_updated":"2024-12-12T02:28:50Z","snapshot_observed_at":"2026-08-13T09:30:08.901877Z","submitted_at":"2024-12-12T02:28:50Z","title":"FAWAC: Feasibility Informed Advantage Weighted Regression for Persistent Safety in Offline Reinforcement Learning","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-11T17:33:37.721942Z"},"links":{"citing_paper":"/paper/2412.08880"},"observation_digest":"sha256:4bd35a5712c2da8d26a3ffee67037b2309e4887ecb3e1f4db673b16593adfa1d","observation_id":"0dc13ffc-13f9-44e5-94dc-f1d0ab8f545c","resolution":{"observed_at":"2026-08-11T17:33:37.721942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.08880","last_updated":"2024-12-12T02:28:50Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-13T09:30:08.901877Z","submitted_at":"2024-12-12T02:28:50Z","title":"FAWAC: Feasibility Informed Advantage Weighted Regression for Persistent Safety in Offline Reinforcement Learning"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":2,"verified_fuzzy":12},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 0 inbound Pith citation observations for arXiv:2412.08880."}