{"as_of":"2026-08-12T23:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0533eac4b68cff9bd935408b484c53bef59e305e1cba854caa43c13ac0a0ee07","coverage":[{"denominator":23,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T21:46:47.809846Z","state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.04153/citation-record","integrity":"/paper/2412.04153/integrity","json":"/paper/2412.04153/citation-record.json","paper":"/paper/2412.04153"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:46:47.690685Z","title":"Constrained policy optimization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.04153","last_updated":"2025-04-18T13:37:59Z","snapshot_observed_at":"2026-08-12T14:29:17.413685Z","submitted_at":"2024-12-05T13:32:02Z","title":"A Dynamic Safety Shield for Safe and Efficient Reinforcement Learning of Navigation Tasks","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-11T21:46:47.690685Z"},"links":{"citing_paper":"/paper/2412.04153"},"observation_digest":"sha256:c9aa94021edb6b404b2f631fcb642163774b981ed991cb02cc96f42da3d21ff0","observation_id":"fdf42074-223c-41fb-a76f-832d17f5d8e1","resolution":{"observed_at":"2026-08-11T21:46:47.690685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:46:48.353971Z","title":"Exploring under constraints with model-based actor-critic and safety filters","venue":null,"work_id":"cc2dce9c-3b5c-42ec-8d5e-d55620628a36","year":2024},"citing_paper":{"arxiv_id":"2412.04153","last_updated":"2025-04-18T13:37:59Z","snapshot_observed_at":"2026-08-12T14:29:17.413685Z","submitted_at":"2024-12-05T13:32:02Z","title":"A Dynamic Safety Shield for Safe and Efficient Reinforcement Learning of Navigation Tasks","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-11T21:46:47.697056Z"},"links":{"citing_paper":"/paper/2412.04153"},"observation_digest":"sha256:bdea110462f034c44c704e287430b2aba1d370ec6e7e709291519fc7272b6855","observation_id":"35b2f30b-af06-4c7e-a3e8-9753179948df","resolution":{"observed_at":"2026-08-11T21:46:48.359758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:46:48.336431Z","title":"Control barrier functions: Theory and applications","venue":null,"work_id":"13e19df5-8091-46c3-bfc1-a5a96248a427","year":2019},"citing_paper":{"arxiv_id":"2412.04153","last_updated":"2025-04-18T13:37:59Z","snapshot_observed_at":"2026-08-12T14:29:17.413685Z","submitted_at":"2024-12-05T13:32:02Z","title":"A Dynamic Safety Shield for Safe and Efficient Reinforcement Learning of Navigation Tasks","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-11T21:46:47.702503Z"},"links":{"citing_paper":"/paper/2412.04153"},"observation_digest":"sha256:dae0ae2a64c446d983115c2348d852858232ab3dc2ebff024be029a9ba4c90b1","observation_id":"89dadc74-6225-4b55-801a-beac0ef708d4","resolution":{"observed_at":"2026-08-11T21:46:48.341772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:46:48.321170Z","title":"o m and Tore H \\","venue":null,"work_id":"f181dbb5-70aa-4c34-8b54-f8b36ca609a9","year":2006},"citing_paper":{"arxiv_id":"2412.04153","last_updated":"2025-04-18T13:37:59Z","snapshot_observed_at":"2026-08-12T14:29:17.413685Z","submitted_at":"2024-12-05T13:32:02Z","title":"A Dynamic Safety Shield for Safe and Efficient Reinforcement Learning of Navigation Tasks","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-11T21:46:47.707940Z"},"links":{"citing_paper":"/paper/2412.04153"},"observation_digest":"sha256:353b2e884ac307ebf0aa0d4428d046a3c9e919e0faba614282ed90f3e6941d05","observation_id":"475acf9e-724e-4b35-9435-cb3c320cfc67","resolution":{"observed_at":"2026-08-11T21:46:48.325928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:46:48.304900Z","title":"Where to go next: learning a subgoal recommendation policy for navigation in dynamic environments","venue":null,"work_id":"8d66e9a4-d447-4dbe-8547-8902ceebb87d","year":2021},"citing_paper":{"arxiv_id":"2412.04153","last_updated":"2025-04-18T13:37:59Z","snapshot_observed_at":"2026-08-12T14:29:17.413685Z","submitted_at":"2024-12-05T13:32:02Z","title":"A Dynamic Safety Shield for Safe and Efficient Reinforcement Learning of Navigation Tasks","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-11T21:46:47.713804Z"},"links":{"citing_paper":"/paper/2412.04153"},"observation_digest":"sha256:c2d8e0fed1968f6a945fe4541c6368a8df02619bacea851ecf28f0f67deb994c","observation_id":"8de02ea4-4d5e-4a3b-a7ee-0444ed7ae8ea","resolution":{"observed_at":"2026-08-11T21:46:48.310211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:46:48.288654Z","title":"Safe reinforcement learning via shielding under partial observability","venue":null,"work_id":"bf5aa10e-2e8a-4bad-b58e-83eaa49407aa","year":2023},"citing_paper":{"arxiv_id":"2412.04153","last_updated":"2025-04-18T13:37:59Z","snapshot_observed_at":"2026-08-12T14:29:17.413685Z","submitted_at":"2024-12-05T13:32:02Z","title":"A Dynamic Safety Shield for Safe and Efficient Reinforcement Learning of Navigation Tasks","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-11T21:46:47.719125Z"},"links":{"citing_paper":"/paper/2412.04153"},"observation_digest":"sha256:01738d65c14b1e5eba229b214fceda3b8bfdd720a348d99fc94065d34aed8dfb","observation_id":"d159a33d-9900-4d2e-bb6a-7eca0da27359","resolution":{"observed_at":"2026-08-11T21:46:48.293847Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:46:48.272059Z","title":"Pybullet, a python module for physics simulation for games, robotics and machine learning","venue":null,"work_id":"cb7863fb-7571-461f-a6cd-e38974b366f4","year":2016},"citing_paper":{"arxiv_id":"2412.04153","last_updated":"2025-04-18T13:37:59Z","snapshot_observed_at":"2026-08-12T14:29:17.413685Z","submitted_at":"2024-12-05T13:32:02Z","title":"A Dynamic Safety Shield for Safe and Efficient Reinforcement Learning of Navigation Tasks","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-11T21:46:47.724917Z"},"links":{"citing_paper":"/paper/2412.04153"},"observation_digest":"sha256:7b8fa7a51e0d2313a43f06112bcc2af34aaa6b404062ad1e88474bae055c1800","observation_id":"35afc550-2d84-41b9-b92c-fe203bd8da85","resolution":{"observed_at":"2026-08-11T21:46:48.277268Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1801.08757","last_updated":"2018-01-26T11:11:18Z","snapshot_observed_at":"2026-08-09T14:33:35.632300Z","submitted_at":"2018-01-26T11:11:18Z","title":"Safe Exploration in Continuous Action Spaces","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.08757","snapshot_observed_at":"2026-08-11T21:46:47.730387Z","title":"Safe exploration in continuous action spaces","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.04153","last_updated":"2025-04-18T13:37:59Z","snapshot_observed_at":"2026-08-12T14:29:17.413685Z","submitted_at":"2024-12-05T13:32:02Z","title":"A Dynamic Safety Shield for Safe and Efficient Reinforcement Learning of Navigation Tasks","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T21:46:47.730387Z"},"links":{"cited_paper":"/paper/1801.08757","citing_paper":"/paper/2412.04153"},"observation_digest":"sha256:10beb2eb67d9a17376374566851a0542a10f239de4d9b7ce30c1f45767422ce1","observation_id":"17b2177e-567d-45b3-aafc-e8d564f39a66","resolution":{"observed_at":"2026-08-11T21:46:47.730387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2312.12861","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:46:48.100064Z","title":"Safe multi-agent reinforcement learning for behavior-based cooperative navigation","venue":null,"work_id":"d97e3d66-d6a2-464f-a76f-b92d9b57394f","year":2025},"citing_paper":{"arxiv_id":"2412.04153","last_updated":"2025-04-18T13:37:59Z","snapshot_observed_at":"2026-08-12T14:29:17.413685Z","submitted_at":"2024-12-05T13:32:02Z","title":"A Dynamic Safety Shield for Safe and Efficient Reinforcement Learning of Navigation Tasks","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T21:46:47.735758Z"},"links":{"citing_paper":"/paper/2412.04153"},"observation_digest":"sha256:fc86310663abe96b611d9358594dc0ca2a1209952c179be27ff1b78e8418a097","observation_id":"db2338fe-5da7-4bb3-8f2e-fe10f3635950","resolution":{"observed_at":"2026-08-11T21:46:48.110539Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:46:47.740847Z","title":"Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.04153","last_updated":"2025-04-18T13:37:59Z","snapshot_observed_at":"2026-08-12T14:29:17.413685Z","submitted_at":"2024-12-05T13:32:02Z","title":"A Dynamic Safety Shield for Safe and Efficient Reinforcement Learning of Navigation Tasks","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-11T21:46:47.740847Z"},"links":{"citing_paper":"/paper/2412.04153"},"observation_digest":"sha256:f71524da9dac6816680de303877da1ca41048c4e0c6f810d6bde2f2d9457bfd0","observation_id":"e78072dd-f704-4be9-8797-e452200db7d1","resolution":{"observed_at":"2026-08-11T21:46:47.740847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.17583","last_updated":"2024-05-21T05:49:52Z","snapshot_observed_at":"2026-08-12T10:44:21.030543Z","submitted_at":"2024-01-31T03:58:28Z","title":"Agile But Safe: Learning Collision-Free High-Speed Legged Locomotion","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.17583","snapshot_observed_at":"2026-08-11T21:46:47.746141Z","title":"Agile but safe: Learning collision-free high-speed legged locomotion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04153","last_updated":"2025-04-18T13:37:59Z","snapshot_observed_at":"2026-08-12T14:29:17.413685Z","submitted_at":"2024-12-05T13:32:02Z","title":"A Dynamic Safety Shield for Safe and Efficient Reinforcement Learning of Navigation Tasks","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-11T21:46:47.746141Z"},"links":{"cited_paper":"/paper/2401.17583","citing_paper":"/paper/2412.04153"},"observation_digest":"sha256:64d82fe617f879532ff6a1617a183f5016ae68d89e6a7013578470fa85b44d72","observation_id":"9e25fbf4-1c99-4956-a469-a5eb116a5f8f","resolution":{"observed_at":"2026-08-11T21:46:47.746141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.07176","last_updated":"2024-08-07T19:08:36Z","snapshot_observed_at":"2026-08-11T04:51:35.344635Z","submitted_at":"2023-07-14T06:00:08Z","title":"SafeDreamer: Safe Reinforcement Learning with World Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.07176","snapshot_observed_at":"2026-08-11T21:46:47.751481Z","title":"Safe dreamerv3: Safe reinforcement learning with world models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04153","last_updated":"2025-04-18T13:37:59Z","snapshot_observed_at":"2026-08-12T14:29:17.413685Z","submitted_at":"2024-12-05T13:32:02Z","title":"A Dynamic Safety Shield for Safe and Efficient Reinforcement Learning of Navigation Tasks","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T21:46:47.751481Z"},"links":{"cited_paper":"/paper/2307.07176","citing_paper":"/paper/2412.04153"},"observation_digest":"sha256:e280b0ca4b6c59ef4d7ddaeac97a64bdb5694c582fd24ae473d93bd9febdc323","observation_id":"e576be2f-df30-48da-a4f2-c6ef8a46f042","resolution":{"observed_at":"2026-08-11T21:46:47.751481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.09304","last_updated":"2023-05-16T09:22:14Z","snapshot_observed_at":"2026-08-03T12:13:47.197385Z","submitted_at":"2023-05-16T09:22:14Z","title":"OmniSafe: An Infrastructure for Accelerating Safe Reinforcement Learning Research","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.09304","snapshot_observed_at":"2026-08-11T21:46:47.756731Z","title":"Omnisafe: An infrastructure for accelerating safe reinforcement learning research","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04153","last_updated":"2025-04-18T13:37:59Z","snapshot_observed_at":"2026-08-12T14:29:17.413685Z","submitted_at":"2024-12-05T13:32:02Z","title":"A Dynamic Safety Shield for Safe and Efficient Reinforcement Learning of Navigation Tasks","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T21:46:47.756731Z"},"links":{"cited_paper":"/paper/2305.09304","citing_paper":"/paper/2412.04153"},"observation_digest":"sha256:643d8e4f4c1ccbc5979bf7331b398366713914d578e3ddac6fb648647a31c4a0","observation_id":"cb1ef198-49d5-49f5-b475-be205d3957ff","resolution":{"observed_at":"2026-08-11T21:46:47.756731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-07T14:18:01.067346Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01708","snapshot_observed_at":"2026-08-11T21:46:47.761953Z","title":"Benchmarking safe exploration in deep reinforcement learning","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2412.04153","last_updated":"2025-04-18T13:37:59Z","snapshot_observed_at":"2026-08-12T14:29:17.413685Z","submitted_at":"2024-12-05T13:32:02Z","title":"A Dynamic Safety Shield for Safe and Efficient Reinforcement Learning of Navigation Tasks","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-11T21:46:47.761953Z"},"links":{"cited_paper":"/paper/1910.01708","citing_paper":"/paper/2412.04153"},"observation_digest":"sha256:c2aca937ea5a877726bf22947ed08b2551d6b3d8f785373f795ec1d527197c1a","observation_id":"601e906b-7322-4f7b-b574-398969d00804","resolution":{"observed_at":"2026-08-11T21:46:47.761953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:46:48.245760Z","title":"Saut \\'e rl: Almost surely safe reinforcement learning using state augmentation","venue":null,"work_id":"df1775ee-4393-4dd6-bb22-5ef4b08db45d","year":2022},"citing_paper":{"arxiv_id":"2412.04153","last_updated":"2025-04-18T13:37:59Z","snapshot_observed_at":"2026-08-12T14:29:17.413685Z","submitted_at":"2024-12-05T13:32:02Z","title":"A Dynamic Safety Shield for Safe and Efficient Reinforcement Learning of Navigation Tasks","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-11T21:46:47.767462Z"},"links":{"citing_paper":"/paper/2412.04153"},"observation_digest":"sha256:8e9db79550602692126b5aa003426798d62b8abfd4b137ea45d50cde920f730e","observation_id":"63d412ca-88d1-4863-bba3-e29ff6fe59af","resolution":{"observed_at":"2026-08-11T21:46:48.250696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:46:47.772428Z","title":"Responsive safety in reinforcement learning by pid lagrangian methods","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.04153","last_updated":"2025-04-18T13:37:59Z","snapshot_observed_at":"2026-08-12T14:29:17.413685Z","submitted_at":"2024-12-05T13:32:02Z","title":"A Dynamic Safety Shield for Safe and Efficient Reinforcement Learning of Navigation Tasks","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-11T21:46:47.772428Z"},"links":{"citing_paper":"/paper/2412.04153"},"observation_digest":"sha256:40d2b997b62d3a0fe2524a83c80223befa82961e191257b8fc3b2659bd8db0ef","observation_id":"c744c90c-486e-4f35-af90-783531fffb19","resolution":{"observed_at":"2026-08-11T21:46:47.772428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1805.11074","last_updated":"2018-12-26T11:09:40Z","snapshot_observed_at":"2026-08-07T08:33:38.128537Z","submitted_at":"2018-05-28T17:31:11Z","title":"Reward Constrained Policy Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.11074","snapshot_observed_at":"2026-08-11T21:46:47.777452Z","title":"Reward constrained policy optimization","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.04153","last_updated":"2025-04-18T13:37:59Z","snapshot_observed_at":"2026-08-12T14:29:17.413685Z","submitted_at":"2024-12-05T13:32:02Z","title":"A Dynamic Safety Shield for Safe and Efficient Reinforcement Learning of Navigation Tasks","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-11T21:46:47.777452Z"},"links":{"cited_paper":"/paper/1805.11074","citing_paper":"/paper/2412.04153"},"observation_digest":"sha256:ab665799113f35b03206188e897cd658b37636d854737ec2595638eed1b4c3aa","observation_id":"6864f15d-b65f-438b-9e96-6555df89dc23","resolution":{"observed_at":"2026-08-11T21:46:47.777452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:46:48.217794Z","title":"Recovery rl: Safe reinforcement learning with learned recovery zones","venue":null,"work_id":"e3e60545-a16a-45cb-9043-d29e2f88f5c6","year":2021},"citing_paper":{"arxiv_id":"2412.04153","last_updated":"2025-04-18T13:37:59Z","snapshot_observed_at":"2026-08-12T14:29:17.413685Z","submitted_at":"2024-12-05T13:32:02Z","title":"A Dynamic Safety Shield for Safe and Efficient Reinforcement Learning of Navigation Tasks","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-11T21:46:47.783134Z"},"links":{"citing_paper":"/paper/2412.04153"},"observation_digest":"sha256:809cb2ff541e4d6d0df398feb029b07f068978f7a0fd601f6b9f40276a75825b","observation_id":"09b25504-6a5c-4ab0-8408-c429518b6700","resolution":{"observed_at":"2026-08-11T21:46:48.223145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:46:48.201613Z","title":"Probabilistic model predictive safety certification for learning-based control","venue":null,"work_id":"c15d8177-d827-49c6-84d3-eb9953b12001","year":2021},"citing_paper":{"arxiv_id":"2412.04153","last_updated":"2025-04-18T13:37:59Z","snapshot_observed_at":"2026-08-12T14:29:17.413685Z","submitted_at":"2024-12-05T13:32:02Z","title":"A Dynamic Safety Shield for Safe and Efficient Reinforcement Learning of Navigation Tasks","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-11T21:46:47.788069Z"},"links":{"citing_paper":"/paper/2412.04153"},"observation_digest":"sha256:3c1890f77ce00672003171c47902bac2c954fdcb48f2b88eecf9f565d58c5c89","observation_id":"04d10399-31f3-4457-b233-67bfba3530fa","resolution":{"observed_at":"2026-08-11T21:46:48.206780Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:46:48.185551Z","title":"A predictive safety filter for learning-based control of constrained nonlinear dynamical systems","venue":null,"work_id":"c292a964-2b9c-48c0-b50f-0e7b8aaab791","year":2021},"citing_paper":{"arxiv_id":"2412.04153","last_updated":"2025-04-18T13:37:59Z","snapshot_observed_at":"2026-08-12T14:29:17.413685Z","submitted_at":"2024-12-05T13:32:02Z","title":"A Dynamic Safety Shield for Safe and Efficient Reinforcement Learning of Navigation Tasks","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-11T21:46:47.793312Z"},"links":{"citing_paper":"/paper/2412.04153"},"observation_digest":"sha256:9e62a2c42e83e6a19ed816f9447bdc007063f576d0795c5c73e1189d79467904","observation_id":"ce486482-9077-42d9-a849-e8c74d333747","resolution":{"observed_at":"2026-08-11T21:46:48.190864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:46:48.169091Z","title":"Benchmarking reinforcement learning techniques for autonomous navigation","venue":null,"work_id":"cd483f69-7673-4d29-80eb-75ca273fe253","year":2023},"citing_paper":{"arxiv_id":"2412.04153","last_updated":"2025-04-18T13:37:59Z","snapshot_observed_at":"2026-08-12T14:29:17.413685Z","submitted_at":"2024-12-05T13:32:02Z","title":"A Dynamic Safety Shield for Safe and Efficient Reinforcement Learning of Navigation Tasks","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-11T21:46:47.798565Z"},"links":{"citing_paper":"/paper/2412.04153"},"observation_digest":"sha256:f0bd0339c9af6601e0ede97459290254b1965097cd97c0ca498672a1ed394847","observation_id":"36dda262-eca5-4f18-8bed-3af90bd56238","resolution":{"observed_at":"2026-08-11T21:46:48.174087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.12639","last_updated":"2019-12-28T03:03:04Z","snapshot_observed_at":"2026-08-10T20:31:22.283484Z","submitted_at":"2019-10-25T01:26:04Z","title":"MAMPS: Safe Multi-Agent Reinforcement Learning via Model Predictive Shielding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.12639","snapshot_observed_at":"2026-08-11T21:46:47.804510Z","title":"Mamps: Safe multi-agent reinforcement learning via model predictive shielding","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2412.04153","last_updated":"2025-04-18T13:37:59Z","snapshot_observed_at":"2026-08-12T14:29:17.413685Z","submitted_at":"2024-12-05T13:32:02Z","title":"A Dynamic Safety Shield for Safe and Efficient Reinforcement Learning of Navigation Tasks","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-11T21:46:47.804510Z"},"links":{"cited_paper":"/paper/1910.12639","citing_paper":"/paper/2412.04153"},"observation_digest":"sha256:fe12a2a8a9595a25b5f4935164d46f3f2923009730e705ea8a474353f1c5d6ee","observation_id":"b9854771-a858-46b6-8fd8-74d130a7f4f4","resolution":{"observed_at":"2026-08-11T21:46:47.804510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:46:48.152648Z","title":"Spatial-temporal-aware safe multi-agent reinforcement learning of connected autonomous vehicles in challenging scenarios","venue":null,"work_id":"11ede497-f8f7-4187-a1ad-8b63c5274a76","year":2023},"citing_paper":{"arxiv_id":"2412.04153","last_updated":"2025-04-18T13:37:59Z","snapshot_observed_at":"2026-08-12T14:29:17.413685Z","submitted_at":"2024-12-05T13:32:02Z","title":"A Dynamic Safety Shield for Safe and Efficient Reinforcement Learning of Navigation Tasks","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-11T21:46:47.809846Z"},"links":{"citing_paper":"/paper/2412.04153"},"observation_digest":"sha256:fd8b200d452fab300f4117de131cb8844de1a99d19f032884dd2b2573924bfe7","observation_id":"ff8352ce-f7f7-4d3c-ab4f-c6ba8ba554e6","resolution":{"observed_at":"2026-08-11T21:46:48.157922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.04153","last_updated":"2025-04-18T13:37:59Z","latest_version":2,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-12T14:29:17.413685Z","submitted_at":"2024-12-05T13:32:02Z","title":"A Dynamic Safety Shield for Safe and Efficient Reinforcement Learning of Navigation Tasks"},"reference_resolution":{"displayed":23,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":10,"verified_exact":1,"verified_fuzzy":12},"total_outbound_references":23},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 23 of 23 outbound references and 0 inbound Pith citation observations for arXiv:2412.04153."}