{"as_of":"2026-08-05T13:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ab25a9a241603a98595a825a2ce6b8fb0813e18347ea0577d69a6da938849350","coverage":[{"denominator":32,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-16T07:55:31.706717Z","state":"measured"},{"denominator":34,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":34,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T22:46:27.179341Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2602.02924","last_updated":"2026-05-05T18:05:36Z","snapshot_observed_at":"2026-07-06T22:44:14.347235Z","submitted_at":"2026-02-02T23:53:53Z","title":"How Does the Lagrangian Guide Safe Reinforcement Learning through Diffusion Models?","version":2},"cited_work":{"arxiv_id":"2602.02924","doi":"10.48550/arxiv.2602.02924","metadata_source":"pith","pith_arxiv_id":"2602.02924","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"How Does the Lagrangian Guide Safe Reinforcement Learning through Diffusion Models?","venue":"cs.LG","work_id":"d08dbd12-23a9-47e7-90d5-8522a22a2592","year":2026},"citing_paper":{"arxiv_id":"2605.18719","last_updated":"2026-05-18T17:50:04Z","snapshot_observed_at":"2026-08-03T04:40:08.919496Z","submitted_at":"2026-05-18T17:50:04Z","title":"SafeDiffusion-R1: Online Reward Steering for Safe Diffusion Post-Training","version":1},"reference_index":131,"source":"arxiv_source","source_observed_at":"2026-05-20T11:26:55.810822Z"},"links":{"cited_paper":"/paper/2602.02924","citing_paper":"/paper/2605.18719"},"observation_digest":"sha256:675b57b26c8ebcba8b3d6d963ddbdfd8c6946c99679be06f35f16f11eb3b6a5f","observation_id":"dc9e0a22-3766-44bb-acd6-67d28e85a92e","resolution":{"observed_at":"2026-05-20T11:28:14.084672Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-20T21:55:05.193707+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T21:55:05.193707+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.02924","last_updated":"2026-05-05T18:05:36Z","snapshot_observed_at":"2026-07-06T22:44:14.347235Z","submitted_at":"2026-02-02T23:53:53Z","title":"How Does the Lagrangian Guide Safe Reinforcement Learning through Diffusion Models?","version":2},"cited_work":{"arxiv_id":"2602.02924","doi":"10.48550/arxiv.2602.02924","metadata_source":"pith","pith_arxiv_id":"2602.02924","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"How Does the Lagrangian Guide Safe Reinforcement Learning through Diffusion Models?","venue":"cs.LG","work_id":"d08dbd12-23a9-47e7-90d5-8522a22a2592","year":2026},"citing_paper":{"arxiv_id":"2605.26282","last_updated":"2026-05-25T19:06:51Z","snapshot_observed_at":"2026-08-02T12:16:30.744884Z","submitted_at":"2026-05-25T19:06:51Z","title":"Scaling World-Model Reinforcement Learning Through Diffusion Policy Optimization","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-29T22:46:27.179341Z"},"links":{"cited_paper":"/paper/2602.02924","citing_paper":"/paper/2605.26282"},"observation_digest":"sha256:344046e3b2899d19858ed323a6961048ace8f258942488badf51652e0e68ac61","observation_id":"f757a7ce-a53d-42c8-967a-03c4fb450188","resolution":{"observed_at":"2026-06-29T22:54:01.405866Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-20T21:55:05.193707+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T21:55:05.193707+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2602.02924/citation-record","integrity":"/paper/2602.02924/integrity","json":"/paper/2602.02924/citation-record.json","paper":"/paper/2602.02924"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.06121","last_updated":"2024-06-26T04:14:13Z","snapshot_observed_at":"2026-07-06T17:27:45.481850Z","submitted_at":"2024-02-09T01:11:23Z","title":"Iterated Denoising Energy Matching for Sampling from Boltzmann Densities","version":2},"cited_work":{"arxiv_id":"2402.06121","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.06121","snapshot_observed_at":"2026-07-04T19:10:04.929606Z","title":"Akhound-Sadegh, J","venue":null,"work_id":"b2ebba24-1daa-448d-bbcf-a2a79a4e4ba2","year":2024},"citing_paper":{"arxiv_id":"2602.02924","last_updated":"2026-05-05T18:05:36Z","snapshot_observed_at":"2026-07-06T22:44:14.347235Z","submitted_at":"2026-02-02T23:53:53Z","title":"How Does the Lagrangian Guide Safe Reinforcement Learning through Diffusion Models?","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-16T07:55:31.706717Z"},"links":{"cited_paper":"/paper/2402.06121","citing_paper":"/paper/2602.02924"},"observation_digest":"sha256:0ba819bd5563b203e22289f75966e6165e29cc487c22a6e7a4ef685a520b1649","observation_id":"d27449cf-6ef1-4339-a740-b8bda2ffa502","resolution":{"observed_at":"2026-05-16T07:57:33.078134Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03979","last_updated":"2025-06-05T04:27:46Z","snapshot_observed_at":"2026-07-06T21:36:35.142284Z","submitted_at":"2025-06-04T14:09:25Z","title":"Solving Inverse Problems via Diffusion-Based Priors: An Approximation-Free Ensemble Sampling Approach","version":2},"cited_work":{"arxiv_id":"2506.03979","doi":"10.48550/arxiv.2506.03979","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03979","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hongrui Chen, Holden Lee, and Jianfeng Lu","venue":"ArXiv.org","work_id":"ebd3d185-34ee-4232-9cfe-b622df78c34d","year":2025},"citing_paper":{"arxiv_id":"2602.02924","last_updated":"2026-05-05T18:05:36Z","snapshot_observed_at":"2026-07-06T22:44:14.347235Z","submitted_at":"2026-02-02T23:53:53Z","title":"How Does the Lagrangian Guide Safe Reinforcement Learning through Diffusion Models?","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-16T07:55:31.706717Z"},"links":{"cited_paper":"/paper/2506.03979","citing_paper":"/paper/2602.02924"},"observation_digest":"sha256:c2f5bad4c952c8b9ecedddb4311d3eeef184deac81f188ecd8580e8fbf90591b","observation_id":"a1dfbca6-728b-40fd-b9f4-045f21b29428","resolution":{"observed_at":"2026-05-16T07:57:33.082156Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.25375","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:54:01.449348Z","title":"Safe and stable control via lyapunov-guided diffusion models.arXiv preprint arXiv:2509.25375","venue":null,"work_id":"8ba94f51-d6d6-4786-963a-8571f0c33ee9","year":2025},"citing_paper":{"arxiv_id":"2602.02924","last_updated":"2026-05-05T18:05:36Z","snapshot_observed_at":"2026-07-06T22:44:14.347235Z","submitted_at":"2026-02-02T23:53:53Z","title":"How Does the Lagrangian Guide Safe Reinforcement Learning through Diffusion Models?","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-16T07:55:31.706717Z"},"links":{"citing_paper":"/paper/2602.02924"},"observation_digest":"sha256:a80d0a591b2871991ca40565906ecac8cb5492d24199f3dae44f255f76c2c25f","observation_id":"5f35fc00-60ee-4106-8f46-195e62be1489","resolution":{"observed_at":"2026-05-16T07:57:33.066012Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.03233","last_updated":"2025-04-04T07:29:11Z","snapshot_observed_at":"2026-07-31T03:40:42.167469Z","submitted_at":"2025-04-04T07:29:11Z","title":"Data-Driven Hamiltonian for Direct Construction of Safe Set from Trajectory Data","version":1},"cited_work":{"arxiv_id":"2504.03233","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.03233","snapshot_observed_at":"2026-07-03T18:38:49.538672Z","title":"J., Strong, C","venue":null,"work_id":"5f144477-1718-41ac-9abf-d487be807311","year":2025},"citing_paper":{"arxiv_id":"2602.02924","last_updated":"2026-05-05T18:05:36Z","snapshot_observed_at":"2026-07-06T22:44:14.347235Z","submitted_at":"2026-02-02T23:53:53Z","title":"How Does the Lagrangian Guide Safe Reinforcement Learning through Diffusion Models?","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-16T07:55:31.706717Z"},"links":{"cited_paper":"/paper/2504.03233","citing_paper":"/paper/2602.02924"},"observation_digest":"sha256:05af605344c3fe85d5a48418895f5632dab9dc5c5a7499c28c9a02e531ef1c3e","observation_id":"de7f3371-2582-4361-b633-9094833e8c62","resolution":{"observed_at":"2026-05-16T07:57:33.136551Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11612","last_updated":"2025-06-06T06:54:29Z","snapshot_observed_at":"2026-07-06T20:37:42.218354Z","submitted_at":"2025-02-17T09:55:58Z","title":"Maximum Entropy Reinforcement Learning with Diffusion Policy","version":3},"cited_work":{"arxiv_id":"2502.11612","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.11612","snapshot_observed_at":"2026-07-02T16:27:08.506450Z","title":"Maximum entropy reinforcement learning with diffusion policy.arXiv preprint arXiv:2502.11612","venue":null,"work_id":"dd4be881-0b74-48ca-b181-6f07c353a0b7","year":2025},"citing_paper":{"arxiv_id":"2602.02924","last_updated":"2026-05-05T18:05:36Z","snapshot_observed_at":"2026-07-06T22:44:14.347235Z","submitted_at":"2026-02-02T23:53:53Z","title":"How Does the Lagrangian Guide Safe Reinforcement Learning through Diffusion Models?","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-16T07:55:31.706717Z"},"links":{"cited_paper":"/paper/2502.11612","citing_paper":"/paper/2602.02924"},"observation_digest":"sha256:542eaa33ad191a97858b05c33f5078fd4d65595cbf766e530d216e553be6dd18","observation_id":"c3c1a766-0652-415a-a8f8-b41e117e5683","resolution":{"observed_at":"2026-05-16T07:57:33.115112Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2602.02924","last_updated":"2026-05-05T18:05:36Z","snapshot_observed_at":"2026-07-06T22:44:14.347235Z","submitted_at":"2026-02-02T23:53:53Z","title":"How Does the Lagrangian Guide Safe Reinforcement Learning through Diffusion Models?","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-16T07:55:31.706717Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2602.02924"},"observation_digest":"sha256:0d0874f56d5d09c46a02b09753aefaf90d4d46a1df7277f4f7c5f8a0fc9ae4c9","observation_id":"3ccd2e71-4895-4cdb-bb92-e543eaf7ca3e","resolution":{"observed_at":"2026-05-16T07:57:33.102252Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.09991","last_updated":"2022-12-21T01:06:18Z","snapshot_observed_at":"2026-07-06T13:11:57.798513Z","submitted_at":"2022-05-20T07:02:03Z","title":"Planning with Diffusion for Flexible Behavior Synthesis","version":2},"cited_work":{"arxiv_id":"2205.09991","doi":"10.48550/arxiv.2205.09991","metadata_source":"pith","pith_arxiv_id":"2205.09991","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Planning with Diffusion for Flexible Behavior Synthesis","venue":"cs.LG","work_id":"38b2c635-b754-412a-a8f5-dfcf3e405c95","year":2022},"citing_paper":{"arxiv_id":"2602.02924","last_updated":"2026-05-05T18:05:36Z","snapshot_observed_at":"2026-07-06T22:44:14.347235Z","submitted_at":"2026-02-02T23:53:53Z","title":"How Does the Lagrangian Guide Safe Reinforcement Learning through Diffusion Models?","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-16T07:55:31.706717Z"},"links":{"cited_paper":"/paper/2205.09991","citing_paper":"/paper/2602.02924"},"observation_digest":"sha256:b137ce27289bbfbeb5cf6eaa123c24f0832efdc3de0d07220c3c4341453e5d53","observation_id":"a6031ea8-fbfa-4d29-9628-0b96b7c1edb2","resolution":{"observed_at":"2026-05-16T07:57:33.123642Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Model-based constrained reinforcement learning using generalized control barrier function","venue":null,"work_id":"7080877d-6e05-4c89-ac12-edfdc7e046bb","year":2021},"citing_paper":{"arxiv_id":"2602.02924","last_updated":"2026-05-05T18:05:36Z","snapshot_observed_at":"2026-07-06T22:44:14.347235Z","submitted_at":"2026-02-02T23:53:53Z","title":"How Does the Lagrangian Guide Safe Reinforcement Learning through Diffusion Models?","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-16T07:55:31.706717Z"},"links":{"citing_paper":"/paper/2602.02924"},"observation_digest":"sha256:70cf8aa63e73167c91c219febd811f7ddec940fcb9e88998d5ef382b6d759990","observation_id":"3966d4ec-0b61-4528-962b-f38bcf1efb0d","resolution":{"observed_at":"2026-05-16T07:57:33.599665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.00361","last_updated":"2025-06-30T03:48:44Z","snapshot_observed_at":"2026-08-03T17:18:33.914768Z","submitted_at":"2025-02-01T07:55:06Z","title":"Efficient Online Reinforcement Learning for Diffusion Policy","version":4},"cited_work":{"arxiv_id":"2502.00361","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.00361","snapshot_observed_at":"2026-07-10T14:37:15.961163Z","title":"Soft diffusion actor-critic: Efficient online reinforcement learning for diffusion policy.arXiv preprint arXiv:2502.00361","venue":"cs.LG","work_id":"9b6105fa-1051-411d-9b4b-34592a2780b8","year":2025},"citing_paper":{"arxiv_id":"2602.02924","last_updated":"2026-05-05T18:05:36Z","snapshot_observed_at":"2026-07-06T22:44:14.347235Z","submitted_at":"2026-02-02T23:53:53Z","title":"How Does the Lagrangian Guide Safe Reinforcement Learning through Diffusion Models?","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-16T07:55:31.706717Z"},"links":{"cited_paper":"/paper/2502.00361","citing_paper":"/paper/2602.02924"},"observation_digest":"sha256:20990c78f37af5e866504d14758d5e9d4a3242af8cab60cc90443d8c4a7c9e05","observation_id":"343df86c-0770-46d2-8ef5-e68026b1daa1","resolution":{"observed_at":"2026-05-16T07:57:33.143511Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02538","last_updated":"2025-05-25T22:15:41Z","snapshot_observed_at":"2026-08-03T23:24:49.416436Z","submitted_at":"2025-02-04T18:04:05Z","title":"Flow Q-Learning","version":2},"cited_work":{"arxiv_id":"2502.02538","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.02538","snapshot_observed_at":"2026-07-10T16:47:24.448335Z","title":"Flow Q-learning","venue":"cs.LG","work_id":"aaf75949-519b-45a5-8a13-f387de951d31","year":2025},"citing_paper":{"arxiv_id":"2602.02924","last_updated":"2026-05-05T18:05:36Z","snapshot_observed_at":"2026-07-06T22:44:14.347235Z","submitted_at":"2026-02-02T23:53:53Z","title":"How Does the Lagrangian Guide Safe Reinforcement Learning through Diffusion Models?","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-16T07:55:31.706717Z"},"links":{"cited_paper":"/paper/2502.02538","citing_paper":"/paper/2602.02924"},"observation_digest":"sha256:c7510a94e66f94822488bb4e57879ac8442e0cd8c5d7e1e39b1d1ff52c0d8c6f","observation_id":"c3abb07d-e78c-4e3c-9ca8-c884306e4681","resolution":{"observed_at":"2026-05-16T07:57:33.110582Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11752","last_updated":"2025-02-13T23:18:56Z","snapshot_observed_at":"2026-07-06T17:04:58.670142Z","submitted_at":"2023-12-18T23:31:01Z","title":"Learning a Diffusion Model Policy from Rewards via Q-Score Matching","version":5},"cited_work":{"arxiv_id":"2312.11752","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.11752","snapshot_observed_at":"2026-07-03T04:17:36.937596Z","title":"Learning a","venue":null,"work_id":"cc696d86-62f6-40ba-80af-8cbd54495ef2","year":2023},"citing_paper":{"arxiv_id":"2602.02924","last_updated":"2026-05-05T18:05:36Z","snapshot_observed_at":"2026-07-06T22:44:14.347235Z","submitted_at":"2026-02-02T23:53:53Z","title":"How Does the Lagrangian Guide Safe Reinforcement Learning through Diffusion Models?","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-16T07:55:31.706717Z"},"links":{"cited_paper":"/paper/2312.11752","citing_paper":"/paper/2602.02924"},"observation_digest":"sha256:8607709f22f19cf0584087146f7bbbe3b11f28d604299f065ad09cc584575bfa","observation_id":"47c4faa7-5cc4-4405-9729-7c73890d20fd","resolution":{"observed_at":"2026-05-16T07:57:33.094604Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sablas: Learning safe control for black-box dynamical systems.IEEE Robotics and Automation Letters, 7(2):1928–1935","venue":null,"work_id":"826a6bd2-29c7-488d-be6a-c8c8fb10bf7a","year":1928},"citing_paper":{"arxiv_id":"2602.02924","last_updated":"2026-05-05T18:05:36Z","snapshot_observed_at":"2026-07-06T22:44:14.347235Z","submitted_at":"2026-02-02T23:53:53Z","title":"How Does the Lagrangian Guide Safe Reinforcement Learning through Diffusion Models?","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-16T07:55:31.706717Z"},"links":{"citing_paper":"/paper/2602.02924"},"observation_digest":"sha256:c32c77d7975ccfc33024ac278378cadeb1813620c23a94ad28a0c526c05b9267","observation_id":"847e8c1e-8d51-47eb-99d3-9654f00b8c61","resolution":{"observed_at":"2026-05-16T07:57:33.581153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"cited_work":{"arxiv_id":"2409.00588","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.00588","snapshot_observed_at":"2026-07-04T09:59:44.479162Z","title":"Diffusion Policy Policy Optimization","venue":"cs.RO","work_id":"c665cf26-fe05-4f5a-96cf-3be3407fa976","year":2024},"citing_paper":{"arxiv_id":"2602.02924","last_updated":"2026-05-05T18:05:36Z","snapshot_observed_at":"2026-07-06T22:44:14.347235Z","submitted_at":"2026-02-02T23:53:53Z","title":"How Does the Lagrangian Guide Safe Reinforcement Learning through Diffusion Models?","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-16T07:55:31.706717Z"},"links":{"cited_paper":"/paper/2409.00588","citing_paper":"/paper/2602.02924"},"observation_digest":"sha256:cc6c4df0a96c45ab7d14e5f0be0b818abfba355176f383f4fbc9ac16b67bf8a2","observation_id":"e9c845c4-cb15-40fc-ac0f-722adfefde5a","resolution":{"observed_at":"2026-05-16T08:48:15.161771Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19244","last_updated":"2023-10-30T03:22:54Z","snapshot_observed_at":"2026-07-06T16:40:16.152421Z","submitted_at":"2023-10-30T03:22:54Z","title":"High-Dimensional Statistics","version":1},"cited_work":{"arxiv_id":"2310.19244","doi":"10.48550/arxiv.2310.19244","metadata_source":"arxiv_reference","pith_arxiv_id":"2310.19244","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"and Hütter, J.-C","venue":"arXiv (Cornell University)","work_id":"d86297c5-1bfb-4043-9887-4a513b7f3f48","year":2023},"citing_paper":{"arxiv_id":"2602.02924","last_updated":"2026-05-05T18:05:36Z","snapshot_observed_at":"2026-07-06T22:44:14.347235Z","submitted_at":"2026-02-02T23:53:53Z","title":"How Does the Lagrangian Guide Safe Reinforcement Learning through Diffusion Models?","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-16T07:55:31.706717Z"},"links":{"cited_paper":"/paper/2310.19244","citing_paper":"/paper/2602.02924"},"observation_digest":"sha256:a08f99763f207f65be2f357017e288878248815d3b0d8982d041db77df429908","observation_id":"ce658ca0-de2a-4bf2-a677-01a1da4f535d","resolution":{"observed_at":"2026-05-16T07:57:33.090247Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14154","last_updated":"2023-05-23T15:21:03Z","snapshot_observed_at":"2026-07-06T15:31:36.425535Z","submitted_at":"2023-05-23T15:21:03Z","title":"Solving Stabilize-Avoid Optimal Control via Epigraph Form and Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2305.14154","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.14154","snapshot_observed_at":"2026-07-04T11:39:46.369169Z","title":"So, O., Ge, C., and Fan, C","venue":null,"work_id":"97638b36-3c7c-44e1-8f5e-afb1e2bafebc","year":null},"citing_paper":{"arxiv_id":"2602.02924","last_updated":"2026-05-05T18:05:36Z","snapshot_observed_at":"2026-07-06T22:44:14.347235Z","submitted_at":"2026-02-02T23:53:53Z","title":"How Does the Lagrangian Guide Safe Reinforcement Learning through Diffusion Models?","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-16T07:55:31.706717Z"},"links":{"cited_paper":"/paper/2305.14154","citing_paper":"/paper/2602.02924"},"observation_digest":"sha256:9b3c6072f90dec96c79dca06a4e0cce14ad9590f12d2d0c043da79f316dfc4ec","observation_id":"d52239c0-fa27-433b-8848-6d136be14113","resolution":{"observed_at":"2026-05-16T07:57:33.146628Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.13456","last_updated":"2021-02-10T18:17:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-11-26T19:39:10Z","title":"Score-Based Generative Modeling through Stochastic Differential Equations","version":2},"cited_work":{"arxiv_id":"2011.13456","doi":"10.1088/1748-9326/aae98d","metadata_source":"pith","pith_arxiv_id":"2011.13456","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Score-Based Generative Modeling through Stochastic Differential Equations","venue":"cs.LG","work_id":"d9110e53-a5d4-4794-a4c5-a575e91c31ad","year":2020},"citing_paper":{"arxiv_id":"2602.02924","last_updated":"2026-05-05T18:05:36Z","snapshot_observed_at":"2026-07-06T22:44:14.347235Z","submitted_at":"2026-02-02T23:53:53Z","title":"How Does the Lagrangian Guide Safe Reinforcement Learning through Diffusion Models?","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-16T07:55:31.706717Z"},"links":{"cited_paper":"/paper/2011.13456","citing_paper":"/paper/2602.02924"},"observation_digest":"sha256:f32c06bb9448a1a69931313ffc2330d533b8bf9977f710119fb39e19134bcb00","observation_id":"8b451dd2-24f1-41b6-a0f5-becf0538f25e","resolution":{"observed_at":"2026-05-16T07:57:33.106457Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-06-01T22:58:00.812405+00:00","source":"crossref_status_cache"},{"observed_at":"2026-06-01T22:58:00.812405+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-01T20:24:08.300098Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":"1801.00690","doi":"10.48550/arxiv.1801.00690","metadata_source":"pith","pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepMind Control Suite","venue":"cs.AI","work_id":"54294ef0-c651-4d5a-a72b-f85a88329a71","year":2018},"citing_paper":{"arxiv_id":"2602.02924","last_updated":"2026-05-05T18:05:36Z","snapshot_observed_at":"2026-07-06T22:44:14.347235Z","submitted_at":"2026-02-02T23:53:53Z","title":"How Does the Lagrangian Guide Safe Reinforcement Learning through Diffusion Models?","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-16T07:55:31.706717Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2602.02924"},"observation_digest":"sha256:1ffcc3ada58b8db5b6ac8400a117509102e6a6c3a46602603c400f86df308de3","observation_id":"3beb648f-3f11-44c4-93f7-7ea03dd05792","resolution":{"observed_at":"2026-05-16T07:57:33.070055Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1805.11074","last_updated":"2018-12-26T11:09:40Z","snapshot_observed_at":"2026-07-06T06:41:39.213867Z","submitted_at":"2018-05-28T17:31:11Z","title":"Reward Constrained Policy Optimization","version":3},"cited_work":{"arxiv_id":"1805.11074","doi":null,"metadata_source":"pith","pith_arxiv_id":"1805.11074","snapshot_observed_at":"2026-07-04T11:39:46.348956Z","title":"Reward Constrained Policy Optimization","venue":"cs.LG","work_id":"c4fdaea7-11ae-432a-8a0c-0b650e87b855","year":2018},"citing_paper":{"arxiv_id":"2602.02924","last_updated":"2026-05-05T18:05:36Z","snapshot_observed_at":"2026-07-06T22:44:14.347235Z","submitted_at":"2026-02-02T23:53:53Z","title":"How Does the Lagrangian Guide Safe Reinforcement Learning through Diffusion Models?","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-16T07:55:31.706717Z"},"links":{"cited_paper":"/paper/1805.11074","citing_paper":"/paper/2602.02924"},"observation_digest":"sha256:f601866fb8376f96dc15d844ed8000b18fdd62f11b775d3435821477f938bc12","observation_id":"06d88804-9297-4977-ab65-33f3b10ca3e4","resolution":{"observed_at":"2026-05-16T07:57:33.098452Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"and Schwartz, A","venue":null,"work_id":"615d1400-b40d-4932-9b28-9ac249440635","year":1993},"citing_paper":{"arxiv_id":"2602.02924","last_updated":"2026-05-05T18:05:36Z","snapshot_observed_at":"2026-07-06T22:44:14.347235Z","submitted_at":"2026-02-02T23:53:53Z","title":"How Does the Lagrangian Guide Safe Reinforcement Learning through Diffusion Models?","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-16T07:55:31.706717Z"},"links":{"citing_paper":"/paper/2602.02924"},"observation_digest":"sha256:a20cd0443f30cac75ab41e31e2af3f48498a353bc498994ffebe49b78cfcee90","observation_id":"35e80717-c1a4-4fb7-9260-5350b2eba6ae","resolution":{"observed_at":"2026-05-16T07:57:33.583341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.13734","last_updated":"2024-07-18T17:35:32Z","snapshot_observed_at":"2026-08-04T02:06:15.701646Z","submitted_at":"2024-07-18T17:35:32Z","title":"Understanding Reinforcement Learning-Based Fine-Tuning of Diffusion Models: A Tutorial and Review","version":1},"cited_work":{"arxiv_id":"2407.13734","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.13734","snapshot_observed_at":"2026-07-05T17:51:14.851401Z","title":"Understanding reinforcement learning-based fine-tuning of diffusion models: A tutorial and review","venue":"cs.LG","work_id":"a22cff4a-9d87-46bd-8d73-d48374c743ef","year":2024},"citing_paper":{"arxiv_id":"2602.02924","last_updated":"2026-05-05T18:05:36Z","snapshot_observed_at":"2026-07-06T22:44:14.347235Z","submitted_at":"2026-02-02T23:53:53Z","title":"How Does the Lagrangian Guide Safe Reinforcement Learning through Diffusion Models?","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-16T07:55:31.706717Z"},"links":{"cited_paper":"/paper/2407.13734","citing_paper":"/paper/2602.02924"},"observation_digest":"sha256:e570772bdffafb9c258a46a4461b2cfdb69615ac0afe038d554c30b1c1211fd2","observation_id":"3d519c0f-f77d-4afa-b5b7-a834da9d8e8d","resolution":{"observed_at":"2026-05-16T07:57:33.150279Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2208.06193","doi":null,"metadata_source":"pith","pith_arxiv_id":"2208.06193","snapshot_observed_at":"2026-07-04T06:49:37.744619Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","venue":"cs.LG","work_id":"dd3fee6a-963f-4e7d-8dd8-b30bd0b76fb5","year":2022},"citing_paper":{"arxiv_id":"2602.02924","last_updated":"2026-05-05T18:05:36Z","snapshot_observed_at":"2026-07-06T22:44:14.347235Z","submitted_at":"2026-02-02T23:53:53Z","title":"How Does the Lagrangian Guide Safe Reinforcement Learning through Diffusion Models?","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-16T07:55:31.706717Z"},"links":{"cited_paper":"/paper/2208.06193","citing_paper":"/paper/2602.02924"},"observation_digest":"sha256:149f44a5adaf4e2f0c62c7cb46b0a16224d3291567b2162de25750ac07fbde05","observation_id":"77cd936f-939d-43e5-997f-1270f5770f7f","resolution":{"observed_at":"2026-05-16T07:57:33.085981Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14758","last_updated":"2024-04-15T13:44:11Z","snapshot_observed_at":"2026-07-06T17:20:49.161755Z","submitted_at":"2024-01-26T10:33:38Z","title":"Off-Policy Primal-Dual Safe Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2401.14758","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.14758","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dsrl: Benchmarking safe offline reinforce- ment learning with diverse safety requirements","venue":null,"work_id":"36f4b1f3-0cce-4bec-8413-509242680a26","year":2024},"citing_paper":{"arxiv_id":"2602.02924","last_updated":"2026-05-05T18:05:36Z","snapshot_observed_at":"2026-07-06T22:44:14.347235Z","submitted_at":"2026-02-02T23:53:53Z","title":"How Does the Lagrangian Guide Safe Reinforcement Learning through Diffusion Models?","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-16T07:55:31.706717Z"},"links":{"cited_paper":"/paper/2401.14758","citing_paper":"/paper/2602.02924"},"observation_digest":"sha256:bc70201bf59e8a14081c9d357b2ab6d453e9992885627b21bda9034f2485948d","observation_id":"9d0ad8ed-6e32-4fcb-b826-9748be050b13","resolution":{"observed_at":"2026-05-16T07:57:33.119515Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.12544","last_updated":"2025-06-14T15:37:43Z","snapshot_observed_at":"2026-07-06T21:42:16.332283Z","submitted_at":"2025-06-14T15:37:43Z","title":"Constrained Diffusers for Safe Planning and Control","version":1},"cited_work":{"arxiv_id":"2506.12544","doi":"10.48550/arxiv.2506.12544","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.12544","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Constrained diffusers for safe planning and control","venue":"ArXiv.org","work_id":"5f5488d6-53dc-4d2f-bfbd-667a2f840072","year":2025},"citing_paper":{"arxiv_id":"2602.02924","last_updated":"2026-05-05T18:05:36Z","snapshot_observed_at":"2026-07-06T22:44:14.347235Z","submitted_at":"2026-02-02T23:53:53Z","title":"How Does the Lagrangian Guide Safe Reinforcement Learning through Diffusion Models?","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-16T07:55:31.706717Z"},"links":{"cited_paper":"/paper/2506.12544","citing_paper":"/paper/2602.02924"},"observation_digest":"sha256:e8b1038df5d399c561f95a5fdf93e2e2d9f71156cee5fec92b22e7132b369b90","observation_id":"dc6c532d-0623-4c1c-a351-397df8345958","resolution":{"observed_at":"2026-05-16T07:57:33.128486Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03640","last_updated":"2025-03-13T18:50:52Z","snapshot_observed_at":"2026-07-30T17:53:30.893941Z","submitted_at":"2025-02-05T21:51:47Z","title":"Discrete GCBF Proximal Policy Optimization for Multi-agent Safe Optimal Control","version":3},"cited_work":{"arxiv_id":"2502.03640","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.03640","snapshot_observed_at":"2026-07-04T11:39:46.366290Z","title":"Discrete gcbf proximal policy optimization for multi-agent safe optimal control.arXiv preprint arXiv:2502.03640, 2025b","venue":null,"work_id":"707780e4-98e0-44cd-8eef-44db4c88f440","year":null},"citing_paper":{"arxiv_id":"2602.02924","last_updated":"2026-05-05T18:05:36Z","snapshot_observed_at":"2026-07-06T22:44:14.347235Z","submitted_at":"2026-02-02T23:53:53Z","title":"How Does the Lagrangian Guide Safe Reinforcement Learning through Diffusion Models?","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-16T07:55:31.706717Z"},"links":{"cited_paper":"/paper/2502.03640","citing_paper":"/paper/2602.02924"},"observation_digest":"sha256:d0c873a23b240b73a30843602807315d9dadaa587800f0b24e28ccc744b82437","observation_id":"f19839a0-4bd1-45a2-8b15-b24525f0c226","resolution":{"observed_at":"2026-05-16T07:57:33.074108Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10700","last_updated":"2024-01-19T14:05:09Z","snapshot_observed_at":"2026-07-06T17:17:52.174927Z","submitted_at":"2024-01-19T14:05:09Z","title":"Safe Offline Reinforcement Learning with Feasibility-Guided Diffusion Model","version":1},"cited_work":{"arxiv_id":"2401.10700","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.10700","snapshot_observed_at":"2026-07-02T21:57:25.901467Z","title":"E., Zhan, X., and Liu, J","venue":null,"work_id":"667e62a7-168e-491e-a173-b2accd9e2e88","year":2024},"citing_paper":{"arxiv_id":"2602.02924","last_updated":"2026-05-05T18:05:36Z","snapshot_observed_at":"2026-07-06T22:44:14.347235Z","submitted_at":"2026-02-02T23:53:53Z","title":"How Does the Lagrangian Guide Safe Reinforcement Learning through Diffusion Models?","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-16T07:55:31.706717Z"},"links":{"cited_paper":"/paper/2401.10700","citing_paper":"/paper/2602.02924"},"observation_digest":"sha256:4a59febcbfc4921adbc5ccece034f3decc527cf69c81b68049b400c3ab074093","observation_id":"11a28bdb-dcf0-47f2-a01e-f4a1b9bcdefc","resolution":{"observed_at":"2026-05-16T07:57:33.132731Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"dual variable) τdiffusion step 12 Augmented Lagrangian-Guided Diffusion Appendix Overview This appendix is organized into four main parts","venue":null,"work_id":"b5cd1999-f6e9-4247-9936-d1a457adb810","year":2019},"citing_paper":{"arxiv_id":"2602.02924","last_updated":"2026-05-05T18:05:36Z","snapshot_observed_at":"2026-07-06T22:44:14.347235Z","submitted_at":"2026-02-02T23:53:53Z","title":"How Does the Lagrangian Guide Safe Reinforcement Learning through Diffusion Models?","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-16T07:55:31.706717Z"},"links":{"citing_paper":"/paper/2602.02924"},"observation_digest":"sha256:44bae6cb032ca0645de2660ddcf2673b620ec5c3ccb6c1cebc462db94370ebdf","observation_id":"65b5515a-5638-4e24-b7cf-a47ebc146b86","resolution":{"observed_at":"2026-05-16T07:57:33.593618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"However, these approaches are largely restricted to the offline setting","venue":null,"work_id":"ecb50175-9eaf-43b5-af03-cefa2ad98512","year":2022},"citing_paper":{"arxiv_id":"2602.02924","last_updated":"2026-05-05T18:05:36Z","snapshot_observed_at":"2026-07-06T22:44:14.347235Z","submitted_at":"2026-02-02T23:53:53Z","title":"How Does the Lagrangian Guide Safe Reinforcement Learning through Diffusion Models?","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-16T07:55:31.706717Z"},"links":{"citing_paper":"/paper/2602.02924"},"observation_digest":"sha256:07b7f3dfbbd74e1b490ec388a5b886ed0fc5ab2625f1292e13730f02e40720a2","observation_id":"2c865bdc-9d5b-44e8-98d3-0017c5768256","resolution":{"observed_at":"2026-05-16T07:57:33.591685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Despite recent progress, most existing diffusion-based approaches remain confined to the offline reinforcement learning setting","venue":null,"work_id":"4a72bd06-14bf-4547-a919-d5b2b7000697","year":2023},"citing_paper":{"arxiv_id":"2602.02924","last_updated":"2026-05-05T18:05:36Z","snapshot_observed_at":"2026-07-06T22:44:14.347235Z","submitted_at":"2026-02-02T23:53:53Z","title":"How Does the Lagrangian Guide Safe Reinforcement Learning through Diffusion Models?","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-16T07:55:31.706717Z"},"links":{"citing_paper":"/paper/2602.02924"},"observation_digest":"sha256:421a77d05ca5cc1c004d0b5784a0e279a13ad2b504f5e00d644be2728206337a","observation_id":"1ab181eb-2975-4372-9b46-629a4fbd8561","resolution":{"observed_at":"2026-05-16T07:57:33.597357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In the following proposition, we present a method for estimating the exact score function for Lagrangian-guided diffusion under the VE SDE framework","venue":null,"work_id":"90f0b634-a6dd-433b-bd19-4dd20c8c5290","year":2023},"citing_paper":{"arxiv_id":"2602.02924","last_updated":"2026-05-05T18:05:36Z","snapshot_observed_at":"2026-07-06T22:44:14.347235Z","submitted_at":"2026-02-02T23:53:53Z","title":"How Does the Lagrangian Guide Safe Reinforcement Learning through Diffusion Models?","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-16T07:55:31.706717Z"},"links":{"citing_paper":"/paper/2602.02924"},"observation_digest":"sha256:32366daf369e2c0961837d78c377d84fb0d3f9cd1bf61732c8dd6a1782f44b9f","observation_id":"da782dae-1890-4c7c-90db-dd791b9f668d","resolution":{"observed_at":"2026-05-16T07:57:33.589830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c6d943b5-93be-4011-aab8-fae9688a60d1","year":2025},"citing_paper":{"arxiv_id":"2602.02924","last_updated":"2026-05-05T18:05:36Z","snapshot_observed_at":"2026-07-06T22:44:14.347235Z","submitted_at":"2026-02-02T23:53:53Z","title":"How Does the Lagrangian Guide Safe Reinforcement Learning through Diffusion Models?","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-16T07:55:31.706717Z"},"links":{"citing_paper":"/paper/2602.02924"},"observation_digest":"sha256:dfaac424bf3ea3501286274970ce89608d8090bac2951780326bf1183b90695f","observation_id":"4a828c4a-d893-4c03-a81e-0c718ff3a041","resolution":{"observed_at":"2026-05-16T07:57:33.595448Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Z K 0 q dσ2(τ) dτ −1 × dσ2(τ) dτ ˜ϕA(s, aτ , τ)−ϕ ∗(s, aτ , τ) 2 dτ # = 1 2 Eπ0(a0|s)","venue":null,"work_id":"8c0a2d0d-25b5-49f2-8497-bf5fa9e95339","year":2017},"citing_paper":{"arxiv_id":"2602.02924","last_updated":"2026-05-05T18:05:36Z","snapshot_observed_at":"2026-07-06T22:44:14.347235Z","submitted_at":"2026-02-02T23:53:53Z","title":"How Does the Lagrangian Guide Safe Reinforcement Learning through Diffusion Models?","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-16T07:55:31.706717Z"},"links":{"citing_paper":"/paper/2602.02924"},"observation_digest":"sha256:7c29f0f2be1e94e1dda2b1fcd11247fc0ea3640a1139b63edf61d7821abf17c0","observation_id":"4ff6b2d8-4b40-43b5-bf91-8689f8bbef71","resolution":{"observed_at":"2026-05-16T07:57:33.587631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"To rule out potential confounding effects, we evaluated the use of cost critic ensembles in the baseline methods, including SAC+Lag and CAL (originally proposed with ensembles)","venue":null,"work_id":"58339d4a-5c59-457e-b132-5ebde7678442","year":2000},"citing_paper":{"arxiv_id":"2602.02924","last_updated":"2026-05-05T18:05:36Z","snapshot_observed_at":"2026-07-06T22:44:14.347235Z","submitted_at":"2026-02-02T23:53:53Z","title":"How Does the Lagrangian Guide Safe Reinforcement Learning through Diffusion Models?","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-16T07:55:31.706717Z"},"links":{"citing_paper":"/paper/2602.02924"},"observation_digest":"sha256:ab0ae0509a7d3fad8f5800e7eccd7b6f44e67201efcb5d9ddc0149fbaa0614d1","observation_id":"9abf9253-4ceb-4e06-a7af-f37c0cf79df4","resolution":{"observed_at":"2026-05-16T07:57:33.585521Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2602.02924","last_updated":"2026-05-05T18:05:36Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T22:44:14.347235Z","submitted_at":"2026-02-02T23:53:53Z","title":"How Does the Lagrangian Guide Safe Reinforcement Learning through Diffusion Models?"},"reference_resolution":{"displayed":32,"state_counts":{"malformed_identifier":1,"metadata_mismatch":4,"parse_uncertain":0,"unresolved":1,"verified_exact":18,"verified_fuzzy":8},"total_outbound_references":32},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 32 of 32 outbound references and 2 inbound Pith citation observations for arXiv:2602.02924."}