{"as_of":"2026-08-23T14:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:dac3ba88aa32024bf1a41fe0b88a096fb6fabb6069326caa09889836e051d972","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T12:36:41.887506Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2504.12557/citation-record","integrity":"/paper/2504.12557/integrity","json":"/paper/2504.12557/citation-record.json","paper":"/paper/2504.12557"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:36:42.426481Z","title":"Constrained policy optimization","venue":null,"work_id":"b05abd11-663d-49c0-ba7e-8ce32ac5413d","year":2017},"citing_paper":{"arxiv_id":"2504.12557","last_updated":"2026-06-30T02:48:09Z","snapshot_observed_at":"2026-08-17T06:42:22.902643Z","submitted_at":"2025-04-17T01:11:08Z","title":"TraCeS: Learning Per-Timestep Constraint-Violation Credit from Sparse Trajectory-Level Labels","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-16T12:36:41.649267Z"},"links":{"citing_paper":"/paper/2504.12557"},"observation_digest":"sha256:efa84253360d8ec4cc002ebebaf022f4e605efa2abce4be774c0de823cd22618","observation_id":"db834ad8-2448-43ac-bdfd-fd9080df8ab6","resolution":{"observed_at":"2026-08-16T12:36:42.430456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:36:42.414035Z","title":"Constrained markov decision processes with total cost criteria: Lagrangian approach and dual linear program","venue":null,"work_id":"6cebad7a-baed-4f86-b089-dd40fab7d434","year":1998},"citing_paper":{"arxiv_id":"2504.12557","last_updated":"2026-06-30T02:48:09Z","snapshot_observed_at":"2026-08-17T06:42:22.902643Z","submitted_at":"2025-04-17T01:11:08Z","title":"TraCeS: Learning Per-Timestep Constraint-Violation Credit from Sparse Trajectory-Level Labels","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-16T12:36:41.653077Z"},"links":{"citing_paper":"/paper/2504.12557"},"observation_digest":"sha256:01984b8db7b22ef3f9a668d53bcdda88d5de6bf792bb7dc180231dfae63d8eda","observation_id":"58761e91-1cf1-4ca9-b7e0-6458a2990987","resolution":{"observed_at":"2026-08-16T12:36:42.418024Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:36:41.656330Z","title":"Pattern recognition and machine learning, volume 4","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2504.12557","last_updated":"2026-06-30T02:48:09Z","snapshot_observed_at":"2026-08-17T06:42:22.902643Z","submitted_at":"2025-04-17T01:11:08Z","title":"TraCeS: Learning Per-Timestep Constraint-Violation Credit from Sparse Trajectory-Level Labels","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-16T12:36:41.656330Z"},"links":{"citing_paper":"/paper/2504.12557"},"observation_digest":"sha256:d8765af45e5cff5828185133e89c10d89b801eb9b98d8c2015eafb2d049b66c5","observation_id":"4a4314f8-eb62-439d-9730-01706c60a187","resolution":{"observed_at":"2026-08-16T12:36:41.656330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:36:42.391326Z","title":"Safety through feedback in constrained RL","venue":null,"work_id":"033f7d9e-4d51-4a6b-9045-73105188e63c","year":2024},"citing_paper":{"arxiv_id":"2504.12557","last_updated":"2026-06-30T02:48:09Z","snapshot_observed_at":"2026-08-17T06:42:22.902643Z","submitted_at":"2025-04-17T01:11:08Z","title":"TraCeS: Learning Per-Timestep Constraint-Violation Credit from Sparse Trajectory-Level Labels","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-16T12:36:41.659658Z"},"links":{"citing_paper":"/paper/2504.12557"},"observation_digest":"sha256:fdddf9a1d0e656948a7cdd33c71c9d1d0507560991da2df91e0b382d7fa83e24","observation_id":"38784651-cad7-484b-a0f2-439b00037213","resolution":{"observed_at":"2026-08-16T12:36:42.395444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:36:42.378470Z","title":"Learning constraints from demonstrations, 2019","venue":null,"work_id":"5cc3e72f-f04c-4a6e-bdb0-271dbbb08cbd","year":2019},"citing_paper":{"arxiv_id":"2504.12557","last_updated":"2026-06-30T02:48:09Z","snapshot_observed_at":"2026-08-17T06:42:22.902643Z","submitted_at":"2025-04-17T01:11:08Z","title":"TraCeS: Learning Per-Timestep Constraint-Violation Credit from Sparse Trajectory-Level Labels","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-16T12:36:41.780247Z"},"links":{"citing_paper":"/paper/2504.12557"},"observation_digest":"sha256:f06fa607f5b84f0cece3ddc6f9cbf85474510584d4d8b12db7ed82b56a1c35e6","observation_id":"110a8904-a278-4451-a80a-8bc4d40c1154","resolution":{"observed_at":"2026-08-16T12:36:42.382354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:36:42.365566Z","title":"Learning parametric constraints in high dimensions from demonstrations","venue":null,"work_id":"c70d89e8-c44c-4624-a344-6f4272ecd051","year":2020},"citing_paper":{"arxiv_id":"2504.12557","last_updated":"2026-06-30T02:48:09Z","snapshot_observed_at":"2026-08-17T06:42:22.902643Z","submitted_at":"2025-04-17T01:11:08Z","title":"TraCeS: Learning Per-Timestep Constraint-Violation Credit from Sparse Trajectory-Level Labels","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-16T12:36:41.783809Z"},"links":{"citing_paper":"/paper/2504.12557"},"observation_digest":"sha256:d9d745aababc266d13634b917eddcd2fc0d488cee409c032796f573aefbce7d3","observation_id":"3c88a293-5349-4bb2-81bd-e29ec1027f47","resolution":{"observed_at":"2026-08-16T12:36:42.369797Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:36:41.787417Z","title":"Risk-constrained reinforcement learning with percentile risk criteria","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.12557","last_updated":"2026-06-30T02:48:09Z","snapshot_observed_at":"2026-08-17T06:42:22.902643Z","submitted_at":"2025-04-17T01:11:08Z","title":"TraCeS: Learning Per-Timestep Constraint-Violation Credit from Sparse Trajectory-Level Labels","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-16T12:36:41.787417Z"},"links":{"citing_paper":"/paper/2504.12557"},"observation_digest":"sha256:2c449397ac758e12d6b0e83a4c786e9c2454a00368a5a165dbecf2d31b8ab1b7","observation_id":"21939fd4-3c55-4aab-926a-02026b1d445d","resolution":{"observed_at":"2026-08-16T12:36:41.787417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:36:41.790694Z","title":"Deep learning, volume 1","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2504.12557","last_updated":"2026-06-30T02:48:09Z","snapshot_observed_at":"2026-08-17T06:42:22.902643Z","submitted_at":"2025-04-17T01:11:08Z","title":"TraCeS: Learning Per-Timestep Constraint-Violation Credit from Sparse Trajectory-Level Labels","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-16T12:36:41.790694Z"},"links":{"citing_paper":"/paper/2504.12557"},"observation_digest":"sha256:a5d085ffd75c6460633dda76432e9c2943f4ba5686931a398cbaf086997497d9","observation_id":"0304cd27-0363-4fa1-83ee-2d8b56a6d9b9","resolution":{"observed_at":"2026-08-16T12:36:41.790694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:36:41.793818Z","title":"Bullet-safety-gym: A framework for constrained reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.12557","last_updated":"2026-06-30T02:48:09Z","snapshot_observed_at":"2026-08-17T06:42:22.902643Z","submitted_at":"2025-04-17T01:11:08Z","title":"TraCeS: Learning Per-Timestep Constraint-Violation Credit from Sparse Trajectory-Level Labels","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-16T12:36:41.793818Z"},"links":{"citing_paper":"/paper/2504.12557"},"observation_digest":"sha256:000bf7088cffd68c22468d07af12d6bf1f348ce6a58d571453553510fccaafc7","observation_id":"63a886f0-4c05-4dab-a4b0-f23f8a7ca69b","resolution":{"observed_at":"2026-08-16T12:36:41.793818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:36:42.327182Z","title":"Learning to walk in the real world with minimal human effort","venue":null,"work_id":"29240f1e-f41e-4a81-86a8-bf7bcfb90548","year":2021},"citing_paper":{"arxiv_id":"2504.12557","last_updated":"2026-06-30T02:48:09Z","snapshot_observed_at":"2026-08-17T06:42:22.902643Z","submitted_at":"2025-04-17T01:11:08Z","title":"TraCeS: Learning Per-Timestep Constraint-Violation Credit from Sparse Trajectory-Level Labels","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-16T12:36:41.796797Z"},"links":{"citing_paper":"/paper/2504.12557"},"observation_digest":"sha256:498c7987b35da7b8d493a70dd58868522c5b9605483ee334ea8b9fa6c5cafc91","observation_id":"ed77f75e-10c0-4da8-ba88-054c55c5034f","resolution":{"observed_at":"2026-08-16T12:36:42.330965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:36:42.314906Z","title":"The elements of statistical learning: data mining, inference, and prediction, 2017","venue":null,"work_id":"d8dcc345-bfeb-48cd-99a5-5f67c1962cd3","year":2017},"citing_paper":{"arxiv_id":"2504.12557","last_updated":"2026-06-30T02:48:09Z","snapshot_observed_at":"2026-08-17T06:42:22.902643Z","submitted_at":"2025-04-17T01:11:08Z","title":"TraCeS: Learning Per-Timestep Constraint-Violation Credit from Sparse Trajectory-Level Labels","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-16T12:36:41.799957Z"},"links":{"citing_paper":"/paper/2504.12557"},"observation_digest":"sha256:ad04a342a247784432796628c12c951799f7cf55ccb134bd983e0097dfc94ded","observation_id":"f6d8eca7-a32a-4d97-8139-21495b724518","resolution":{"observed_at":"2026-08-16T12:36:42.318986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:36:42.303201Z","title":"Safety gymnasium: A unified safe reinforcement learning benchmark","venue":null,"work_id":"4476039d-aa47-4c30-bbd7-f8c761989e84","year":2023},"citing_paper":{"arxiv_id":"2504.12557","last_updated":"2026-06-30T02:48:09Z","snapshot_observed_at":"2026-08-17T06:42:22.902643Z","submitted_at":"2025-04-17T01:11:08Z","title":"TraCeS: Learning Per-Timestep Constraint-Violation Credit from Sparse Trajectory-Level Labels","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-16T12:36:41.803233Z"},"links":{"citing_paper":"/paper/2504.12557"},"observation_digest":"sha256:fe1acbb92ecfc7985bad3f5428ecda326ec8cf5be563d0daa6dbdb8d6455812f","observation_id":"c7a918ad-8c00-4362-8307-eae79965236d","resolution":{"observed_at":"2026-08-16T12:36:42.307135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:36:42.291335Z","title":"Omnisafe: An infrastructure for accelerating safe reinforcement learning research","venue":null,"work_id":"ad71f533-4438-4d9d-a87d-1de57a8b4fc6","year":2024},"citing_paper":{"arxiv_id":"2504.12557","last_updated":"2026-06-30T02:48:09Z","snapshot_observed_at":"2026-08-17T06:42:22.902643Z","submitted_at":"2025-04-17T01:11:08Z","title":"TraCeS: Learning Per-Timestep Constraint-Violation Credit from Sparse Trajectory-Level Labels","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-16T12:36:41.806183Z"},"links":{"citing_paper":"/paper/2504.12557"},"observation_digest":"sha256:ac9875ed424283d9d151bf722057426d1948f183538b232f732b88d1d243f6ad","observation_id":"50096365-36ce-430a-8596-6bcb5eb797b5","resolution":{"observed_at":"2026-08-16T12:36:42.295065Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:36:41.809239Z","title":"Deep reinforcement learning for autonomous driving: A survey","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.12557","last_updated":"2026-06-30T02:48:09Z","snapshot_observed_at":"2026-08-17T06:42:22.902643Z","submitted_at":"2025-04-17T01:11:08Z","title":"TraCeS: Learning Per-Timestep Constraint-Violation Credit from Sparse Trajectory-Level Labels","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-16T12:36:41.809239Z"},"links":{"citing_paper":"/paper/2504.12557"},"observation_digest":"sha256:4f3cc96b49a4b92ebb0f0b58f8be6f8361af88476633bce50b5253cb2d4c7a65","observation_id":"f2e5b44e-a3ce-4a45-acf6-a8b96c5c1638","resolution":{"observed_at":"2026-08-16T12:36:41.809239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1806.01186","last_updated":"2019-03-08T09:17:21Z","snapshot_observed_at":"2026-08-18T21:21:17.683030Z","submitted_at":"2018-06-04T16:30:17Z","title":"Penalizing side effects using stepwise relative reachability","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.01186","snapshot_observed_at":"2026-08-16T12:36:41.812315Z","title":"Penalizing side effects using stepwise relative reachability","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.12557","last_updated":"2026-06-30T02:48:09Z","snapshot_observed_at":"2026-08-17T06:42:22.902643Z","submitted_at":"2025-04-17T01:11:08Z","title":"TraCeS: Learning Per-Timestep Constraint-Violation Credit from Sparse Trajectory-Level Labels","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-16T12:36:41.812315Z"},"links":{"cited_paper":"/paper/1806.01186","citing_paper":"/paper/2504.12557"},"observation_digest":"sha256:9a1f00ae551251d6325ce63324daa21b22710343d6a3212ebc60a28701b82217","observation_id":"cd1a32a3-297a-4af5-b740-3b28218f924b","resolution":{"observed_at":"2026-08-16T12:36:41.812315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:36:42.270380Z","title":null,"venue":null,"work_id":"208dcd80-bb30-44cb-8562-0aedc09b8166","year":2006},"citing_paper":{"arxiv_id":"2504.12557","last_updated":"2026-06-30T02:48:09Z","snapshot_observed_at":"2026-08-17T06:42:22.902643Z","submitted_at":"2025-04-17T01:11:08Z","title":"TraCeS: Learning Per-Timestep Constraint-Violation Credit from Sparse Trajectory-Level Labels","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-16T12:36:41.815739Z"},"links":{"citing_paper":"/paper/2504.12557"},"observation_digest":"sha256:b9e730f4883fb31945264c294cbe555f11a9fe8875a6e728b3fd22e1290fb8e8","observation_id":"ec1e86aa-62e4-4508-9231-0f97879f70ca","resolution":{"observed_at":"2026-08-16T12:36:42.273954Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:36:42.258079Z","title":"Benchmarking constraint inference in inverse reinforcement learning","venue":null,"work_id":"a7ec9a4d-8490-4b4d-93f1-ab242b6b72c1","year":2023},"citing_paper":{"arxiv_id":"2504.12557","last_updated":"2026-06-30T02:48:09Z","snapshot_observed_at":"2026-08-17T06:42:22.902643Z","submitted_at":"2025-04-17T01:11:08Z","title":"TraCeS: Learning Per-Timestep Constraint-Violation Credit from Sparse Trajectory-Level Labels","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-16T12:36:41.818599Z"},"links":{"citing_paper":"/paper/2504.12557"},"observation_digest":"sha256:753c52760017a3838b280c4dd001b664667443a7196758b761b10465cf41739e","observation_id":"0c556bd0-9fa8-4448-8114-23590d18e721","resolution":{"observed_at":"2026-08-16T12:36:42.262088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:36:41.821476Z","title":"Datasets and benchmarks for offline safe reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12557","last_updated":"2026-06-30T02:48:09Z","snapshot_observed_at":"2026-08-17T06:42:22.902643Z","submitted_at":"2025-04-17T01:11:08Z","title":"TraCeS: Learning Per-Timestep Constraint-Violation Credit from Sparse Trajectory-Level Labels","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-16T12:36:41.821476Z"},"links":{"citing_paper":"/paper/2504.12557"},"observation_digest":"sha256:96c7f3e9e82df7aa68764d227a274b7fae562f98f1da4bde467865af92b839e0","observation_id":"e003f9f4-82d2-4e0e-a976-580469585b0a","resolution":{"observed_at":"2026-08-16T12:36:41.821476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:36:42.235435Z","title":"Inverse constrained reinforcement learning","venue":null,"work_id":"db05c5d7-13f9-422f-bcc2-74b886f3b734","year":2021},"citing_paper":{"arxiv_id":"2504.12557","last_updated":"2026-06-30T02:48:09Z","snapshot_observed_at":"2026-08-17T06:42:22.902643Z","submitted_at":"2025-04-17T01:11:08Z","title":"TraCeS: Learning Per-Timestep Constraint-Violation Credit from Sparse Trajectory-Level Labels","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-16T12:36:41.824208Z"},"links":{"citing_paper":"/paper/2504.12557"},"observation_digest":"sha256:65c181203440a1272f0bc078d49040d7162760b4d683f9a2579d15ef5b9f9c61","observation_id":"93c0d676-8997-45ae-8b0c-95ac9977220e","resolution":{"observed_at":"2026-08-16T12:36:42.239202Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:36:41.827433Z","title":"Algorithms for inverse reinforcement learning","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2504.12557","last_updated":"2026-06-30T02:48:09Z","snapshot_observed_at":"2026-08-17T06:42:22.902643Z","submitted_at":"2025-04-17T01:11:08Z","title":"TraCeS: Learning Per-Timestep Constraint-Violation Credit from Sparse Trajectory-Level Labels","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-16T12:36:41.827433Z"},"links":{"citing_paper":"/paper/2504.12557"},"observation_digest":"sha256:9cb34d4221fea90a2fd3a4b2d8eea5f4e526d474a6e13705809618f912b86700","observation_id":"b3ae1378-4288-412f-90b7-3938adbfe0e0","resolution":{"observed_at":"2026-08-16T12:36:41.827433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:36:42.215569Z","title":"Puterman","venue":null,"work_id":"4f146cf4-4a46-42ae-9300-3e9b774db4a0","year":1994},"citing_paper":{"arxiv_id":"2504.12557","last_updated":"2026-06-30T02:48:09Z","snapshot_observed_at":"2026-08-17T06:42:22.902643Z","submitted_at":"2025-04-17T01:11:08Z","title":"TraCeS: Learning Per-Timestep Constraint-Violation Credit from Sparse Trajectory-Level Labels","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-16T12:36:41.830326Z"},"links":{"citing_paper":"/paper/2504.12557"},"observation_digest":"sha256:073d50eddd3d594da7d400b3c5ec226b6a12567efa14a2bbf4099b816435dbbc","observation_id":"29e35af0-9cfb-4b0b-9b29-1f38567331a6","resolution":{"observed_at":"2026-08-16T12:36:42.218787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-14T05:35:42.838302Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01708","snapshot_observed_at":"2026-08-16T12:36:41.833362Z","title":"Benchmarking safe exploration in deep reinforcement learning","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2504.12557","last_updated":"2026-06-30T02:48:09Z","snapshot_observed_at":"2026-08-17T06:42:22.902643Z","submitted_at":"2025-04-17T01:11:08Z","title":"TraCeS: Learning Per-Timestep Constraint-Violation Credit from Sparse Trajectory-Level Labels","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-16T12:36:41.833362Z"},"links":{"cited_paper":"/paper/1910.01708","citing_paper":"/paper/2504.12557"},"observation_digest":"sha256:a045fb463494eda9fd7d1aba7d9bbdba415469421a93d7619c05c0e80dcab89d","observation_id":"480eab5c-7607-40a5-a969-021318ced5d9","resolution":{"observed_at":"2026-08-16T12:36:41.833362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:36:42.203887Z","title":"Catastrophic forgetting, rehearsal and pseudorehearsal","venue":null,"work_id":"509393c7-4c4b-4926-8a7d-6b4259529fc9","year":1995},"citing_paper":{"arxiv_id":"2504.12557","last_updated":"2026-06-30T02:48:09Z","snapshot_observed_at":"2026-08-17T06:42:22.902643Z","submitted_at":"2025-04-17T01:11:08Z","title":"TraCeS: Learning Per-Timestep Constraint-Violation Credit from Sparse Trajectory-Level Labels","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-16T12:36:41.836573Z"},"links":{"citing_paper":"/paper/2504.12557"},"observation_digest":"sha256:5fcfa5b7831b4d47b8a14e6abfbf0f6a33ce3d7d4c24bccc1f5e57cc1f5bcc15","observation_id":"a7a87914-3372-4822-adec-9b4da6ad4d70","resolution":{"observed_at":"2026-08-16T12:36:42.207648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:36:42.191281Z","title":"Avoiding negative side effects due to incomplete knowledge of AI systems","venue":null,"work_id":"81d847f9-555b-4c27-b40b-2c163210b080","year":2021},"citing_paper":{"arxiv_id":"2504.12557","last_updated":"2026-06-30T02:48:09Z","snapshot_observed_at":"2026-08-17T06:42:22.902643Z","submitted_at":"2025-04-17T01:11:08Z","title":"TraCeS: Learning Per-Timestep Constraint-Violation Credit from Sparse Trajectory-Level Labels","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-16T12:36:41.839271Z"},"links":{"citing_paper":"/paper/2504.12557"},"observation_digest":"sha256:6648c83319be519c7b8dcf159812bd5b3e17b5fa41bbf7e32eadf394b711c4a6","observation_id":"8d762e3b-84bb-4186-a81d-a7db9fe61b41","resolution":{"observed_at":"2026-08-16T12:36:42.195544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:36:42.177128Z","title":"Avoiding negative side effects of autonomous systems in the open world","venue":null,"work_id":"5b6beca9-b06b-49de-9c79-dc9b81fe2ae9","year":2022},"citing_paper":{"arxiv_id":"2504.12557","last_updated":"2026-06-30T02:48:09Z","snapshot_observed_at":"2026-08-17T06:42:22.902643Z","submitted_at":"2025-04-17T01:11:08Z","title":"TraCeS: Learning Per-Timestep Constraint-Violation Credit from Sparse Trajectory-Level Labels","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-16T12:36:41.842175Z"},"links":{"citing_paper":"/paper/2504.12557"},"observation_digest":"sha256:2306936b064c49e1ab4cf5dc1d3f4804cd41d691e533e9273b3f69cd952f2b4c","observation_id":"6214cded-eada-48ae-abd4-8e8b597252c0","resolution":{"observed_at":"2026-08-16T12:36:42.181858Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-20T07:04:06.309989Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-16T12:36:41.845203Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.12557","last_updated":"2026-06-30T02:48:09Z","snapshot_observed_at":"2026-08-17T06:42:22.902643Z","submitted_at":"2025-04-17T01:11:08Z","title":"TraCeS: Learning Per-Timestep Constraint-Violation Credit from Sparse Trajectory-Level Labels","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-16T12:36:41.845203Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2504.12557"},"observation_digest":"sha256:8bd947ef934bb0b28ef8d793c046ac97414bab2a5832da1244eb3b23b649c459","observation_id":"eddb70d4-b60a-4d50-9b66-41dd6f60c555","resolution":{"observed_at":"2026-08-16T12:36:41.845203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:36:42.165626Z","title":"Preferences implicit in the state of the world","venue":null,"work_id":"b00e68d8-055c-4c50-afc0-fb0113989e0a","year":2019},"citing_paper":{"arxiv_id":"2504.12557","last_updated":"2026-06-30T02:48:09Z","snapshot_observed_at":"2026-08-17T06:42:22.902643Z","submitted_at":"2025-04-17T01:11:08Z","title":"TraCeS: Learning Per-Timestep Constraint-Violation Credit from Sparse Trajectory-Level Labels","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-16T12:36:41.848303Z"},"links":{"citing_paper":"/paper/2504.12557"},"observation_digest":"sha256:245a94da445e1c353eb6a352b2a262b0da18e5c87b4de71a6fb019742e81f320","observation_id":"aa8c6021-b0a0-4bf2-977b-8c4b572e0fd1","resolution":{"observed_at":"2026-08-16T12:36:42.169376Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:36:42.152745Z","title":"Responsive safety in reinforcement learning by pid lagrangian methods","venue":null,"work_id":"29ae2d0c-6ae4-4473-abbe-7ee59e9c8627","year":2020},"citing_paper":{"arxiv_id":"2504.12557","last_updated":"2026-06-30T02:48:09Z","snapshot_observed_at":"2026-08-17T06:42:22.902643Z","submitted_at":"2025-04-17T01:11:08Z","title":"TraCeS: Learning Per-Timestep Constraint-Violation Credit from Sparse Trajectory-Level Labels","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-16T12:36:41.851275Z"},"links":{"citing_paper":"/paper/2504.12557"},"observation_digest":"sha256:008508e3e5a79a432846ae247bfca92cbbc7d2c288273e27e6660be0906a0de0","observation_id":"d77d9460-905e-4cd2-bf2e-300e33bf7462","resolution":{"observed_at":"2026-08-16T12:36:42.156624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:36:42.140561Z","title":"Introduction to reinforcement learning, 1998","venue":null,"work_id":"3d7ac9ca-2f5d-4237-af3a-d6e530d1d154","year":1998},"citing_paper":{"arxiv_id":"2504.12557","last_updated":"2026-06-30T02:48:09Z","snapshot_observed_at":"2026-08-17T06:42:22.902643Z","submitted_at":"2025-04-17T01:11:08Z","title":"TraCeS: Learning Per-Timestep Constraint-Violation Credit from Sparse Trajectory-Level Labels","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-16T12:36:41.854015Z"},"links":{"citing_paper":"/paper/2504.12557"},"observation_digest":"sha256:313a5a5cd4bc145610ad20aecf59dd35ef43204f445d61d80c9d3bfa00f209dc","observation_id":"63316d3f-87ba-45e9-8840-0b44beb65e24","resolution":{"observed_at":"2026-08-16T12:36:42.144729Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:36:42.120693Z","title":"Reward constrained policy optimization","venue":null,"work_id":"d25835df-0ab0-43db-9214-3c5a8e0ded80","year":2018},"citing_paper":{"arxiv_id":"2504.12557","last_updated":"2026-06-30T02:48:09Z","snapshot_observed_at":"2026-08-17T06:42:22.902643Z","submitted_at":"2025-04-17T01:11:08Z","title":"TraCeS: Learning Per-Timestep Constraint-Violation Credit from Sparse Trajectory-Level Labels","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-16T12:36:41.856928Z"},"links":{"citing_paper":"/paper/2504.12557"},"observation_digest":"sha256:628b16f4943c0f08b9ff0e859044b9f9ba1aea14de0b15fe69f1322341a4ef86","observation_id":"11a5385d-7207-4a31-b213-81a098d25e7e","resolution":{"observed_at":"2026-08-16T12:36:42.126432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:36:41.950856Z","title":"Mujoco: A physics engine for model-based control","venue":null,"work_id":"cee875d1-38f6-4439-a026-499798610477","year":2012},"citing_paper":{"arxiv_id":"2504.12557","last_updated":"2026-06-30T02:48:09Z","snapshot_observed_at":"2026-08-17T06:42:22.902643Z","submitted_at":"2025-04-17T01:11:08Z","title":"TraCeS: Learning Per-Timestep Constraint-Violation Credit from Sparse Trajectory-Level Labels","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-16T12:36:41.859853Z"},"links":{"citing_paper":"/paper/2504.12557"},"observation_digest":"sha256:2058a30deb5d991863c0145efe141c865db14553cb3f54ec21027c07a0c28db4","observation_id":"0f7d8899-f112-4283-a6a0-d259817bd5bf","resolution":{"observed_at":"2026-08-16T12:36:41.957688Z","resolver_source":"arxiv_id_nonexistent","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:36:42.104191Z","title":"Avoiding side effects in complex environments","venue":null,"work_id":"9223430e-02fd-4c7c-8e63-d4766e8b3486","year":2020},"citing_paper":{"arxiv_id":"2504.12557","last_updated":"2026-06-30T02:48:09Z","snapshot_observed_at":"2026-08-17T06:42:22.902643Z","submitted_at":"2025-04-17T01:11:08Z","title":"TraCeS: Learning Per-Timestep Constraint-Violation Credit from Sparse Trajectory-Level Labels","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-16T12:36:41.862815Z"},"links":{"citing_paper":"/paper/2504.12557"},"observation_digest":"sha256:359781b4accbd85d7748b242a5af9c31605afe97afaee201a4e0dd0a79c88aeb","observation_id":"04b6c6d2-fa03-4468-ab37-007352c1ef8a","resolution":{"observed_at":"2026-08-16T12:36:42.108917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:36:42.088645Z","title":"Conservative agency via attainable utility preservation","venue":null,"work_id":"5ddf8de0-a992-487a-8669-b6c52462c5ba","year":2020},"citing_paper":{"arxiv_id":"2504.12557","last_updated":"2026-06-30T02:48:09Z","snapshot_observed_at":"2026-08-17T06:42:22.902643Z","submitted_at":"2025-04-17T01:11:08Z","title":"TraCeS: Learning Per-Timestep Constraint-Violation Credit from Sparse Trajectory-Level Labels","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-16T12:36:41.865835Z"},"links":{"citing_paper":"/paper/2504.12557"},"observation_digest":"sha256:63620211647e0dc4f94d41d67555e083d2cf5729cb9593f8e1f621e6325a3b3e","observation_id":"88ca42f7-1b6d-4758-a71b-3fbe2d100e57","resolution":{"observed_at":"2026-08-16T12:36:42.092787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:36:42.072013Z","title":"Minimax-regret querying on side effects for safe optimality in factored markov decision processes","venue":null,"work_id":"cc444b9c-35ca-485b-b66a-b5311d08151e","year":2018},"citing_paper":{"arxiv_id":"2504.12557","last_updated":"2026-06-30T02:48:09Z","snapshot_observed_at":"2026-08-17T06:42:22.902643Z","submitted_at":"2025-04-17T01:11:08Z","title":"TraCeS: Learning Per-Timestep Constraint-Violation Credit from Sparse Trajectory-Level Labels","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-16T12:36:41.868899Z"},"links":{"citing_paper":"/paper/2504.12557"},"observation_digest":"sha256:9f9762b3dfc81c0d686a8026e642beccdd8c58d618c68df675c16340da0ad4d0","observation_id":"4b283082-b5c4-4357-a4a7-16f7b6cf2d0f","resolution":{"observed_at":"2026-08-16T12:36:42.077061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:36:42.057657Z","title":"Deep reinforcement learning for power system applications: An overview","venue":null,"work_id":"81a1addb-1ef9-48b8-86a1-2415119eb8c2","year":2019},"citing_paper":{"arxiv_id":"2504.12557","last_updated":"2026-06-30T02:48:09Z","snapshot_observed_at":"2026-08-17T06:42:22.902643Z","submitted_at":"2025-04-17T01:11:08Z","title":"TraCeS: Learning Per-Timestep Constraint-Violation Credit from Sparse Trajectory-Level Labels","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-16T12:36:41.872031Z"},"links":{"citing_paper":"/paper/2504.12557"},"observation_digest":"sha256:fd9eb293017843a9f4e2d4a68393527672a6395810bdd9e6a44e808f8e78c93e","observation_id":"b227f4fb-8f39-4938-90f0-7503fa21b151","resolution":{"observed_at":"2026-08-16T12:36:42.062029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:36:41.875365Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.12557","last_updated":"2026-06-30T02:48:09Z","snapshot_observed_at":"2026-08-17T06:42:22.902643Z","submitted_at":"2025-04-17T01:11:08Z","title":"TraCeS: Learning Per-Timestep Constraint-Violation Credit from Sparse Trajectory-Level Labels","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-16T12:36:41.875365Z"},"links":{"citing_paper":"/paper/2504.12557"},"observation_digest":"sha256:4636e6e6e4b70671be8efd8343a32cd52a2665b9926e86660586957b688a2dfe","observation_id":"9a90f31d-231d-45de-ba73-667e7d84ebba","resolution":{"observed_at":"2026-08-16T12:36:41.875365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:36:41.879800Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.12557","last_updated":"2026-06-30T02:48:09Z","snapshot_observed_at":"2026-08-17T06:42:22.902643Z","submitted_at":"2025-04-17T01:11:08Z","title":"TraCeS: Learning Per-Timestep Constraint-Violation Credit from Sparse Trajectory-Level Labels","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-16T12:36:41.879800Z"},"links":{"citing_paper":"/paper/2504.12557"},"observation_digest":"sha256:daf5a489d6cae2e0889491fd985055c67faea594bea106e742e18edbb2c8cc28","observation_id":"7103a27f-e484-41c4-9850-26b1ce66548b","resolution":{"observed_at":"2026-08-16T12:36:41.879800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:36:41.883847Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.12557","last_updated":"2026-06-30T02:48:09Z","snapshot_observed_at":"2026-08-17T06:42:22.902643Z","submitted_at":"2025-04-17T01:11:08Z","title":"TraCeS: Learning Per-Timestep Constraint-Violation Credit from Sparse Trajectory-Level Labels","version":3},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-16T12:36:41.883847Z"},"links":{"citing_paper":"/paper/2504.12557"},"observation_digest":"sha256:81242534e5c50c5dd7bd790d91d094cb53bebe6f443ea74341623c3c26d3a000","observation_id":"edec5826-2e65-4a3e-b885-4dbdff15b48d","resolution":{"observed_at":"2026-08-16T12:36:41.883847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:36:41.887506Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.12557","last_updated":"2026-06-30T02:48:09Z","snapshot_observed_at":"2026-08-17T06:42:22.902643Z","submitted_at":"2025-04-17T01:11:08Z","title":"TraCeS: Learning Per-Timestep Constraint-Violation Credit from Sparse Trajectory-Level Labels","version":3},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-16T12:36:41.887506Z"},"links":{"citing_paper":"/paper/2504.12557"},"observation_digest":"sha256:b8357acc4ef11175bc2bf44fc859d664ac071f267b823595a3688f711823c218","observation_id":"8a0f0014-6cf0-4473-99f4-92e1dff401ba","resolution":{"observed_at":"2026-08-16T12:36:41.887506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2504.12557","last_updated":"2026-06-30T02:48:09Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-17T06:42:22.902643Z","submitted_at":"2025-04-17T01:11:08Z","title":"TraCeS: Learning Per-Timestep Constraint-Violation Credit from Sparse Trajectory-Level Labels"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":15,"verified_exact":1,"verified_fuzzy":23},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 0 inbound Pith citation observations for arXiv:2504.12557."}