{"as_of":"2026-08-14T00:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2d9c7d4b63c0bd575a1ec33010babf4885abcf29d6b7b0d48c11a11ff1a44a9a","coverage":[{"denominator":13,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":13,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T11:30:06.718481Z","state":"measured"},{"denominator":13,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":13,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.15429/citation-record","integrity":"/paper/2412.15429/integrity","json":"/paper/2412.15429/citation-record.json","paper":"/paper/2412.15429"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:30:06.932895Z","title":"Additionally, SafetyGymnasium includes five velocity- constrained tasks for the agents, Ant, HalfCheetah, Hopper, Walker2d, and Swimmer","venue":null,"work_id":"93dd38f7-c8e1-488c-94c4-e41e70ef7a42","year":2004},"citing_paper":{"arxiv_id":"2412.15429","last_updated":"2025-04-19T01:50:15Z","snapshot_observed_at":"2026-08-13T19:08:54.305088Z","submitted_at":"2024-12-19T22:29:03Z","title":"Offline Safe Reinforcement Learning Using Trajectory Classification","version":5},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T11:30:06.718481Z"},"links":{"citing_paper":"/paper/2412.15429"},"observation_digest":"sha256:e0bbd13e8ae1d5de7a4cbff8e87616250a396581ced918e6ed89add858f759b6","observation_id":"4d392448-e575-462f-a099-a19e14447871","resolution":{"observed_at":"2026-08-11T11:30:06.938861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.01240","last_updated":"2019-05-03T15:59:25Z","snapshot_observed_at":"2026-08-13T13:14:54.589483Z","submitted_at":"2019-05-03T15:59:25Z","title":"Information asymmetry in KL-regularized RL","version":1},"cited_work":{"arxiv_id":"1905.01240","doi":null,"metadata_source":"pith","pith_arxiv_id":"1905.01240","snapshot_observed_at":"2026-08-11T11:30:06.858945Z","title":"Information asymmetry in KL-regularized RL","venue":"cs.LG","work_id":"caf4da7b-83f0-4d8f-a910-f1be6a23498a","year":2019},"citing_paper":{"arxiv_id":"2412.15429","last_updated":"2025-04-19T01:50:15Z","snapshot_observed_at":"2026-08-13T19:08:54.305088Z","submitted_at":"2024-12-19T22:29:03Z","title":"Offline Safe Reinforcement Learning Using Trajectory Classification","version":5},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T11:30:06.675090Z"},"links":{"cited_paper":"/paper/1905.01240","citing_paper":"/paper/2412.15429"},"observation_digest":"sha256:ee9ef247f49359f47fc1f6c731b3536654a4c5a8db74c07201b62095baa16d67","observation_id":"18c774c9-cf56-4bd1-9c01-f50a1989c6ae","resolution":{"observed_at":"2026-08-11T11:30:06.866006Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09303","last_updated":"2023-06-16T17:54:06Z","snapshot_observed_at":"2026-08-13T11:15:49.659373Z","submitted_at":"2023-06-15T17:31:26Z","title":"Datasets and Benchmarks for Offline Safe Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09303","snapshot_observed_at":"2026-08-11T11:30:06.691008Z","title":"IEEE transactions on pattern analysis and machine intelligence, 45(3): 3461–3475","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.15429","last_updated":"2025-04-19T01:50:15Z","snapshot_observed_at":"2026-08-13T19:08:54.305088Z","submitted_at":"2024-12-19T22:29:03Z","title":"Offline Safe Reinforcement Learning Using Trajectory Classification","version":5},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T11:30:06.691008Z"},"links":{"cited_paper":"/paper/2306.09303","citing_paper":"/paper/2412.15429"},"observation_digest":"sha256:ecd29a694a093a2f44e745a66f1a2eab992042a54f6b90ad0c353f18793672f3","observation_id":"68046617-dae9-4b99-92c5-85eef071965c","resolution":{"observed_at":"2026-08-11T11:30:06.691008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-07T14:18:01.067346Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01708","snapshot_observed_at":"2026-08-11T11:30:06.696490Z","title":"arXiv preprint arXiv:1910.01708, 7(1):","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2412.15429","last_updated":"2025-04-19T01:50:15Z","snapshot_observed_at":"2026-08-13T19:08:54.305088Z","submitted_at":"2024-12-19T22:29:03Z","title":"Offline Safe Reinforcement Learning Using Trajectory Classification","version":5},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T11:30:06.696490Z"},"links":{"cited_paper":"/paper/1910.01708","citing_paper":"/paper/2412.15429"},"observation_digest":"sha256:dfbfcccf7b7eeb337a841b9f161101f4ecf5f169b705266cd7dad014fdb738c3","observation_id":"4a019047-0e98-42fb-8f3e-472e92eea9e5","resolution":{"observed_at":"2026-08-11T11:30:06.696490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10700","last_updated":"2024-01-19T14:05:09Z","snapshot_observed_at":"2026-08-13T13:14:10.872962Z","submitted_at":"2024-01-19T14:05:09Z","title":"Safe Offline Reinforcement Learning with Feasibility-Guided Diffusion Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10700","snapshot_observed_at":"2026-08-11T11:30:06.707943Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.15429","last_updated":"2025-04-19T01:50:15Z","snapshot_observed_at":"2026-08-13T19:08:54.305088Z","submitted_at":"2024-12-19T22:29:03Z","title":"Offline Safe Reinforcement Learning Using Trajectory Classification","version":5},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T11:30:06.707943Z"},"links":{"cited_paper":"/paper/2401.10700","citing_paper":"/paper/2412.15429"},"observation_digest":"sha256:5a310966e8a5cd33ea84365a3db23aab8f8498b5d9fc739c25045bfcdc7077f9","observation_id":"a1dbd71a-4b92-46be-99c3-d0db40b902b8","resolution":{"observed_at":"2026-08-11T11:30:06.707943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:30:06.950864Z","title":"In Aaai, vol- ume 8, 1433–1438","venue":null,"work_id":"78beaaae-9b31-40d8-ae2c-38c71ed03832","year":2019},"citing_paper":{"arxiv_id":"2412.15429","last_updated":"2025-04-19T01:50:15Z","snapshot_observed_at":"2026-08-13T19:08:54.305088Z","submitted_at":"2024-12-19T22:29:03Z","title":"Offline Safe Reinforcement Learning Using Trajectory Classification","version":5},"reference_index":2008,"source":"pdf_text","source_observed_at":"2026-08-11T11:30:06.713348Z"},"links":{"citing_paper":"/paper/2412.15429"},"observation_digest":"sha256:0a379bbeb0f05980d8a3d852f6c2a4b0093d32777467cca67cef69322c24230b","observation_id":"2fe4b687-9f5c-4d0f-a8b4-67613f411bd7","resolution":{"observed_at":"2026-08-11T11:30:06.956003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1805.11074","last_updated":"2018-12-26T11:09:40Z","snapshot_observed_at":"2026-08-13T19:08:07.087878Z","submitted_at":"2018-05-28T17:31:11Z","title":"Reward Constrained Policy Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.11074","snapshot_observed_at":"2026-08-11T11:30:06.701825Z","title":"arXiv preprint arXiv:1805.11074","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.15429","last_updated":"2025-04-19T01:50:15Z","snapshot_observed_at":"2026-08-13T19:08:54.305088Z","submitted_at":"2024-12-19T22:29:03Z","title":"Offline Safe Reinforcement Learning Using Trajectory Classification","version":5},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-11T11:30:06.701825Z"},"links":{"cited_paper":"/paper/1805.11074","citing_paper":"/paper/2412.15429"},"observation_digest":"sha256:571624723b6d21a0a4a23dc80d300dda42ae3af15ccad62034dd36ad0fe80c2c","observation_id":"ca64a2f1-7689-4d97-94bb-72e9c128350c","resolution":{"observed_at":"2026-08-11T11:30:06.701825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:30:06.967660Z","title":"In ICML, 2052–2062","venue":null,"work_id":"013d81b2-0607-4bd4-90db-f36561c26a57","year":null},"citing_paper":{"arxiv_id":"2412.15429","last_updated":"2025-04-19T01:50:15Z","snapshot_observed_at":"2026-08-13T19:08:54.305088Z","submitted_at":"2024-12-19T22:29:03Z","title":"Offline Safe Reinforcement Learning Using Trajectory Classification","version":5},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-11T11:30:06.670083Z"},"links":{"citing_paper":"/paper/2412.15429"},"observation_digest":"sha256:d240ec1ef27b3f56f3dddc61c9dabb725a025c41ed1f7a79d6a2d4a3253e0dbd","observation_id":"b42f9f0c-697c-4533-95c8-63d9743e628e","resolution":{"observed_at":"2026-08-11T11:30:06.974156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-11T11:30:06.664950Z","title":"arXiv preprint arXiv:2004.07219","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2412.15429","last_updated":"2025-04-19T01:50:15Z","snapshot_observed_at":"2026-08-13T19:08:54.305088Z","submitted_at":"2024-12-19T22:29:03Z","title":"Offline Safe Reinforcement Learning Using Trajectory Classification","version":5},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-11T11:30:06.664950Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2412.15429"},"observation_digest":"sha256:9dfa67973df7022142ede3ae9ff74bac17baa91b7499bb16d162de623a6e5ad4","observation_id":"0a912bba-8465-4c31-ae85-d0b710dc8def","resolution":{"observed_at":"2026-08-11T11:30:06.664950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.10895","last_updated":"2021-01-26T16:03:32Z","snapshot_observed_at":"2026-08-12T06:40:26.294090Z","submitted_at":"2021-01-26T16:03:32Z","title":"A Primal-Dual Approach to Constrained Markov Decision Processes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.10895","snapshot_observed_at":"2026-08-11T11:30:06.654064Z","title":"arXiv preprint arXiv:2101.10895","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.15429","last_updated":"2025-04-19T01:50:15Z","snapshot_observed_at":"2026-08-13T19:08:54.305088Z","submitted_at":"2024-12-19T22:29:03Z","title":"Offline Safe Reinforcement Learning Using Trajectory Classification","version":5},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-11T11:30:06.654064Z"},"links":{"cited_paper":"/paper/2101.10895","citing_paper":"/paper/2412.15429"},"observation_digest":"sha256:c5f3069f0d1bc07b70f353bd1b2a754b2e083708c170b4c4fbb98d4200f56fe6","observation_id":"4e11c989-1b4f-494d-b00d-2a18c3091576","resolution":{"observed_at":"2026-08-11T11:30:06.654064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.10330","last_updated":"2024-05-24T22:33:04Z","snapshot_observed_at":"2026-08-13T22:50:56.824374Z","submitted_at":"2022-05-20T17:42:38Z","title":"A Review of Safe Reinforcement Learning: Methods, Theory and Applications","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.10330","snapshot_observed_at":"2026-08-11T11:30:06.680248Z","title":"arXiv preprint arXiv:2205.10330","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.15429","last_updated":"2025-04-19T01:50:15Z","snapshot_observed_at":"2026-08-13T19:08:54.305088Z","submitted_at":"2024-12-19T22:29:03Z","title":"Offline Safe Reinforcement Learning Using Trajectory Classification","version":5},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-11T11:30:06.680248Z"},"links":{"cited_paper":"/paper/2205.10330","citing_paper":"/paper/2412.15429"},"observation_digest":"sha256:6c23c4d182810d6937e59d1ff88a9623796b32be7858f4962e62b692436badf5","observation_id":"8e6c6fc6-97fe-4f05-9690-46f1434fec3a","resolution":{"observed_at":"2026-08-11T11:30:06.680248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.09304","last_updated":"2023-05-16T09:22:14Z","snapshot_observed_at":"2026-08-13T11:41:50.164846Z","submitted_at":"2023-05-16T09:22:14Z","title":"OmniSafe: An Infrastructure for Accelerating Safe Reinforcement Learning Research","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.09304","snapshot_observed_at":"2026-08-11T11:30:06.685475Z","title":"arXiv preprint arXiv:2305.09304","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.15429","last_updated":"2025-04-19T01:50:15Z","snapshot_observed_at":"2026-08-13T19:08:54.305088Z","submitted_at":"2024-12-19T22:29:03Z","title":"Offline Safe Reinforcement Learning Using Trajectory Classification","version":5},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-11T11:30:06.685475Z"},"links":{"cited_paper":"/paper/2305.09304","citing_paper":"/paper/2412.15429"},"observation_digest":"sha256:f3b584a5b221742f9e9f4e0e1d2b28dc12a91b88874d069604069c2c3fb9d50d","observation_id":"9ee70c93-8be7-428c-8750-68b977ed3737","resolution":{"observed_at":"2026-08-11T11:30:06.685475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01306","last_updated":"2024-11-19T18:12:45Z","snapshot_observed_at":"2026-08-12T21:18:02.964833Z","submitted_at":"2024-02-02T10:53:36Z","title":"KTO: Model Alignment as Prospect Theoretic Optimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01306","snapshot_observed_at":"2026-08-11T11:30:06.659787Z","title":"arXiv preprint arXiv:2402.01306","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.15429","last_updated":"2025-04-19T01:50:15Z","snapshot_observed_at":"2026-08-13T19:08:54.305088Z","submitted_at":"2024-12-19T22:29:03Z","title":"Offline Safe Reinforcement Learning Using Trajectory Classification","version":5},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-11T11:30:06.659787Z"},"links":{"cited_paper":"/paper/2402.01306","citing_paper":"/paper/2412.15429"},"observation_digest":"sha256:9b381cd8385e37909fe83e920b17244596cf4e6acfeba2edef5be953e35f82b5","observation_id":"a060bc4d-1403-4f04-a38f-6a69ccc63fe3","resolution":{"observed_at":"2026-08-11T11:30:06.659787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.15429","last_updated":"2025-04-19T01:50:15Z","latest_version":5,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-13T19:08:54.305088Z","submitted_at":"2024-12-19T22:29:03Z","title":"Offline Safe Reinforcement Learning Using Trajectory Classification"},"reference_resolution":{"displayed":13,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":9,"verified_exact":0,"verified_fuzzy":3},"total_outbound_references":13},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 13 of 13 outbound references and 0 inbound Pith citation observations for arXiv:2412.15429."}