{"as_of":"2026-08-08T08:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:944422ff712b6fce254cd794f8e64bfdba92689901490243b23010d4c7ee0850","coverage":[{"denominator":25,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":25,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:30:16.628557Z","state":"measured"},{"denominator":30,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":30,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T11:57:51.928730Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.24445","last_updated":"2025-05-30T10:30:24Z","snapshot_observed_at":"2026-08-07T19:43:43.847346Z","submitted_at":"2025-05-30T10:30:24Z","title":"Learning Safety Constraints for Large Language Models","version":1},"cited_work":{"arxiv_id":"2505.24445","doi":"10.48550/arxiv.2505.24445","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.24445","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Learningsafetyconstraintsforlarge language models","venue":"ArXiv.org","work_id":"1b767e3b-dd8a-45af-b68b-4de009df4313","year":2025},"citing_paper":{"arxiv_id":"2602.03433","last_updated":"2026-02-03T11:56:08Z","snapshot_observed_at":"2026-07-06T22:44:18.875334Z","submitted_at":"2026-02-03T11:56:08Z","title":"When control meets large language models: From words to dynamics","version":1},"reference_index":257,"source":"pdf_text","source_observed_at":"2026-05-21T14:52:44.632671Z"},"links":{"cited_paper":"/paper/2505.24445","citing_paper":"/paper/2602.03433"},"observation_digest":"sha256:2e9cce30edca5681b257e756133c7ad4d783b91b280409b52510b7e16459d8d3","observation_id":"e2bd960a-5dbb-4c95-9548-c457ff5dc172","resolution":{"observed_at":"2026-05-21T14:54:13.126908Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24445","last_updated":"2025-05-30T10:30:24Z","snapshot_observed_at":"2026-08-07T19:43:43.847346Z","submitted_at":"2025-05-30T10:30:24Z","title":"Learning Safety Constraints for Large Language Models","version":1},"cited_work":{"arxiv_id":"2505.24445","doi":"10.48550/arxiv.2505.24445","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.24445","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Learningsafetyconstraintsforlarge language models","venue":"ArXiv.org","work_id":"1b767e3b-dd8a-45af-b68b-4de009df4313","year":2025},"citing_paper":{"arxiv_id":"2605.16339","last_updated":"2026-05-07T16:48:48Z","snapshot_observed_at":"2026-07-06T23:27:29.931962Z","submitted_at":"2026-05-07T16:48:48Z","title":"Preference Instability in Reward Models: Detection and Mitigation via Sparse Autoencoders","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-20T22:48:54.238767Z"},"links":{"cited_paper":"/paper/2505.24445","citing_paper":"/paper/2605.16339"},"observation_digest":"sha256:f65fa1525a9dd87c0ad5069ec53582332f8494ceb1c972a24f5632a81ebc79a3","observation_id":"9036905c-b097-4870-b700-ba09c4020dc2","resolution":{"observed_at":"2026-05-20T22:49:10.216730Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24445","last_updated":"2025-05-30T10:30:24Z","snapshot_observed_at":"2026-08-07T19:43:43.847346Z","submitted_at":"2025-05-30T10:30:24Z","title":"Learning Safety Constraints for Large Language Models","version":1},"cited_work":{"arxiv_id":"2505.24445","doi":"10.48550/arxiv.2505.24445","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.24445","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Learningsafetyconstraintsforlarge language models","venue":"ArXiv.org","work_id":"1b767e3b-dd8a-45af-b68b-4de009df4313","year":2025},"citing_paper":{"arxiv_id":"2606.07335","last_updated":"2026-06-05T14:49:26Z","snapshot_observed_at":"2026-07-06T23:47:00.425715Z","submitted_at":"2026-06-05T14:49:26Z","title":"Defending Jailbreak Attacks on Large Language Models via Manifold Trajectory Kinetics","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-27T21:55:48.561400Z"},"links":{"cited_paper":"/paper/2505.24445","citing_paper":"/paper/2606.07335"},"observation_digest":"sha256:07bd5843ca46289d669262e3b9984dfece03b3bb99140718950b1be2c179481e","observation_id":"c9ba4192-0e7a-4ee5-ab2c-d234dde2bced","resolution":{"observed_at":"2026-06-27T22:01:20.847532Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24445","last_updated":"2025-05-30T10:30:24Z","snapshot_observed_at":"2026-08-07T19:43:43.847346Z","submitted_at":"2025-05-30T10:30:24Z","title":"Learning Safety Constraints for Large Language Models","version":1},"cited_work":{"arxiv_id":"2505.24445","doi":"10.48550/arxiv.2505.24445","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.24445","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Learningsafetyconstraintsforlarge language models","venue":"ArXiv.org","work_id":"1b767e3b-dd8a-45af-b68b-4de009df4313","year":2025},"citing_paper":{"arxiv_id":"2606.15531","last_updated":"2026-06-16T14:29:31Z","snapshot_observed_at":"2026-08-08T06:11:28.037599Z","submitted_at":"2026-06-14T01:18:53Z","title":"Greedy Coordinate Diffusion: Effective and Semantically Coherent Adversarial Attacks via Diffusion Guidance","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-06-27T04:35:35.594085Z"},"links":{"cited_paper":"/paper/2505.24445","citing_paper":"/paper/2606.15531"},"observation_digest":"sha256:0e045f31e338025eb3ce4da3713ede69f4b84a8c0ffe7d8123446007a153166a","observation_id":"511e8842-49c9-4e3a-a11b-475e12eb343f","resolution":{"observed_at":"2026-07-03T17:08:43.438995Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24445","last_updated":"2025-05-30T10:30:24Z","snapshot_observed_at":"2026-08-07T19:43:43.847346Z","submitted_at":"2025-05-30T10:30:24Z","title":"Learning Safety Constraints for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24445","snapshot_observed_at":"2026-08-02T11:57:51.928730Z","title":"Safety as polytope: Learning polytope constraints for LLM safety","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19366","last_updated":"2026-06-09T08:47:00Z","snapshot_observed_at":"2026-08-07T08:20:59.463372Z","submitted_at":"2026-06-09T08:47:00Z","title":"Geometry-Guided Constraint Learning for LLM Safety Classification","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T11:57:51.928730Z"},"links":{"cited_paper":"/paper/2505.24445","citing_paper":"/paper/2607.19366"},"observation_digest":"sha256:3eefde361366e962ce4fe5c7650d21a6f267b337d11980288667ba8890c3518d","observation_id":"9d400a3f-0fe4-42db-8206-794618102f72","resolution":{"observed_at":"2026-08-02T11:57:51.928730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.24445/citation-record","integrity":"/paper/2505.24445/integrity","json":"/paper/2505.24445/citation-record.json","paper":"/paper/2505.24445"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.14762","last_updated":"2024-11-05T16:40:21Z","snapshot_observed_at":"2026-07-06T17:34:07.737296Z","submitted_at":"2024-02-22T18:21:59Z","title":"MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14762","snapshot_observed_at":"2026-08-07T12:30:14.985484Z","title":"Mt-bench-101: A fine- grained benchmark for evaluating large language models in multi-turn dialogues","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24445","last_updated":"2025-05-30T10:30:24Z","snapshot_observed_at":"2026-08-07T19:43:43.847346Z","submitted_at":"2025-05-30T10:30:24Z","title":"Learning Safety Constraints for Large Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:14.985484Z"},"links":{"cited_paper":"/paper/2402.14762","citing_paper":"/paper/2505.24445"},"observation_digest":"sha256:70d5517de5bb4728c4b2f809f150803aacdd41eaa7bfec1fc3a9c4100d59643a","observation_id":"211c39db-1a9e-44e8-952e-e3a33be7cf9e","resolution":{"observed_at":"2026-08-07T12:30:14.985484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05426","last_updated":"2024-05-06T16:02:30Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:58Z","title":"SequenceMatch: Imitation Learning for Autoregressive Sequence Modelling with Backtracking","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05426","snapshot_observed_at":"2026-08-07T12:30:15.354687Z","title":"and Ermon, S","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24445","last_updated":"2025-05-30T10:30:24Z","snapshot_observed_at":"2026-08-07T19:43:43.847346Z","submitted_at":"2025-05-30T10:30:24Z","title":"Learning Safety Constraints for Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:15.354687Z"},"links":{"cited_paper":"/paper/2306.05426","citing_paper":"/paper/2505.24445"},"observation_digest":"sha256:cdba18c36e6bea80f18987ef0a5e0bb978fc132d81dee349857a0fc299e9a101","observation_id":"70a87e9a-0d49-4527-b423-512a812a02e6","resolution":{"observed_at":"2026-08-07T12:30:15.354687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.08757","last_updated":"2018-01-26T11:11:18Z","snapshot_observed_at":"2026-07-06T06:20:24.181731Z","submitted_at":"2018-01-26T11:11:18Z","title":"Safe Exploration in Continuous Action Spaces","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.08757","snapshot_observed_at":"2026-08-07T12:30:15.456333Z","title":"Safe exploration in continuous action spaces","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24445","last_updated":"2025-05-30T10:30:24Z","snapshot_observed_at":"2026-08-07T19:43:43.847346Z","submitted_at":"2025-05-30T10:30:24Z","title":"Learning Safety Constraints for Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:15.456333Z"},"links":{"cited_paper":"/paper/1801.08757","citing_paper":"/paper/2505.24445"},"observation_digest":"sha256:9d029ab7d9a9bd67def41fde9d7971b6d15088b7108d1e23965fcfbd0806ef84","observation_id":"7363c4c8-40c6-482c-b8e0-7d7bc2524288","resolution":{"observed_at":"2026-08-07T12:30:15.456333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.11462","last_updated":"2020-09-25T20:22:26Z","snapshot_observed_at":"2026-07-06T09:58:19.547859Z","submitted_at":"2020-09-24T03:17:19Z","title":"RealToxicityPrompts: Evaluating Neural Toxic Degeneration in Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.11462","snapshot_observed_at":"2026-08-07T12:30:15.620283Z","title":null,"venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2505.24445","last_updated":"2025-05-30T10:30:24Z","snapshot_observed_at":"2026-08-07T19:43:43.847346Z","submitted_at":"2025-05-30T10:30:24Z","title":"Learning Safety Constraints for Large Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:15.620283Z"},"links":{"cited_paper":"/paper/2009.11462","citing_paper":"/paper/2505.24445"},"observation_digest":"sha256:82e232ba828b83f9692ac6219ca4636f1672b3441146a8dc187c87f320483721","observation_id":"08849323-40da-4714-a7fe-c4502c5a2c33","resolution":{"observed_at":"2026-08-07T12:30:15.620283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-07T12:30:15.758569Z","title":"Measuring mas- sive multitask language understanding","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2505.24445","last_updated":"2025-05-30T10:30:24Z","snapshot_observed_at":"2026-08-07T19:43:43.847346Z","submitted_at":"2025-05-30T10:30:24Z","title":"Learning Safety Constraints for Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:15.758569Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2505.24445"},"observation_digest":"sha256:ad17e39afe4766418965289c61535bf40654e7c8cf63a4bd6369064ecb2556ee","observation_id":"519a09b1-99c1-4f8d-bf1e-1b428aa01b35","resolution":{"observed_at":"2026-08-07T12:30:15.758569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.14692","last_updated":"2023-07-27T08:28:58Z","snapshot_observed_at":"2026-08-05T17:47:54.974979Z","submitted_at":"2023-07-27T08:28:58Z","title":"Backdoor Attacks for In-Context Learning with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.14692","snapshot_observed_at":"2026-08-07T12:30:15.821630Z","title":"Back- door attacks for in-context learning with language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24445","last_updated":"2025-05-30T10:30:24Z","snapshot_observed_at":"2026-08-07T19:43:43.847346Z","submitted_at":"2025-05-30T10:30:24Z","title":"Learning Safety Constraints for Large Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:15.821630Z"},"links":{"cited_paper":"/paper/2307.14692","citing_paper":"/paper/2505.24445"},"observation_digest":"sha256:790b04ea5c8fde59348a1490e71836251fe329e0358f3489aaadffdfbae84060","observation_id":"d78c2c74-df8f-49c9-87d0-4dd07e0a2639","resolution":{"observed_at":"2026-08-07T12:30:15.821630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04451","last_updated":"2024-03-20T21:34:56Z","snapshot_observed_at":"2026-08-06T02:57:30.438059Z","submitted_at":"2023-10-03T19:44:37Z","title":"AutoDAN: Generating Stealthy Jailbreak Prompts on Aligned Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.04451","snapshot_observed_at":"2026-08-07T12:30:15.939144Z","title":"Autodan: Generat- ing stealthy jailbreak prompts on aligned large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24445","last_updated":"2025-05-30T10:30:24Z","snapshot_observed_at":"2026-08-07T19:43:43.847346Z","submitted_at":"2025-05-30T10:30:24Z","title":"Learning Safety Constraints for Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:15.939144Z"},"links":{"cited_paper":"/paper/2310.04451","citing_paper":"/paper/2505.24445"},"observation_digest":"sha256:cbde7acb441897973d0c9d6034c684cef40a0bdf1b5d6946c4102e7a204ce3de","observation_id":"56cec1a0-9d3c-46d4-b90a-bb3b4cf916c4","resolution":{"observed_at":"2026-08-07T12:30:15.939144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.02475","last_updated":"2024-03-04T20:39:24Z","snapshot_observed_at":"2026-07-06T17:39:29.151236Z","submitted_at":"2024-03-04T20:39:24Z","title":"Enhancing LLM Safety via Constrained Direct Preference Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.02475","snapshot_observed_at":"2026-08-07T12:30:16.012101Z","title":"Enhancing LLM Safety via Constrained Direct Preference Optimization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24445","last_updated":"2025-05-30T10:30:24Z","snapshot_observed_at":"2026-08-07T19:43:43.847346Z","submitted_at":"2025-05-30T10:30:24Z","title":"Learning Safety Constraints for Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:16.012101Z"},"links":{"cited_paper":"/paper/2403.02475","citing_paper":"/paper/2505.24445"},"observation_digest":"sha256:2240a91835279d72930f0b4fc40c2e870fcd1d78d629de780f73424dbff36dbc","observation_id":"7f1d5073-9f8a-45ce-be38-8a0bd2e8880e","resolution":{"observed_at":"2026-08-07T12:30:16.012101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:30:16.069748Z","title":"Mpax: Mathematical pro- gramming in jax","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24445","last_updated":"2025-05-30T10:30:24Z","snapshot_observed_at":"2026-08-07T19:43:43.847346Z","submitted_at":"2025-05-30T10:30:24Z","title":"Learning Safety Constraints for Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:16.069748Z"},"links":{"citing_paper":"/paper/2505.24445"},"observation_digest":"sha256:ebc2c5bce4fb8d71280039d4cfe44cc4af0e6b77f5bb779fdf7fd70d4063f7dc","observation_id":"41797f56-e347-427e-879c-d3aa95e037af","resolution":{"observed_at":"2026-08-07T12:30:16.069748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.19933","last_updated":"2025-02-27T07:28:35Z","snapshot_observed_at":"2026-07-06T19:39:59.961070Z","submitted_at":"2024-10-25T19:08:23Z","title":"Enhancing Safety in Reinforcement Learning with Human Feedback via Rectified Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.19933","snapshot_observed_at":"2026-08-07T12:30:16.143593Z","title":"Enhancing safety in reinforcement learning with human feedback via rectified policy optimization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24445","last_updated":"2025-05-30T10:30:24Z","snapshot_observed_at":"2026-08-07T19:43:43.847346Z","submitted_at":"2025-05-30T10:30:24Z","title":"Learning Safety Constraints for Large Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:16.143593Z"},"links":{"cited_paper":"/paper/2410.19933","citing_paper":"/paper/2505.24445"},"observation_digest":"sha256:258c5776080cf45e2c3089ca5f6d7b5b71c9ee64f496cdb755a5e1cb7825d3ae","observation_id":"5df8c693-4082-40b4-82ae-d1d98aff73cb","resolution":{"observed_at":"2026-08-07T12:30:16.143593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18837","last_updated":"2025-01-31T01:09:32Z","snapshot_observed_at":"2026-07-06T20:28:47.519113Z","submitted_at":"2025-01-31T01:09:32Z","title":"Constitutional Classifiers: Defending against Universal Jailbreaks across Thousands of Hours of Red Teaming","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.18837","snapshot_observed_at":"2026-08-07T12:30:16.217942Z","title":"Constitutional classifiers: Defending against universal jailbreaks across thousands of hours of red teaming.arXiv preprint arXiv:2501.18837,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24445","last_updated":"2025-05-30T10:30:24Z","snapshot_observed_at":"2026-08-07T19:43:43.847346Z","submitted_at":"2025-05-30T10:30:24Z","title":"Learning Safety Constraints for Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:16.217942Z"},"links":{"cited_paper":"/paper/2501.18837","citing_paper":"/paper/2505.24445"},"observation_digest":"sha256:ba70f4da8c583a0e648e0b13513360940272e833912e9181dfa233f04d474552","observation_id":"2481352e-529d-4429-8213-38d98983fd1c","resolution":{"observed_at":"2026-08-07T12:30:16.217942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15549","last_updated":"2025-07-29T09:37:22Z","snapshot_observed_at":"2026-08-06T22:31:48.025702Z","submitted_at":"2024-07-22T11:19:14Z","title":"Latent Adversarial Training Improves Robustness to Persistent Harmful Behaviors in LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15549","snapshot_observed_at":"2026-08-07T12:30:16.287165Z","title":"C., Perez, E., Hadfield- Menell, D., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24445","last_updated":"2025-05-30T10:30:24Z","snapshot_observed_at":"2026-08-07T19:43:43.847346Z","submitted_at":"2025-05-30T10:30:24Z","title":"Learning Safety Constraints for Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:16.287165Z"},"links":{"cited_paper":"/paper/2407.15549","citing_paper":"/paper/2505.24445"},"observation_digest":"sha256:ae055c0ac808e577855ee2f1c404a0c79782d8e70696de82fa6a05919e5c028b","observation_id":"b459100a-c042-471c-be37-2187899fe70f","resolution":{"observed_at":"2026-08-07T12:30:16.287165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.11999","last_updated":"2024-08-30T03:39:57Z","snapshot_observed_at":"2026-07-06T18:02:02.384288Z","submitted_at":"2024-04-18T08:49:38Z","title":"Token-level Direct Preference Optimization","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.11999","snapshot_observed_at":"2026-08-07T12:30:16.341645Z","title":"Token-level direct preference optimization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24445","last_updated":"2025-05-30T10:30:24Z","snapshot_observed_at":"2026-08-07T19:43:43.847346Z","submitted_at":"2025-05-30T10:30:24Z","title":"Learning Safety Constraints for Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:16.341645Z"},"links":{"cited_paper":"/paper/2404.11999","citing_paper":"/paper/2505.24445"},"observation_digest":"sha256:d29215e07d4916bd2479cf1934787c65ba1d17dd1b3ed59a4c84bbfdc8a54ea2","observation_id":"74b81ec1-c15b-4fb3-a0bb-fb078d10d9bd","resolution":{"observed_at":"2026-08-07T12:30:16.341645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02030","last_updated":"2024-05-23T13:49:25Z","snapshot_observed_at":"2026-08-02T22:15:22.617931Z","submitted_at":"2024-02-03T05:01:04Z","title":"Panacea: Pareto Alignment via Preference Adaptation for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02030","snapshot_observed_at":"2026-08-07T12:30:16.406578Z","title":"Panacea: Pareto alignment via preference adaptation for llms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24445","last_updated":"2025-05-30T10:30:24Z","snapshot_observed_at":"2026-08-07T19:43:43.847346Z","submitted_at":"2025-05-30T10:30:24Z","title":"Learning Safety Constraints for Large Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:16.406578Z"},"links":{"cited_paper":"/paper/2402.02030","citing_paper":"/paper/2505.24445"},"observation_digest":"sha256:0600b8dc9333bdf00e36c866581aa8cb8d9ecc7c9c54fce8172614c5bd8323fa","observation_id":"d0b25abb-0b16-4501-8622-7fd70047f051","resolution":{"observed_at":"2026-08-07T12:30:16.406578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:30:17.829272Z","title":"Beyond one-preference-fits-all alignment: Multi-objective direct preference optimization","venue":null,"work_id":"79f622ff-c5c2-414a-be1f-42edb0f2c6a9","year":2024},"citing_paper":{"arxiv_id":"2505.24445","last_updated":"2025-05-30T10:30:24Z","snapshot_observed_at":"2026-08-07T19:43:43.847346Z","submitted_at":"2025-05-30T10:30:24Z","title":"Learning Safety Constraints for Large Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:16.462865Z"},"links":{"citing_paper":"/paper/2505.24445"},"observation_digest":"sha256:50662017ba45f789904db43acf5c90db636427f901fbc6521fe8eb8ee9382b6a","observation_id":"cc3e2173-fffc-4d37-aa3e-989ffb38cc47","resolution":{"observed_at":"2026-08-07T12:30:17.936203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:30:17.641277Z","title":null,"venue":null,"work_id":"85ec0b72-b4fe-4af5-91bf-68348f1b6008","year":2024},"citing_paper":{"arxiv_id":"2505.24445","last_updated":"2025-05-30T10:30:24Z","snapshot_observed_at":"2026-08-07T19:43:43.847346Z","submitted_at":"2025-05-30T10:30:24Z","title":"Learning Safety Constraints for Large Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:16.506016Z"},"links":{"citing_paper":"/paper/2505.24445"},"observation_digest":"sha256:2d6fbc412ab8a9e56a5b36b3f822bbc436bd00d0372760aa9f0c083c488d999c","observation_id":"c06c74f7-cc17-4d49-8621-04f06d5d164c","resolution":{"observed_at":"2026-08-07T12:30:17.725886Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:30:17.448198Z","title":"{human question}\\n{model answer}","venue":null,"work_id":"86fc1653-332a-4338-bb3b-abd85aa41fd8","year":2023},"citing_paper":{"arxiv_id":"2505.24445","last_updated":"2025-05-30T10:30:24Z","snapshot_observed_at":"2026-08-07T19:43:43.847346Z","submitted_at":"2025-05-30T10:30:24Z","title":"Learning Safety Constraints for Large Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:16.558669Z"},"links":{"citing_paper":"/paper/2505.24445"},"observation_digest":"sha256:aa1d6d07f828c091beb4494c25368b8a1b73cb6e6ab54615854109dba9345c48","observation_id":"947a66c1-85a2-4efe-b390-8d096005b368","resolution":{"observed_at":"2026-08-07T12:30:17.579256Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:30:17.232257Z","title":"Results show mean ± standard deviation","venue":null,"work_id":"1ce097ed-d76b-47d2-901c-d1a354875909","year":2021},"citing_paper":{"arxiv_id":"2505.24445","last_updated":"2025-05-30T10:30:24Z","snapshot_observed_at":"2026-08-07T19:43:43.847346Z","submitted_at":"2025-05-30T10:30:24Z","title":"Learning Safety Constraints for Large Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:16.628557Z"},"links":{"citing_paper":"/paper/2505.24445"},"observation_digest":"sha256:9dc4ec61f4dce85ae81b7caaaaa757453ab1d58f4479abb0b1ec5e26377a8ef5","observation_id":"e2f0e159-4e83-4861-9165-53506c0bd2b9","resolution":{"observed_at":"2026-08-07T12:30:17.301765Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02151","last_updated":"2025-04-17T18:55:45Z","snapshot_observed_at":"2026-08-08T01:18:53.200448Z","submitted_at":"2024-04-02T17:58:27Z","title":"Jailbreaking Leading Safety-Aligned LLMs with Simple Adaptive Attacks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02151","snapshot_observed_at":"2026-08-07T12:30:14.786704Z","title":"Jail- breaking leading safety-aligned llms with simple adaptive attacks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24445","last_updated":"2025-05-30T10:30:24Z","snapshot_observed_at":"2026-08-07T19:43:43.847346Z","submitted_at":"2025-05-30T10:30:24Z","title":"Learning Safety Constraints for Large Language Models","version":1},"reference_index":1999,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:14.786704Z"},"links":{"cited_paper":"/paper/2404.02151","citing_paper":"/paper/2505.24445"},"observation_digest":"sha256:9c281473fe31016e5d43459abed8730d279c4af546c35c84794ff59402e21c7a","observation_id":"12ed9f93-7ac7-444e-845a-2394f397f838","resolution":{"observed_at":"2026-08-07T12:30:14.786704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.07958","last_updated":"2022-05-08T02:43:02Z","snapshot_observed_at":"2026-08-03T16:26:48.747700Z","submitted_at":"2021-09-08T17:15:27Z","title":"TruthfulQA: Measuring How Models Mimic Human Falsehoods","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.07958","snapshot_observed_at":"2026-08-07T12:30:15.888021Z","title":"Truthfulqa: Measuring how models mimic human falsehoods","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24445","last_updated":"2025-05-30T10:30:24Z","snapshot_observed_at":"2026-08-07T19:43:43.847346Z","submitted_at":"2025-05-30T10:30:24Z","title":"Learning Safety Constraints for Large Language Models","version":1},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:15.888021Z"},"links":{"cited_paper":"/paper/2109.07958","citing_paper":"/paper/2505.24445"},"observation_digest":"sha256:299327cea3099bada3305dd1f3753b454fdf2a3ab747303970ca9fa68cb63f99","observation_id":"3fc8dcb9-694d-40f7-bfa6-435116fa0bca","resolution":{"observed_at":"2026-08-07T12:30:15.888021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.12312","last_updated":"2022-11-22T15:03:48Z","snapshot_observed_at":"2026-07-06T14:21:45.463565Z","submitted_at":"2022-11-22T15:03:48Z","title":"Interpreting Neural Networks through the Polytope Lens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.12312","snapshot_observed_at":"2026-08-07T12:30:15.138252Z","title":"R., Millidge, B., Alfour, G., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24445","last_updated":"2025-05-30T10:30:24Z","snapshot_observed_at":"2026-08-07T19:43:43.847346Z","submitted_at":"2025-05-30T10:30:24Z","title":"Learning Safety Constraints for Large Language Models","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:15.138252Z"},"links":{"cited_paper":"/paper/2211.12312","citing_paper":"/paper/2505.24445"},"observation_digest":"sha256:e63bbda13a95bf2fb527eb7a91280dd8322b9c99cfaac82534f20e6b7145c6f8","observation_id":"5691e74e-0f86-4b94-8d91-7297b889fcc0","resolution":{"observed_at":"2026-08-07T12:30:15.138252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06942","last_updated":"2024-07-23T06:47:13Z","snapshot_observed_at":"2026-08-06T12:56:48.193649Z","submitted_at":"2023-12-12T02:34:06Z","title":"AI Control: Improving Safety Despite Intentional Subversion","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06942","snapshot_observed_at":"2026-08-07T12:30:15.698528Z","title":"Ai control: Improving safety despite intentional subversion","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24445","last_updated":"2025-05-30T10:30:24Z","snapshot_observed_at":"2026-08-07T19:43:43.847346Z","submitted_at":"2025-05-30T10:30:24Z","title":"Learning Safety Constraints for Large Language Models","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:15.698528Z"},"links":{"cited_paper":"/paper/2312.06942","citing_paper":"/paper/2505.24445"},"observation_digest":"sha256:47152050c4f7cc9861f37624d76181e999bbcaab479a89473dd71b66dace9365","observation_id":"62406f3f-8d92-4d13-9b40-ac547bef0427","resolution":{"observed_at":"2026-08-07T12:30:15.698528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05094","last_updated":"2024-08-09T14:36:42Z","snapshot_observed_at":"2026-08-07T03:38:50.034263Z","submitted_at":"2024-08-09T14:36:42Z","title":"Unlocking Decoding-time Controllability: Gradient-Free Multi-Objective Alignment with Contrastive Prompts","version":1},"cited_work":{"arxiv_id":"2408.05094","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.05094","snapshot_observed_at":"2026-08-07T12:30:16.973232Z","title":"Unlocking Decoding-time Controllability: Gradient-Free Multi-Objective Alignment with Contrastive Prompts","venue":"cs.CL","work_id":"a78018a9-6c90-448c-b473-17ba78af4221","year":2024},"citing_paper":{"arxiv_id":"2505.24445","last_updated":"2025-05-30T10:30:24Z","snapshot_observed_at":"2026-08-07T19:43:43.847346Z","submitted_at":"2025-05-30T10:30:24Z","title":"Learning Safety Constraints for Large Language Models","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:15.545665Z"},"links":{"cited_paper":"/paper/2408.05094","citing_paper":"/paper/2505.24445"},"observation_digest":"sha256:de04758ac27ab9b10b02b62a2a06a275fe07080e60bd5089726abe7ab361428e","observation_id":"4c4f088e-3a56-4d72-9850-0fc309a42dff","resolution":{"observed_at":"2026-08-07T12:30:17.032993Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05030","last_updated":"2025-07-29T09:44:14Z","snapshot_observed_at":"2026-08-07T17:43:00.958834Z","submitted_at":"2024-03-08T04:22:48Z","title":"Defending Against Unforeseen Failure Modes with Latent Adversarial Training","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05030","snapshot_observed_at":"2026-08-07T12:30:15.271464Z","title":"Defending against unforeseen failure modes with latent adversarial training","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24445","last_updated":"2025-05-30T10:30:24Z","snapshot_observed_at":"2026-08-07T19:43:43.847346Z","submitted_at":"2025-05-30T10:30:24Z","title":"Learning Safety Constraints for Large Language Models","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:15.271464Z"},"links":{"cited_paper":"/paper/2403.05030","citing_paper":"/paper/2505.24445"},"observation_digest":"sha256:15e434bdef788eb1aa466812761163e16c3c81ef833fb763f96e7ae76b4cf9a2","observation_id":"28a20280-8c32-43e8-b0aa-224937fb62cc","resolution":{"observed_at":"2026-08-07T12:30:15.271464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:30:18.022907Z","title":"and Bartlett, P","venue":null,"work_id":"58c05457-2e56-4907-9fcd-62a2d748fbca","year":1999},"citing_paper":{"arxiv_id":"2505.24445","last_updated":"2025-05-30T10:30:24Z","snapshot_observed_at":"2026-08-07T19:43:43.847346Z","submitted_at":"2025-05-30T10:30:24Z","title":"Learning Safety Constraints for Large Language Models","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:14.835783Z"},"links":{"citing_paper":"/paper/2505.24445"},"observation_digest":"sha256:0645c563a870880978f129b9c47e48f3b63683a32b87102a851357977cd85b13","observation_id":"05e6391c-18c6-4105-a685-75cfa16f0747","resolution":{"observed_at":"2026-08-07T12:30:18.150799Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.24445","last_updated":"2025-05-30T10:30:24Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T19:43:43.847346Z","submitted_at":"2025-05-30T10:30:24Z","title":"Learning Safety Constraints for Large Language Models"},"reference_resolution":{"displayed":25,"state_counts":{"malformed_identifier":2,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":20,"verified_exact":1,"verified_fuzzy":2},"total_outbound_references":25},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 25 of 25 outbound references and 5 inbound Pith citation observations for arXiv:2505.24445."}