{"as_of":"2026-08-01T13:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fed6724599dda6b2e6aad5b73789a13d4bcc0ea2d76104453a9b5f05c544ab88","coverage":[{"denominator":59,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":59,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-25T21:09:19.727723Z","state":"measured"},{"denominator":59,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":59,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-01T06:32:01.292127+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.25442/citation-record","integrity":"/paper/2606.25442/integrity","json":"/paper/2606.25442/citation-record.json","paper":"/paper/2606.25442"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.15585","last_updated":"2025-06-09T02:36:20Z","snapshot_observed_at":"2026-07-06T21:12:51.325430Z","submitted_at":"2025-04-22T05:02:49Z","title":"A Comprehensive Survey in LLM(-Agent) Full Stack Safety: Data, Training and Deployment","version":4},"cited_work":{"arxiv_id":"2504.15585","doi":"10.48550/arxiv.2504.15585","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.15585","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"A comprehensive survey in llm (-agent) full stack safety: Data, training and deployment","venue":null,"work_id":"890e4d27-50d3-4726-8e34-bbd56d407411","year":2025},"citing_paper":{"arxiv_id":"2606.25442","last_updated":"2026-06-24T06:10:33Z","snapshot_observed_at":"2026-07-06T23:59:52.373272Z","submitted_at":"2026-06-24T06:10:33Z","title":"PolicyAlign: Direct Policy-Based Safety Alignment for Large Language Models","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-06-25T21:09:19.727723Z"},"links":{"cited_paper":"/paper/2504.15585","citing_paper":"/paper/2606.25442"},"observation_digest":"sha256:69312ca81e431d7b7fe616db60ddc0d0670ed47674c5672453ff17e8be16fd35","observation_id":"ef2b4891-04f4-4c96-a460-7e69a64d9593","resolution":{"observed_at":"2026-07-04T19:40:06.706686Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.19672","last_updated":"2025-07-25T20:52:58Z","snapshot_observed_at":"2026-07-06T22:03:05.943334Z","submitted_at":"2025-07-25T20:52:58Z","title":"Alignment and Safety in Large Language Models: Safety Mechanisms, Training Paradigms, and Emerging Challenges","version":1},"cited_work":{"arxiv_id":"2507.19672","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.19672","snapshot_observed_at":"2026-07-04T19:40:06.723481Z","title":"Alignment and safety in large language models: Safety mechanisms, training paradigms, and emerging challenges.arXiv preprint arXiv:2507.19672","venue":null,"work_id":"517eb84e-95d6-41e8-98e4-900bab886e19","year":2025},"citing_paper":{"arxiv_id":"2606.25442","last_updated":"2026-06-24T06:10:33Z","snapshot_observed_at":"2026-07-06T23:59:52.373272Z","submitted_at":"2026-06-24T06:10:33Z","title":"PolicyAlign: Direct Policy-Based Safety Alignment for Large Language Models","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-06-25T21:09:19.727723Z"},"links":{"cited_paper":"/paper/2507.19672","citing_paper":"/paper/2606.25442"},"observation_digest":"sha256:5e3bbc5474cfc7171511f61c83b9d4caffa752bb898a4b0ffdfe2bd177d5e54d","observation_id":"38dfe6e5-ba1c-4977-afac-63d06655746c","resolution":{"observed_at":"2026-07-04T19:40:06.724811Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2502.15871","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T19:40:06.718635Z","title":"A comprehensive survey on the trustworthiness of large language models in healthcare.arXiv preprint arXiv:2502.15871, 4","venue":null,"work_id":"e8315022-d9f4-441e-a74b-bb55030e35b9","year":2025},"citing_paper":{"arxiv_id":"2606.25442","last_updated":"2026-06-24T06:10:33Z","snapshot_observed_at":"2026-07-06T23:59:52.373272Z","submitted_at":"2026-06-24T06:10:33Z","title":"PolicyAlign: Direct Policy-Based Safety Alignment for Large Language Models","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-06-25T21:09:19.727723Z"},"links":{"citing_paper":"/paper/2606.25442"},"observation_digest":"sha256:b3291c5cab7d702cf0fbe99e699aca501a72f0afbfa16e24acef8a59dcb73081","observation_id":"00540679-92bc-4eb7-90b0-b319da0f40a2","resolution":{"observed_at":"2026-07-04T19:40:06.719993Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.10546","last_updated":"2026-04-24T18:29:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-07T22:35:15Z","title":"Learning to Conceal Risk: Controllable Multi-turn Red Teaming for LLMs in the Financial Domain","version":2},"cited_work":{"arxiv_id":"2509.10546","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.10546","snapshot_observed_at":"2026-07-04T19:40:06.713522Z","title":"Learning to Conceal Risk: Controllable Multi-turn Red Teaming for LLMs in the Financial Domain","venue":"cs.CL","work_id":"6834e22f-034d-4718-9b12-e7dd565eb783","year":2025},"citing_paper":{"arxiv_id":"2606.25442","last_updated":"2026-06-24T06:10:33Z","snapshot_observed_at":"2026-07-06T23:59:52.373272Z","submitted_at":"2026-06-24T06:10:33Z","title":"PolicyAlign: Direct Policy-Based Safety Alignment for Large Language Models","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-06-25T21:09:19.727723Z"},"links":{"cited_paper":"/paper/2509.10546","citing_paper":"/paper/2606.25442"},"observation_digest":"sha256:6c0a63febd843f3f3e1fc708e37a8a6e8be59fa7784a4055da0976b8a203bbce","observation_id":"ee84a894-fcc4-4c2f-8167-c6393d390948","resolution":{"observed_at":"2026-07-04T19:40:06.714835Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01769","last_updated":"2024-11-21T23:39:12Z","snapshot_observed_at":"2026-07-06T18:09:08.963593Z","submitted_at":"2024-05-02T22:43:02Z","title":"A Survey on Large Language Models for Critical Societal Domains: Finance, Healthcare, and Law","version":2},"cited_work":{"arxiv_id":"2405.01769","doi":"10.48550/arxiv.2405.01769","metadata_source":"pith","pith_arxiv_id":"2405.01769","snapshot_observed_at":"2026-07-10T08:06:57.501956Z","title":"A Survey on Large Language Models for Critical Societal Domains: Finance, Healthcare, and Law","venue":"cs.CL","work_id":"692402f6-62ca-4f46-a6ff-c1dd81c5eeb8","year":2024},"citing_paper":{"arxiv_id":"2606.25442","last_updated":"2026-06-24T06:10:33Z","snapshot_observed_at":"2026-07-06T23:59:52.373272Z","submitted_at":"2026-06-24T06:10:33Z","title":"PolicyAlign: Direct Policy-Based Safety Alignment for Large Language Models","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-06-25T21:09:19.727723Z"},"links":{"cited_paper":"/paper/2405.01769","citing_paper":"/paper/2606.25442"},"observation_digest":"sha256:a1ce048ed4ea383caf0812dd625b9dcbcd71c22acebfef43b47028d1240e2624","observation_id":"2b841dd2-ce3d-42d2-bb37-1935f1511398","resolution":{"observed_at":"2026-07-04T19:40:06.717399Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-07-18T08:21:09.433752+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-18T08:21:09.433752+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.01652","last_updated":"2022-02-08T20:26:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-09-03T17:55:52Z","title":"Finetuned Language Models Are Zero-Shot Learners","version":5},"cited_work":{"arxiv_id":"2109.01652","doi":"10.3030/823782","metadata_source":"pith","pith_arxiv_id":"2109.01652","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Finetuned Language Models Are Zero-Shot Learners","venue":"cs.CL","work_id":"7ed6cdaa-ed67-4db4-aceb-b7e1b0e6e7c4","year":2021},"citing_paper":{"arxiv_id":"2606.25442","last_updated":"2026-06-24T06:10:33Z","snapshot_observed_at":"2026-07-06T23:59:52.373272Z","submitted_at":"2026-06-24T06:10:33Z","title":"PolicyAlign: Direct Policy-Based Safety Alignment for Large Language Models","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-06-25T21:09:19.727723Z"},"links":{"cited_paper":"/paper/2109.01652","citing_paper":"/paper/2606.25442"},"observation_digest":"sha256:39c697587d6137c36967e252a4350d2a80d1482dfe21b531dfea5ee5b025ddb5","observation_id":"16bbce05-05dd-469f-a85c-eaa325940e29","resolution":{"observed_at":"2026-07-04T19:40:06.727529Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T21:09:19.727723Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.25442","last_updated":"2026-06-24T06:10:33Z","snapshot_observed_at":"2026-07-06T23:59:52.373272Z","submitted_at":"2026-06-24T06:10:33Z","title":"PolicyAlign: Direct Policy-Based Safety Alignment for Large Language Models","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-06-25T21:09:19.727723Z"},"links":{"citing_paper":"/paper/2606.25442"},"observation_digest":"sha256:6433cf244fb3e61008fa243ee95e16d69cda93e69f6ad2c09c4243ded2bd9b91","observation_id":"30042e0e-8060-4138-b776-f01763a18085","resolution":{"observed_at":"2026-06-25T21:09:19.727723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":"2204.05862","doi":"10.1016/j.respol.2005.01.014","metadata_source":"pith","pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","venue":"cs.CL","work_id":"a1f2574b-a899-4713-be60-c87ba332656c","year":2022},"citing_paper":{"arxiv_id":"2606.25442","last_updated":"2026-06-24T06:10:33Z","snapshot_observed_at":"2026-07-06T23:59:52.373272Z","submitted_at":"2026-06-24T06:10:33Z","title":"PolicyAlign: Direct Policy-Based Safety Alignment for Large Language Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-06-25T21:09:19.727723Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2606.25442"},"observation_digest":"sha256:ec68a95091c9e4a2fdf3aa417e07fd948e977c43ba1a21c8d44155c97ce637f5","observation_id":"063af3bb-64f1-4ef0-9510-da9ca0dc6c30","resolution":{"observed_at":"2026-07-04T19:40:06.730995Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T21:09:19.727723Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.25442","last_updated":"2026-06-24T06:10:33Z","snapshot_observed_at":"2026-07-06T23:59:52.373272Z","submitted_at":"2026-06-24T06:10:33Z","title":"PolicyAlign: Direct Policy-Based Safety Alignment for Large Language Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-06-25T21:09:19.727723Z"},"links":{"citing_paper":"/paper/2606.25442"},"observation_digest":"sha256:73b944a947c4574458388cb78364cb06bd4c81930b16067c6d0f591a2025f092","observation_id":"33869db0-c45f-4fc3-8ac6-24afb875e31e","resolution":{"observed_at":"2026-06-25T21:09:19.727723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02151","last_updated":"2025-04-17T18:55:45Z","snapshot_observed_at":"2026-07-06T17:54:43.685212Z","submitted_at":"2024-04-02T17:58:27Z","title":"Jailbreaking Leading Safety-Aligned LLMs with Simple Adaptive Attacks","version":4},"cited_work":{"arxiv_id":"2404.02151","doi":"10.48550/arxiv.2404.02151","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.02151","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"arXiv preprint arXiv:2404.02151 (2024)","venue":null,"work_id":"81e706c8-459e-40a1-a79d-bda6a104cd22","year":2025},"citing_paper":{"arxiv_id":"2606.25442","last_updated":"2026-06-24T06:10:33Z","snapshot_observed_at":"2026-07-06T23:59:52.373272Z","submitted_at":"2026-06-24T06:10:33Z","title":"PolicyAlign: Direct Policy-Based Safety Alignment for Large Language Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-06-25T21:09:19.727723Z"},"links":{"cited_paper":"/paper/2404.02151","citing_paper":"/paper/2606.25442"},"observation_digest":"sha256:2639eee1b6750ce7279c5bfae564be8a1b4113f4236f9a2cd67621557c6a270f","observation_id":"0eb0da7c-0746-4fe1-bd1b-b1ec72a2ccec","resolution":{"observed_at":"2026-07-04T19:40:06.734341Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T21:09:19.727723Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.25442","last_updated":"2026-06-24T06:10:33Z","snapshot_observed_at":"2026-07-06T23:59:52.373272Z","submitted_at":"2026-06-24T06:10:33Z","title":"PolicyAlign: Direct Policy-Based Safety Alignment for Large Language Models","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-06-25T21:09:19.727723Z"},"links":{"citing_paper":"/paper/2606.25442"},"observation_digest":"sha256:533e29955470fc9980f8a6c19749d2111c7eec1bcf51d89622d129fc37d40ff3","observation_id":"9ed7fa22-9d02-43eb-8973-42746823784a","resolution":{"observed_at":"2026-06-25T21:09:19.727723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T21:09:19.727723Z","title":"2023 , number =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.25442","last_updated":"2026-06-24T06:10:33Z","snapshot_observed_at":"2026-07-06T23:59:52.373272Z","submitted_at":"2026-06-24T06:10:33Z","title":"PolicyAlign: Direct Policy-Based Safety Alignment for Large Language Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-06-25T21:09:19.727723Z"},"links":{"citing_paper":"/paper/2606.25442"},"observation_digest":"sha256:6e7f541c8e1873caefeee625e4d789b3f2b00fc89dbda05e3901f4a8906f791e","observation_id":"b12d7ace-971e-4ab8-b91e-aeaccb56cfc6","resolution":{"observed_at":"2026-06-25T21:09:19.727723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T21:09:19.727723Z","title":"2021 , url =","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.25442","last_updated":"2026-06-24T06:10:33Z","snapshot_observed_at":"2026-07-06T23:59:52.373272Z","submitted_at":"2026-06-24T06:10:33Z","title":"PolicyAlign: Direct Policy-Based Safety Alignment for Large Language Models","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-06-25T21:09:19.727723Z"},"links":{"citing_paper":"/paper/2606.25442"},"observation_digest":"sha256:ce8b3b1d4c0abe5204c26edc65c9778a4a0b41432a68b7faac683fdb66df7d1b","observation_id":"7802f74d-0b69-40cc-901c-f6c0a5117119","resolution":{"observed_at":"2026-06-25T21:09:19.727723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T21:09:19.727723Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.25442","last_updated":"2026-06-24T06:10:33Z","snapshot_observed_at":"2026-07-06T23:59:52.373272Z","submitted_at":"2026-06-24T06:10:33Z","title":"PolicyAlign: Direct Policy-Based Safety Alignment for Large Language Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-06-25T21:09:19.727723Z"},"links":{"citing_paper":"/paper/2606.25442"},"observation_digest":"sha256:e6b2571dba957c18f45760d18977e04a3e3ba51a5587f2b00fcdf886f4efde66","observation_id":"424f573e-5625-465f-a56e-6103c5d7eb40","resolution":{"observed_at":"2026-06-25T21:09:19.727723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T21:09:19.727723Z","title":"2021 , url =","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.25442","last_updated":"2026-06-24T06:10:33Z","snapshot_observed_at":"2026-07-06T23:59:52.373272Z","submitted_at":"2026-06-24T06:10:33Z","title":"PolicyAlign: Direct Policy-Based Safety Alignment for Large Language Models","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-06-25T21:09:19.727723Z"},"links":{"citing_paper":"/paper/2606.25442"},"observation_digest":"sha256:4e1ed0df92bc22b3e8607ac640b7b0f001479163323bccf027ea93fd568e8c2f","observation_id":"ac2c9878-a75b-4fe0-b6e8-1624c4d210da","resolution":{"observed_at":"2026-06-25T21:09:19.727723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":"2212.08073","doi":"10.48550/arxiv.2212.08073","metadata_source":"pith","pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-07-11T02:47:49.311954Z","title":"Constitutional AI: Harmlessness from AI Feedback","venue":"cs.CL","work_id":"faaaa4e0-2676-4fac-a0b4-99aef10d2095","year":2022},"citing_paper":{"arxiv_id":"2606.25442","last_updated":"2026-06-24T06:10:33Z","snapshot_observed_at":"2026-07-06T23:59:52.373272Z","submitted_at":"2026-06-24T06:10:33Z","title":"PolicyAlign: Direct Policy-Based Safety Alignment for Large Language Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-06-25T21:09:19.727723Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2606.25442"},"observation_digest":"sha256:a0757702f68b23617dc997c8ca2ad6239f65324e4fcf2d553812c7a4448fc644","observation_id":"31646f2f-037b-4c44-82c5-fe895853b948","resolution":{"observed_at":"2026-07-04T19:40:06.715693Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T07:38:15.114855+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T07:38:15.114855+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T07:38:15.114855+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-07-06T20:11:15.503499Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":"2412.16339","doi":"10.48550/arxiv.2412.16339","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Y ., Joglekar, M., Wallace, E., Jain, S., Barak, B., Heylar, A., Dias, R., Vallone, A., Ren, H., Wei, J., et al","venue":null,"work_id":"900d0032-4aa1-4b47-ab57-616164d48b88","year":2024},"citing_paper":{"arxiv_id":"2606.25442","last_updated":"2026-06-24T06:10:33Z","snapshot_observed_at":"2026-07-06T23:59:52.373272Z","submitted_at":"2026-06-24T06:10:33Z","title":"PolicyAlign: Direct Policy-Based Safety Alignment for Large Language Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-06-25T21:09:19.727723Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2606.25442"},"observation_digest":"sha256:41fcf7aba373e5f84b4d213ff5b3668a05d174bea8fdec7b6ca56afd50ebcca5","observation_id":"8e26d784-e1d1-4784-a47d-feedb03f575d","resolution":{"observed_at":"2026-07-04T19:40:06.722457Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.12275","last_updated":"2026-03-23T13:11:10Z","snapshot_observed_at":"2026-07-06T22:45:39.557598Z","submitted_at":"2026-02-12T18:58:28Z","title":"On-Policy Context Distillation for Language Models","version":2},"cited_work":{"arxiv_id":"2602.12275","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.12275","snapshot_observed_at":"2026-07-10T00:26:39.252472Z","title":"On-Policy Context Distillation for Language Models","venue":"cs.CL","work_id":"b56a7e15-d864-43f4-9212-59bc7ec70d21","year":2026},"citing_paper":{"arxiv_id":"2606.25442","last_updated":"2026-06-24T06:10:33Z","snapshot_observed_at":"2026-07-06T23:59:52.373272Z","submitted_at":"2026-06-24T06:10:33Z","title":"PolicyAlign: Direct Policy-Based Safety Alignment for Large Language Models","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-06-25T21:09:19.727723Z"},"links":{"cited_paper":"/paper/2602.12275","citing_paper":"/paper/2606.25442"},"observation_digest":"sha256:554550df05d4992a13145fc67d15df2538cf05cfe9b7e6a5c1fcfe1f58b30ee6","observation_id":"0c2cfc4a-c5e1-42aa-8778-d54b4fe00fc1","resolution":{"observed_at":"2026-07-04T19:40:06.711996Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":"2307.15043","doi":"10.48550/arxiv.2307.15043","metadata_source":"pith","pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-07-11T02:47:49.837877Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","venue":"cs.CL","work_id":"3322fa86-1768-4677-8425-dd326b45e078","year":2023},"citing_paper":{"arxiv_id":"2606.25442","last_updated":"2026-06-24T06:10:33Z","snapshot_observed_at":"2026-07-06T23:59:52.373272Z","submitted_at":"2026-06-24T06:10:33Z","title":"PolicyAlign: Direct Policy-Based Safety Alignment for Large Language Models","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-06-25T21:09:19.727723Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2606.25442"},"observation_digest":"sha256:ba8b5fcd7c4eb7f94f19902d1487b122d782509bcd22da447fd214a7fbd81dc5","observation_id":"5e1ced3a-7f5d-4991-a6c0-bcdb79932f1e","resolution":{"observed_at":"2026-07-04T19:40:06.675593Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.00555","last_updated":"2025-06-05T03:20:54Z","snapshot_observed_at":"2026-07-31T04:04:55.315536Z","submitted_at":"2025-03-01T16:42:01Z","title":"Safety Tax: Safety Alignment Makes Your Large Reasoning Models Less Reasonable","version":2},"cited_work":{"arxiv_id":"2503.00555","doi":"10.48550/arxiv.2503.00555","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.00555","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Safety tax: Safety alignment makes your large reasoning models less reasonable","venue":null,"work_id":"b0e63685-280f-43d8-adf7-2603cb1c2798","year":2025},"citing_paper":{"arxiv_id":"2606.25442","last_updated":"2026-06-24T06:10:33Z","snapshot_observed_at":"2026-07-06T23:59:52.373272Z","submitted_at":"2026-06-24T06:10:33Z","title":"PolicyAlign: Direct Policy-Based Safety Alignment for Large Language Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-06-25T21:09:19.727723Z"},"links":{"cited_paper":"/paper/2503.00555","citing_paper":"/paper/2606.25442"},"observation_digest":"sha256:1bdef0d6b399d22cde8f10bed04692046af3d3e3ee15eff3c19002e2dc7442cd","observation_id":"e10b7495-3954-4e47-a9bb-616d289a5e6e","resolution":{"observed_at":"2026-07-04T19:40:06.693837Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T21:09:19.727723Z","title":"Proceedings of ICLR , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.25442","last_updated":"2026-06-24T06:10:33Z","snapshot_observed_at":"2026-07-06T23:59:52.373272Z","submitted_at":"2026-06-24T06:10:33Z","title":"PolicyAlign: Direct Policy-Based Safety Alignment for Large Language Models","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-06-25T21:09:19.727723Z"},"links":{"citing_paper":"/paper/2606.25442"},"observation_digest":"sha256:3102dffd321228d3478cbc0bbc0bf13975ffddbd40d5d13c6693b815d897dd3d","observation_id":"8ee96c02-868e-42c1-8bdd-ef45521edad6","resolution":{"observed_at":"2026-06-25T21:09:19.727723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T21:09:19.727723Z","title":"The twelfth international conference on learning representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.25442","last_updated":"2026-06-24T06:10:33Z","snapshot_observed_at":"2026-07-06T23:59:52.373272Z","submitted_at":"2026-06-24T06:10:33Z","title":"PolicyAlign: Direct Policy-Based Safety Alignment for Large Language Models","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-06-25T21:09:19.727723Z"},"links":{"citing_paper":"/paper/2606.25442"},"observation_digest":"sha256:328c3f08f2fee8472c0d49e2ea46c09c89a81d0d82d87b09bc3c1a259790bd15","observation_id":"c39c5b70-4939-4ee7-86e7-2ddfe1e12ba7","resolution":{"observed_at":"2026-06-25T21:09:19.727723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T21:09:19.727723Z","title":"2025 , month =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.25442","last_updated":"2026-06-24T06:10:33Z","snapshot_observed_at":"2026-07-06T23:59:52.373272Z","submitted_at":"2026-06-24T06:10:33Z","title":"PolicyAlign: Direct Policy-Based Safety Alignment for Large Language Models","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-06-25T21:09:19.727723Z"},"links":{"citing_paper":"/paper/2606.25442"},"observation_digest":"sha256:96e9de904d72916881f84873ba656fd9d984419de15b40fa8937f4c082a9c8be","observation_id":"66bc25e0-c54f-4271-b3f3-88da543a8dfa","resolution":{"observed_at":"2026-06-25T21:09:19.727723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T21:09:19.727723Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.25442","last_updated":"2026-06-24T06:10:33Z","snapshot_observed_at":"2026-07-06T23:59:52.373272Z","submitted_at":"2026-06-24T06:10:33Z","title":"PolicyAlign: Direct Policy-Based Safety Alignment for Large Language Models","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-06-25T21:09:19.727723Z"},"links":{"citing_paper":"/paper/2606.25442"},"observation_digest":"sha256:61d5178799a4e3856047784fb2c2519b6cf17f05ed7ed73c2621b7ddfe23bf65","observation_id":"a0cd011e-8d8b-4e24-a5cf-6bea362d161d","resolution":{"observed_at":"2026-06-25T21:09:19.727723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T21:09:19.727723Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.25442","last_updated":"2026-06-24T06:10:33Z","snapshot_observed_at":"2026-07-06T23:59:52.373272Z","submitted_at":"2026-06-24T06:10:33Z","title":"PolicyAlign: Direct Policy-Based Safety Alignment for Large Language Models","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-06-25T21:09:19.727723Z"},"links":{"citing_paper":"/paper/2606.25442"},"observation_digest":"sha256:8f73e67d806524700cc94cac0ef31a9a3a56fcd17c8dc6a56e1344b605803bf2","observation_id":"ab8c767b-04bb-4f45-a8c8-973efd854090","resolution":{"observed_at":"2026-06-25T21:09:19.727723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T21:09:19.727723Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.25442","last_updated":"2026-06-24T06:10:33Z","snapshot_observed_at":"2026-07-06T23:59:52.373272Z","submitted_at":"2026-06-24T06:10:33Z","title":"PolicyAlign: Direct Policy-Based Safety Alignment for Large Language Models","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-06-25T21:09:19.727723Z"},"links":{"citing_paper":"/paper/2606.25442"},"observation_digest":"sha256:5d3bc79e239b9f994c0a7009985867da831050c2b46186a10e164819911c44a2","observation_id":"9dd28c2e-5b09-47c3-9cee-e94441678bbf","resolution":{"observed_at":"2026-06-25T21:09:19.727723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01574","last_updated":"2024-11-06T02:54:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-03T17:53:00Z","title":"MMLU-Pro: A More Robust and Challenging Multi-Task Language Understanding Benchmark","version":6},"cited_work":{"arxiv_id":"2406.01574","doi":"10.1145/3711896.3737413","metadata_source":"pith","pith_arxiv_id":"2406.01574","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"MMLU-Pro: A More Robust and Challenging Multi-Task Language Understanding Benchmark","venue":"cs.CL","work_id":"3c028052-035a-4c22-b80e-3046edb44adc","year":2024},"citing_paper":{"arxiv_id":"2606.25442","last_updated":"2026-06-24T06:10:33Z","snapshot_observed_at":"2026-07-06T23:59:52.373272Z","submitted_at":"2026-06-24T06:10:33Z","title":"PolicyAlign: Direct Policy-Based Safety Alignment for Large Language Models","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-06-25T21:09:19.727723Z"},"links":{"cited_paper":"/paper/2406.01574","citing_paper":"/paper/2606.25442"},"observation_digest":"sha256:3efd0bceba1a6542564b155af3d617f364f1e672d48b976daadca48cb78f6723","observation_id":"fbc3ed8f-f90e-4dd9-9fdc-e053bf2fa2ef","resolution":{"observed_at":"2026-07-04T19:40:06.699084Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T21:09:19.727723Z","title":"2023 , eprint=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.25442","last_updated":"2026-06-24T06:10:33Z","snapshot_observed_at":"2026-07-06T23:59:52.373272Z","submitted_at":"2026-06-24T06:10:33Z","title":"PolicyAlign: Direct Policy-Based Safety Alignment for Large Language Models","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-06-25T21:09:19.727723Z"},"links":{"citing_paper":"/paper/2606.25442"},"observation_digest":"sha256:3a5890dfe12d7c5ac9f190093a6468cb2c16cddd67273644a1a290ad8a749b7e","observation_id":"b2b9d4d1-78bb-43ad-a298-0b44dac91934","resolution":{"observed_at":"2026-06-25T21:09:19.727723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20050","last_updated":"2023-05-31T17:24:00Z","snapshot_observed_at":"2026-07-31T17:40:45.057417Z","submitted_at":"2023-05-31T17:24:00Z","title":"Let's Verify Step by Step","version":1},"cited_work":{"arxiv_id":"2305.20050","doi":"10.1007/bf00262952","metadata_source":"pith","pith_arxiv_id":"2305.20050","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Let's Verify Step by Step","venue":"cs.LG","work_id":"6d05b790-04c5-4fd2-91b2-ba1dfdd5770f","year":2023},"citing_paper":{"arxiv_id":"2606.25442","last_updated":"2026-06-24T06:10:33Z","snapshot_observed_at":"2026-07-06T23:59:52.373272Z","submitted_at":"2026-06-24T06:10:33Z","title":"PolicyAlign: Direct Policy-Based Safety Alignment for Large Language Models","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-06-25T21:09:19.727723Z"},"links":{"cited_paper":"/paper/2305.20050","citing_paper":"/paper/2606.25442"},"observation_digest":"sha256:9cd6be6d72160757f5436b7f7dab9bc95e8149c21f6009bc51d58201dbe84db2","observation_id":"52df4b8f-95b3-4843-b44f-151ceebbe86a","resolution":{"observed_at":"2026-07-04T19:40:06.701504Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.naacl-long.301","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T04:50:41.612108Z","title":"XSTest: A test suite for identifying exaggerated safety behaviours in large language models","venue":null,"work_id":"91f5c2bb-cc61-45df-aa14-108d319cfea9","year":2024},"citing_paper":{"arxiv_id":"2606.25442","last_updated":"2026-06-24T06:10:33Z","snapshot_observed_at":"2026-07-06T23:59:52.373272Z","submitted_at":"2026-06-24T06:10:33Z","title":"PolicyAlign: Direct Policy-Based Safety Alignment for Large Language Models","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-06-25T21:09:19.727723Z"},"links":{"citing_paper":"/paper/2606.25442"},"observation_digest":"sha256:9b5b5c771cae83a4d1de8b185954cda667ba730713d172e303ba61b964f159a5","observation_id":"f31f60cf-3d9a-457e-be1f-7e86f176ce46","resolution":{"observed_at":"2026-06-25T21:18:24.202555Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T21:09:19.727723Z","title":"Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.25442","last_updated":"2026-06-24T06:10:33Z","snapshot_observed_at":"2026-07-06T23:59:52.373272Z","submitted_at":"2026-06-24T06:10:33Z","title":"PolicyAlign: Direct Policy-Based Safety Alignment for Large Language Models","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-06-25T21:09:19.727723Z"},"links":{"citing_paper":"/paper/2606.25442"},"observation_digest":"sha256:5e18360b03ec560b4564ee9eecbd05d8dec85a3f94b7d3b56cb1d1c9ae68a98f","observation_id":"6a3b0c63-c3a4-4c76-b368-32fbc6508cd2","resolution":{"observed_at":"2026-06-25T21:09:19.727723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T21:09:19.727723Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.25442","last_updated":"2026-06-24T06:10:33Z","snapshot_observed_at":"2026-07-06T23:59:52.373272Z","submitted_at":"2026-06-24T06:10:33Z","title":"PolicyAlign: Direct Policy-Based Safety Alignment for Large Language Models","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-06-25T21:09:19.727723Z"},"links":{"citing_paper":"/paper/2606.25442"},"observation_digest":"sha256:12cb8d4a4427f1dac8f8330829e627022e6666db14c1982865ce33a541a6bbb3","observation_id":"e58cc4d2-add5-44a0-8e57-a1917d85d278","resolution":{"observed_at":"2026-06-25T21:09:19.727723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.10387","doi":"10.48550/arxiv.2603.10387","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Don’t let the claw grip your hand: A security analysis and defense framework for OpenClaw","venue":null,"work_id":"419d68e7-2dfc-4480-9d0a-0da2040a78d4","year":2026},"citing_paper":{"arxiv_id":"2606.25442","last_updated":"2026-06-24T06:10:33Z","snapshot_observed_at":"2026-07-06T23:59:52.373272Z","submitted_at":"2026-06-24T06:10:33Z","title":"PolicyAlign: Direct Policy-Based Safety Alignment for Large Language Models","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-06-25T21:09:19.727723Z"},"links":{"citing_paper":"/paper/2606.25442"},"observation_digest":"sha256:83b9492105b54c40e9e044f5becfe14c7f212b3660c80a325453ae135942c809","observation_id":"ae156d65-22ee-4fa7-a915-5116aeb5f20f","resolution":{"observed_at":"2026-07-04T19:40:06.670026Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T21:09:19.727723Z","title":"IEEE Transactions on Pattern Analysis and Machine Intelligence , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.25442","last_updated":"2026-06-24T06:10:33Z","snapshot_observed_at":"2026-07-06T23:59:52.373272Z","submitted_at":"2026-06-24T06:10:33Z","title":"PolicyAlign: Direct Policy-Based Safety Alignment for Large Language Models","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-06-25T21:09:19.727723Z"},"links":{"citing_paper":"/paper/2606.25442"},"observation_digest":"sha256:763209a821bdf71b2e37bf91d679cb54947f613d8f071ac252f46ac4e1080fd9","observation_id":"c9a31ea6-4098-4c20-b102-8913135f6e15","resolution":{"observed_at":"2026-06-25T21:09:19.727723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T21:09:19.727723Z","title":"Proceedings of the 26th annual international conference on machine learning , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.25442","last_updated":"2026-06-24T06:10:33Z","snapshot_observed_at":"2026-07-06T23:59:52.373272Z","submitted_at":"2026-06-24T06:10:33Z","title":"PolicyAlign: Direct Policy-Based Safety Alignment for Large Language Models","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-06-25T21:09:19.727723Z"},"links":{"citing_paper":"/paper/2606.25442"},"observation_digest":"sha256:e9382ed718a80f0451c8f2e565c86973f0c9771ba2ab14d22c23f3d45086a16f","observation_id":"39b53d08-9530-4e02-a025-20c1613b9827","resolution":{"observed_at":"2026-06-25T21:09:19.727723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T21:09:19.727723Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.25442","last_updated":"2026-06-24T06:10:33Z","snapshot_observed_at":"2026-07-06T23:59:52.373272Z","submitted_at":"2026-06-24T06:10:33Z","title":"PolicyAlign: Direct Policy-Based Safety Alignment for Large Language Models","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-06-25T21:09:19.727723Z"},"links":{"citing_paper":"/paper/2606.25442"},"observation_digest":"sha256:9bfb5955cb3f4bf42bf33792c17006b8c3ef59715d8c0cf7e9ce8bd465ffd4ab","observation_id":"ebde2d01-7dd4-4c44-b1b9-86b91501ab39","resolution":{"observed_at":"2026-06-25T21:09:19.727723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T21:09:19.727723Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.25442","last_updated":"2026-06-24T06:10:33Z","snapshot_observed_at":"2026-07-06T23:59:52.373272Z","submitted_at":"2026-06-24T06:10:33Z","title":"PolicyAlign: Direct Policy-Based Safety Alignment for Large Language Models","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-06-25T21:09:19.727723Z"},"links":{"citing_paper":"/paper/2606.25442"},"observation_digest":"sha256:922948fd7a79c57c585e6d1abc2112a8ea0d8e35b4311e30e5364fa37e8c7eac","observation_id":"ac0dbfff-3d16-4027-9c79-e09c893b51e6","resolution":{"observed_at":"2026-06-25T21:09:19.727723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T21:09:19.727723Z","title":"Six Musts and Six Don'ts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.25442","last_updated":"2026-06-24T06:10:33Z","snapshot_observed_at":"2026-07-06T23:59:52.373272Z","submitted_at":"2026-06-24T06:10:33Z","title":"PolicyAlign: Direct Policy-Based Safety Alignment for Large Language Models","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-06-25T21:09:19.727723Z"},"links":{"citing_paper":"/paper/2606.25442"},"observation_digest":"sha256:bedac0af0f130ac73712c4020d3626c61d2ac5fde5f975b828aef4063786ba15","observation_id":"e6b0741c-e2bd-49ea-86e1-b48c43f2d4d4","resolution":{"observed_at":"2026-06-25T21:09:19.727723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T21:09:19.727723Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.25442","last_updated":"2026-06-24T06:10:33Z","snapshot_observed_at":"2026-07-06T23:59:52.373272Z","submitted_at":"2026-06-24T06:10:33Z","title":"PolicyAlign: Direct Policy-Based Safety Alignment for Large Language Models","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-06-25T21:09:19.727723Z"},"links":{"citing_paper":"/paper/2606.25442"},"observation_digest":"sha256:90cc9b82b01995505f4c6193be7d31ccc14830584a1e8506efe53a2b7f5263e1","observation_id":"1199e169-126d-4f67-84be-b8161cb526aa","resolution":{"observed_at":"2026-06-25T21:09:19.727723Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T21:09:19.727723Z","title":"ArXiv , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.25442","last_updated":"2026-06-24T06:10:33Z","snapshot_observed_at":"2026-07-06T23:59:52.373272Z","submitted_at":"2026-06-24T06:10:33Z","title":"PolicyAlign: Direct Policy-Based Safety Alignment for Large Language Models","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-06-25T21:09:19.727723Z"},"links":{"citing_paper":"/paper/2606.25442"},"observation_digest":"sha256:f85a2938ee67d6b5bb0d5ea6533a853369b64f9674dec6a78de51c6f8d967f67","observation_id":"5ef722e4-291e-4598-b0ab-a91b14451974","resolution":{"observed_at":"2026-06-25T21:09:19.727723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.14987","last_updated":"2025-07-20T14:47:03Z","snapshot_observed_at":"2026-07-06T21:59:59.698990Z","submitted_at":"2025-07-20T14:47:03Z","title":"AlphaAlign: Incentivizing Safety Alignment with Extremely Simplified Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2507.14987","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.14987","snapshot_observed_at":"2026-07-04T19:40:06.671432Z","title":"Alphaalign: Incentivizing safety alignment with extremely simplified reinforcement learning.CoRR, abs/2507.14987","venue":null,"work_id":"c961b5c1-330b-4660-8cd1-0eb93ecc0099","year":2025},"citing_paper":{"arxiv_id":"2606.25442","last_updated":"2026-06-24T06:10:33Z","snapshot_observed_at":"2026-07-06T23:59:52.373272Z","submitted_at":"2026-06-24T06:10:33Z","title":"PolicyAlign: Direct Policy-Based Safety Alignment for Large Language Models","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-06-25T21:09:19.727723Z"},"links":{"cited_paper":"/paper/2507.14987","citing_paper":"/paper/2606.25442"},"observation_digest":"sha256:e58b7b630bc1c26505b070695a628ad7b37950df6535266570cfbaaece71c18b","observation_id":"a1575c0b-db97-42d4-a424-7ccff2530cb6","resolution":{"observed_at":"2026-07-04T19:40:06.672952Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.11391","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T19:40:06.702557Z","title":"Mitigating the safety alignment tax with null-space constrained policy optimization.arXiv preprint arXiv:2512.11391","venue":null,"work_id":"f8b86403-314c-4e5c-9652-137c78dd0176","year":2025},"citing_paper":{"arxiv_id":"2606.25442","last_updated":"2026-06-24T06:10:33Z","snapshot_observed_at":"2026-07-06T23:59:52.373272Z","submitted_at":"2026-06-24T06:10:33Z","title":"PolicyAlign: Direct Policy-Based Safety Alignment for Large Language Models","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-06-25T21:09:19.727723Z"},"links":{"citing_paper":"/paper/2606.25442"},"observation_digest":"sha256:ec8916f14e36b93dfb52c5fbe4dded6fc44f17fdf8415f5f60a8f97f2992e9b8","observation_id":"5300cfbe-bb71-417c-a802-6545904e7933","resolution":{"observed_at":"2026-07-04T19:40:06.703822Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2606.25442","last_updated":"2026-06-24T06:10:33Z","snapshot_observed_at":"2026-07-06T23:59:52.373272Z","submitted_at":"2026-06-24T06:10:33Z","title":"PolicyAlign: Direct Policy-Based Safety Alignment for Large Language Models","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-06-25T21:09:19.727723Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2606.25442"},"observation_digest":"sha256:3189dc61d57bb96a722c962739bd664de84990c994e766be0bb376848d15fcc7","observation_id":"a240646d-925d-4c5d-8573-fc7eca196ad5","resolution":{"observed_at":"2026-07-04T19:40:06.689192Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14276","last_updated":"2025-10-16T04:00:18Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-16T04:00:18Z","title":"Qwen3Guard Technical Report","version":1},"cited_work":{"arxiv_id":"2510.14276","doi":"10.48550/arxiv.2510.14276","metadata_source":"pith","pith_arxiv_id":"2510.14276","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Qwen3Guard Technical Report","venue":"cs.CL","work_id":"de1c5964-d29a-456c-97cc-30684b243a85","year":2025},"citing_paper":{"arxiv_id":"2606.25442","last_updated":"2026-06-24T06:10:33Z","snapshot_observed_at":"2026-07-06T23:59:52.373272Z","submitted_at":"2026-06-24T06:10:33Z","title":"PolicyAlign: Direct Policy-Based Safety Alignment for Large Language Models","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-06-25T21:09:19.727723Z"},"links":{"cited_paper":"/paper/2510.14276","citing_paper":"/paper/2606.25442"},"observation_digest":"sha256:2e3a491f411f843fada14e38778061e3fc71ccfbc04f7e0389b172ffc5e56d0a","observation_id":"9b5ea55a-911f-4b47-aa53-578cc0a2dbb6","resolution":{"observed_at":"2026-07-04T19:40:06.686892Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":"2410.21276","doi":"10.1177/15248380231178756","metadata_source":"pith","pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"GPT-4o System Card","venue":"cs.CL","work_id":"f37bf1c7-4964-4e56-9762-d20da8d9009f","year":2024},"citing_paper":{"arxiv_id":"2606.25442","last_updated":"2026-06-24T06:10:33Z","snapshot_observed_at":"2026-07-06T23:59:52.373272Z","submitted_at":"2026-06-24T06:10:33Z","title":"PolicyAlign: Direct Policy-Based Safety Alignment for Large Language Models","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-06-25T21:09:19.727723Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2606.25442"},"observation_digest":"sha256:91da9d654388e616a65b3972ab71b40fd89ff7af723ef2a12c5b36d9bcbf88b3","observation_id":"0d4eab1e-2d4b-43b0-981f-b8180462b169","resolution":{"observed_at":"2026-07-04T19:40:06.691468Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T21:09:19.727723Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.25442","last_updated":"2026-06-24T06:10:33Z","snapshot_observed_at":"2026-07-06T23:59:52.373272Z","submitted_at":"2026-06-24T06:10:33Z","title":"PolicyAlign: Direct Policy-Based Safety Alignment for Large Language Models","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-06-25T21:09:19.727723Z"},"links":{"citing_paper":"/paper/2606.25442"},"observation_digest":"sha256:c9bfb756baacf5ea0254a8c29514ee4bca089cb64bf1bfcb4842ef181916dcc3","observation_id":"5424a20c-1c24-40d1-9f2d-1354db667f49","resolution":{"observed_at":"2026-06-25T21:09:19.727723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.11413","last_updated":"2025-05-16T16:25:51Z","snapshot_observed_at":"2026-07-06T21:25:08.411184Z","submitted_at":"2025-05-16T16:25:51Z","title":"CARES: Comprehensive Evaluation of Safety and Adversarial Robustness in Medical LLMs","version":1},"cited_work":{"arxiv_id":"2505.11413","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.11413","snapshot_observed_at":"2026-07-10T18:57:31.603078Z","title":"Wenhu Chen et al","venue":"cs.CL","work_id":"cb8e4ad0-d739-4338-a07b-a6783cb1c115","year":2025},"citing_paper":{"arxiv_id":"2606.25442","last_updated":"2026-06-24T06:10:33Z","snapshot_observed_at":"2026-07-06T23:59:52.373272Z","submitted_at":"2026-06-24T06:10:33Z","title":"PolicyAlign: Direct Policy-Based Safety Alignment for Large Language Models","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-06-25T21:09:19.727723Z"},"links":{"cited_paper":"/paper/2505.11413","citing_paper":"/paper/2606.25442"},"observation_digest":"sha256:00dec2d5b6f2995a3615de771909e0cbc2775210309952fc4ef2756675d6ad33","observation_id":"36b75ef0-39c3-4866-96ea-7963ec50229a","resolution":{"observed_at":"2026-07-04T19:40:06.696508Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T21:09:19.727723Z","title":"Applied Sciences , volume=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.25442","last_updated":"2026-06-24T06:10:33Z","snapshot_observed_at":"2026-07-06T23:59:52.373272Z","submitted_at":"2026-06-24T06:10:33Z","title":"PolicyAlign: Direct Policy-Based Safety Alignment for Large Language Models","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-06-25T21:09:19.727723Z"},"links":{"citing_paper":"/paper/2606.25442"},"observation_digest":"sha256:0645b36ebb9675344e732b4deb2c1cfb7e3b4233cf76f9352299e13825119183","observation_id":"520ee891-6745-4005-90f6-9693777cd455","resolution":{"observed_at":"2026-06-25T21:09:19.727723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T21:09:19.727723Z","title":"Conference on health, inference, and learning , pages=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.25442","last_updated":"2026-06-24T06:10:33Z","snapshot_observed_at":"2026-07-06T23:59:52.373272Z","submitted_at":"2026-06-24T06:10:33Z","title":"PolicyAlign: Direct Policy-Based Safety Alignment for Large Language Models","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-06-25T21:09:19.727723Z"},"links":{"citing_paper":"/paper/2606.25442"},"observation_digest":"sha256:61ec4363add40e482173150fa50aceabdbb26758c07034d2f3ab99548c1de65b","observation_id":"7ac1b6bf-d013-413f-8a74-311da2741bd9","resolution":{"observed_at":"2026-06-25T21:09:19.727723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T21:09:19.727723Z","title":"The Thirty-ninth Annual Conference on Neural Information Processing Systems Datasets and Benchmarks Track , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.25442","last_updated":"2026-06-24T06:10:33Z","snapshot_observed_at":"2026-07-06T23:59:52.373272Z","submitted_at":"2026-06-24T06:10:33Z","title":"PolicyAlign: Direct Policy-Based Safety Alignment for Large Language Models","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-06-25T21:09:19.727723Z"},"links":{"citing_paper":"/paper/2606.25442"},"observation_digest":"sha256:4ab78d74de5871cd19ce5ed90843fe33913724d01bad60c5182270f1a7c74127","observation_id":"c9371e08-57b8-40ce-b1ce-9aaf00f74c1e","resolution":{"observed_at":"2026-06-25T21:09:19.727723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21134","last_updated":"2026-07-27T09:44:33Z","snapshot_observed_at":"2026-07-30T23:57:34.794982Z","submitted_at":"2025-07-22T17:52:29Z","title":"TRIDENT: Benchmarking LLM Safety in Finance, Medicine, and Law","version":2},"cited_work":{"arxiv_id":"2507.21134","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.21134","snapshot_observed_at":"2026-07-28T02:23:16.096771Z","title":"InInternational Conference on Learning Representations","venue":null,"work_id":"2e6dbf1f-b06d-4a39-a9e4-8a1994513537","year":2025},"citing_paper":{"arxiv_id":"2606.25442","last_updated":"2026-06-24T06:10:33Z","snapshot_observed_at":"2026-07-06T23:59:52.373272Z","submitted_at":"2026-06-24T06:10:33Z","title":"PolicyAlign: Direct Policy-Based Safety Alignment for Large Language Models","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-06-25T21:09:19.727723Z"},"links":{"cited_paper":"/paper/2507.21134","citing_paper":"/paper/2606.25442"},"observation_digest":"sha256:5f5714dae6c54089f8ad69c62ef800a252c053159fc0f3814a7d3ff7a4f9a6e6","observation_id":"336bcbc7-9e21-49cf-8bc1-50df8dd86755","resolution":{"observed_at":"2026-07-28T02:23:16.096771Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.12864","doi":"10.48550/arxiv.2505.12864","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Lexam: Benchmarking legal reasoning on 340 law exams","venue":null,"work_id":"19066673-ddb6-437e-bbfa-bfbfab714f0a","year":2025},"citing_paper":{"arxiv_id":"2606.25442","last_updated":"2026-06-24T06:10:33Z","snapshot_observed_at":"2026-07-06T23:59:52.373272Z","submitted_at":"2026-06-24T06:10:33Z","title":"PolicyAlign: Direct Policy-Based Safety Alignment for Large Language Models","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-06-25T21:09:19.727723Z"},"links":{"citing_paper":"/paper/2606.25442"},"observation_digest":"sha256:79e3a7ccac4ea6aace5ef238447af9a7bf9d23948c4dd1b8ebb3390acd1c5429","observation_id":"376865d9-67da-4068-b0ca-abcb4744e035","resolution":{"observed_at":"2026-07-04T19:40:06.680858Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.11944","last_updated":"2023-11-20T17:28:02Z","snapshot_observed_at":"2026-07-06T16:50:06.095609Z","submitted_at":"2023-11-20T17:28:02Z","title":"FinanceBench: A New Benchmark for Financial Question Answering","version":1},"cited_work":{"arxiv_id":"2311.11944","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.11944","snapshot_observed_at":"2026-07-04T20:40:08.190653Z","title":"FinanceBench: A New Benchmark for Financial Question Answering","venue":"cs.CL","work_id":"b60d115e-50dd-42f6-9178-5d29b05e1e89","year":2023},"citing_paper":{"arxiv_id":"2606.25442","last_updated":"2026-06-24T06:10:33Z","snapshot_observed_at":"2026-07-06T23:59:52.373272Z","submitted_at":"2026-06-24T06:10:33Z","title":"PolicyAlign: Direct Policy-Based Safety Alignment for Large Language Models","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-06-25T21:09:19.727723Z"},"links":{"cited_paper":"/paper/2311.11944","citing_paper":"/paper/2606.25442"},"observation_digest":"sha256:b3297924acdfe88db3d5f87a9e6f79f3d60da9af749fb809dc8b0d9064fc6dfd","observation_id":"67f19427-f5e0-441e-b2e8-8d8d7016ce46","resolution":{"observed_at":"2026-07-04T19:40:06.684250Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T21:09:19.727723Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.25442","last_updated":"2026-06-24T06:10:33Z","snapshot_observed_at":"2026-07-06T23:59:52.373272Z","submitted_at":"2026-06-24T06:10:33Z","title":"PolicyAlign: Direct Policy-Based Safety Alignment for Large Language Models","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-06-25T21:09:19.727723Z"},"links":{"citing_paper":"/paper/2606.25442"},"observation_digest":"sha256:efdf08d5649b0ab0a475431d5a563112e072e90335795a14af43929e2957f544","observation_id":"b635e296-c506-4f49-82fb-bdda3f0854f7","resolution":{"observed_at":"2026-06-25T21:09:19.727723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T21:09:19.727723Z","title":"2025 , url=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.25442","last_updated":"2026-06-24T06:10:33Z","snapshot_observed_at":"2026-07-06T23:59:52.373272Z","submitted_at":"2026-06-24T06:10:33Z","title":"PolicyAlign: Direct Policy-Based Safety Alignment for Large Language Models","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-06-25T21:09:19.727723Z"},"links":{"citing_paper":"/paper/2606.25442"},"observation_digest":"sha256:9a11b4a23ef679eaa5b65d4de236f9124e997d0e869bf7dbbaaf52d1c0d9d5b0","observation_id":"cbbc50e2-44d1-4fc9-a53e-dc720838c09c","resolution":{"observed_at":"2026-06-25T21:09:19.727723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T21:09:19.727723Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.25442","last_updated":"2026-06-24T06:10:33Z","snapshot_observed_at":"2026-07-06T23:59:52.373272Z","submitted_at":"2026-06-24T06:10:33Z","title":"PolicyAlign: Direct Policy-Based Safety Alignment for Large Language Models","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-06-25T21:09:19.727723Z"},"links":{"citing_paper":"/paper/2606.25442"},"observation_digest":"sha256:da77b502f3bf896e70ab71a4cca430cb278ae24fbacfa81e084642d44aeaa202","observation_id":"4a6e2df9-644e-499a-a87c-90ac22b74fb1","resolution":{"observed_at":"2026-06-25T21:09:19.727723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T21:09:19.727723Z","title":"2026 , journal =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.25442","last_updated":"2026-06-24T06:10:33Z","snapshot_observed_at":"2026-07-06T23:59:52.373272Z","submitted_at":"2026-06-24T06:10:33Z","title":"PolicyAlign: Direct Policy-Based Safety Alignment for Large Language Models","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-06-25T21:09:19.727723Z"},"links":{"citing_paper":"/paper/2606.25442"},"observation_digest":"sha256:a9ae359d2e8b26fc8df891a47d7b0996229f57470484409ad61e479a01b952e6","observation_id":"f51f8ef4-1671-4044-bc7a-8aa6f0157764","resolution":{"observed_at":"2026-06-25T21:09:19.727723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T21:09:19.727723Z","title":"2026 , eprint=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.25442","last_updated":"2026-06-24T06:10:33Z","snapshot_observed_at":"2026-07-06T23:59:52.373272Z","submitted_at":"2026-06-24T06:10:33Z","title":"PolicyAlign: Direct Policy-Based Safety Alignment for Large Language Models","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-06-25T21:09:19.727723Z"},"links":{"citing_paper":"/paper/2606.25442"},"observation_digest":"sha256:d54446d50f7c1133c7879521eed140fe2ece45fab2d3b0d2e3ddd7b5aa8e79d1","observation_id":"7ac1baa8-2446-4e9d-a865-9dd4ab8c0a6d","resolution":{"observed_at":"2026-06-25T21:09:19.727723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T21:09:19.727723Z","title":"2024 , month = jul, doi =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.25442","last_updated":"2026-06-24T06:10:33Z","snapshot_observed_at":"2026-07-06T23:59:52.373272Z","submitted_at":"2026-06-24T06:10:33Z","title":"PolicyAlign: Direct Policy-Based Safety Alignment for Large Language Models","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-06-25T21:09:19.727723Z"},"links":{"citing_paper":"/paper/2606.25442"},"observation_digest":"sha256:74de402f39564b59d08778404dcc74b924edced396dd580fffa17878842b431e","observation_id":"cedabc4c-819e-46f1-84bb-7b2fe63782fd","resolution":{"observed_at":"2026-06-25T21:09:19.727723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.25442","last_updated":"2026-06-24T06:10:33Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T23:59:52.373272Z","submitted_at":"2026-06-24T06:10:33Z","title":"PolicyAlign: Direct Policy-Based Safety Alignment for Large Language Models"},"reference_resolution":{"displayed":59,"state_counts":{"malformed_identifier":0,"metadata_mismatch":21,"parse_uncertain":1,"unresolved":32,"verified_exact":5,"verified_fuzzy":0},"total_outbound_references":59},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"thesis":"As of 1 August 2026, this Paper Citation Record lists 59 of 59 outbound references and 0 inbound Pith citation observations for arXiv:2606.25442."}