{"as_of":"2026-08-05T12:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f3148bfd2d3cadab9c630e7b5e25846fce5424c49e9232cceb4fd13c2a19d93b","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":40,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T19:55:56.585528Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":6,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.14598","last_updated":"2025-03-01T21:45:36Z","snapshot_observed_at":"2026-07-06T18:34:29.513732Z","submitted_at":"2024-06-20T17:56:07Z","title":"SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal","version":2},"cited_work":{"arxiv_id":"2406.14598","doi":"10.48550/arxiv.2406.14598","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.14598","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv:2406.14598 (2025)","venue":"arXiv (Cornell University)","work_id":"5f6c39b5-65d4-4261-a0d0-63007ebce626","year":2025},"citing_paper":{"arxiv_id":"2410.02644","last_updated":"2025-05-30T03:50:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-03T16:30:47Z","title":"Agent Security Bench (ASB): Formalizing and Benchmarking Attacks and Defenses in LLM-based Agents","version":4},"reference_index":148,"source":"arxiv_source","source_observed_at":"2026-05-12T13:36:57.011451Z"},"links":{"cited_paper":"/paper/2406.14598","citing_paper":"/paper/2410.02644"},"observation_digest":"sha256:434d3c462a9bfff9728146596bd158224b1f47d50f05a53888bee880631f8b2c","observation_id":"cf7b16cb-dcf4-49a5-bcad-a26f9edf9c18","resolution":{"observed_at":"2026-05-12T13:36:57.194715Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14598","last_updated":"2025-03-01T21:45:36Z","snapshot_observed_at":"2026-07-06T18:34:29.513732Z","submitted_at":"2024-06-20T17:56:07Z","title":"SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal","version":2},"cited_work":{"arxiv_id":"2406.14598","doi":"10.48550/arxiv.2406.14598","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.14598","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv:2406.14598 (2025)","venue":"arXiv (Cornell University)","work_id":"5f6c39b5-65d4-4261-a0d0-63007ebce626","year":2025},"citing_paper":{"arxiv_id":"2411.15594","last_updated":"2025-10-19T10:32:43Z","snapshot_observed_at":"2026-08-02T10:23:50.881300Z","submitted_at":"2024-11-23T16:03:35Z","title":"A Survey on LLM-as-a-Judge","version":6},"reference_index":178,"source":"pdf_text","source_observed_at":"2026-05-23T17:33:13.394338Z"},"links":{"cited_paper":"/paper/2406.14598","citing_paper":"/paper/2411.15594"},"observation_digest":"sha256:197ae9033e2338189d940d58ae2a93ff91a716560cb8576646a589c4449727ea","observation_id":"ee8055b1-1b77-4894-a888-15c2f0e1eb1d","resolution":{"observed_at":"2026-05-23T17:35:44.166011Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14598","last_updated":"2025-03-01T21:45:36Z","snapshot_observed_at":"2026-07-06T18:34:29.513732Z","submitted_at":"2024-06-20T17:56:07Z","title":"SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal","version":2},"cited_work":{"arxiv_id":"2406.14598","doi":"10.48550/arxiv.2406.14598","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.14598","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv:2406.14598 (2025)","venue":"arXiv (Cornell University)","work_id":"5f6c39b5-65d4-4261-a0d0-63007ebce626","year":2025},"citing_paper":{"arxiv_id":"2412.05579","last_updated":"2024-12-10T05:49:12Z","snapshot_observed_at":"2026-07-31T01:42:39.468673Z","submitted_at":"2024-12-07T08:07:24Z","title":"LLMs-as-Judges: A Comprehensive Survey on LLM-based Evaluation Methods","version":2},"reference_index":258,"source":"pdf_text","source_observed_at":"2026-05-11T23:08:34.312466Z"},"links":{"cited_paper":"/paper/2406.14598","citing_paper":"/paper/2412.05579"},"observation_digest":"sha256:2a2d5dae8cb9268c9e3554a1c5cd29c80d3cf4e68b249aaa457517547d95f7df","observation_id":"c0276105-7099-4721-b601-143ac667269f","resolution":{"observed_at":"2026-05-11T23:08:35.739874Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14598","last_updated":"2025-03-01T21:45:36Z","snapshot_observed_at":"2026-07-06T18:34:29.513732Z","submitted_at":"2024-06-20T17:56:07Z","title":"SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14598","snapshot_observed_at":"2026-08-04T19:55:56.585528Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08997","last_updated":"2025-09-10T20:47:56Z","snapshot_observed_at":"2026-08-04T19:55:55.643169Z","submitted_at":"2025-09-10T20:47:56Z","title":"YouthSafe: A Youth-Centric Safety Benchmark and Safeguard Model for Large Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T19:55:56.585528Z"},"links":{"cited_paper":"/paper/2406.14598","citing_paper":"/paper/2509.08997"},"observation_digest":"sha256:5fc1eaa9f1cad472d92f8b9675c7c1474126dc5ac4668ce29f11132349029f49","observation_id":"5fb4048d-bc8e-49e2-b7ce-73c6c5f11954","resolution":{"observed_at":"2026-08-04T19:55:56.585528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14598","last_updated":"2025-03-01T21:45:36Z","snapshot_observed_at":"2026-07-06T18:34:29.513732Z","submitted_at":"2024-06-20T17:56:07Z","title":"SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal","version":2},"cited_work":{"arxiv_id":"2406.14598","doi":"10.48550/arxiv.2406.14598","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.14598","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv:2406.14598 (2025)","venue":"arXiv (Cornell University)","work_id":"5f6c39b5-65d4-4261-a0d0-63007ebce626","year":2025},"citing_paper":{"arxiv_id":"2509.09708","last_updated":"2026-04-28T03:29:39Z","snapshot_observed_at":"2026-07-06T22:28:57.048003Z","submitted_at":"2025-09-07T02:29:07Z","title":"Beyond I'm Sorry, I Can't: Dissecting Large Language Model Refusal","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-05-18T18:56:13.680353Z"},"links":{"cited_paper":"/paper/2406.14598","citing_paper":"/paper/2509.09708"},"observation_digest":"sha256:d6dce6e12d4920a04d3d425d4d0f33a6ff7c9031dd7c57e48360b661796867c1","observation_id":"974542d6-0b78-4b71-92dd-5c58fadb3373","resolution":{"observed_at":"2026-05-18T18:56:45.857797Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14598","last_updated":"2025-03-01T21:45:36Z","snapshot_observed_at":"2026-07-06T18:34:29.513732Z","submitted_at":"2024-06-20T17:56:07Z","title":"SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14598","snapshot_observed_at":"2026-08-04T10:22:08.785775Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.10271","last_updated":"2026-06-26T00:42:37Z","snapshot_observed_at":"2026-08-04T14:50:50.060411Z","submitted_at":"2025-10-11T16:14:56Z","title":"MetaBreak: Jailbreaking Online LLM Services via Special Token Manipulation","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-04T10:22:08.785775Z"},"links":{"cited_paper":"/paper/2406.14598","citing_paper":"/paper/2510.10271"},"observation_digest":"sha256:7eb0c61fa6b5a5e97cdb325746dd8c89d883f8050ec7fbd398d08700ce99f69d","observation_id":"158347e9-6d12-4fe2-bbca-df8c4297d188","resolution":{"observed_at":"2026-08-04T10:22:08.785775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14598","last_updated":"2025-03-01T21:45:36Z","snapshot_observed_at":"2026-07-06T18:34:29.513732Z","submitted_at":"2024-06-20T17:56:07Z","title":"SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14598","snapshot_observed_at":"2026-08-03T04:40:20.100340Z","title":"Sorry-bench: Systematically evaluating large language model safety refusal","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.04521","last_updated":"2026-07-08T17:47:06Z","snapshot_observed_at":"2026-08-03T04:40:19.114838Z","submitted_at":"2026-02-04T13:10:52Z","title":"$C$-$\\Delta\\Theta$: Circuit-Restricted Weight Arithmetic for Selective Refusal","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T04:40:20.100340Z"},"links":{"cited_paper":"/paper/2406.14598","citing_paper":"/paper/2602.04521"},"observation_digest":"sha256:69c67e458399b834c25b968d20aa74d9e8702ac494119eda92b50372a0ba28cc","observation_id":"99ab51e0-3848-44b1-95eb-7a933152af0c","resolution":{"observed_at":"2026-08-03T04:40:20.100340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14598","last_updated":"2025-03-01T21:45:36Z","snapshot_observed_at":"2026-07-06T18:34:29.513732Z","submitted_at":"2024-06-20T17:56:07Z","title":"SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14598","snapshot_observed_at":"2026-08-02T17:19:39.109017Z","title":"Sorry-bench: Systemat- ically evaluating large language model safety refusal.arXiv preprint arXiv:2406.14598, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.27176","last_updated":"2026-07-28T06:00:54Z","snapshot_observed_at":"2026-08-03T16:34:13.324182Z","submitted_at":"2026-03-28T07:26:40Z","title":"MEDIC-AD: Towards Medical Vision-Language Model's Clinical Intelligence","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-02T17:19:39.109017Z"},"links":{"cited_paper":"/paper/2406.14598","citing_paper":"/paper/2603.27176"},"observation_digest":"sha256:5678ec660f633b7ea4877ba871970d71d61b13ee22e73f3e84eb930301d52824","observation_id":"9454a312-c9dd-4365-8b21-bcf958eeea5b","resolution":{"observed_at":"2026-08-02T17:19:39.109017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14598","last_updated":"2025-03-01T21:45:36Z","snapshot_observed_at":"2026-07-06T18:34:29.513732Z","submitted_at":"2024-06-20T17:56:07Z","title":"SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal","version":2},"cited_work":{"arxiv_id":"2406.14598","doi":"10.48550/arxiv.2406.14598","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.14598","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv:2406.14598 (2025)","venue":"arXiv (Cornell University)","work_id":"5f6c39b5-65d4-4261-a0d0-63007ebce626","year":2025},"citing_paper":{"arxiv_id":"2604.06233","last_updated":"2026-04-03T13:53:23Z","snapshot_observed_at":"2026-07-06T22:54:44.656835Z","submitted_at":"2026-04-03T13:53:23Z","title":"Blind Refusal: Language Models Refuse to Help Users Evade Unjust, Absurd, and Illegitimate Rules","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-05-13T19:24:54.381722Z"},"links":{"cited_paper":"/paper/2406.14598","citing_paper":"/paper/2604.06233"},"observation_digest":"sha256:b07a60e5f6407681cca2e170930998290952bbb848feb2b2e583adf15c432099","observation_id":"8ab7dbaa-68b6-48f4-87f7-35e96e9886b8","resolution":{"observed_at":"2026-05-13T19:28:09.987310Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14598","last_updated":"2025-03-01T21:45:36Z","snapshot_observed_at":"2026-07-06T18:34:29.513732Z","submitted_at":"2024-06-20T17:56:07Z","title":"SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal","version":2},"cited_work":{"arxiv_id":"2406.14598","doi":"10.48550/arxiv.2406.14598","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.14598","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv:2406.14598 (2025)","venue":"arXiv (Cornell University)","work_id":"5f6c39b5-65d4-4261-a0d0-63007ebce626","year":2025},"citing_paper":{"arxiv_id":"2604.07709","last_updated":"2026-06-03T21:15:24Z","snapshot_observed_at":"2026-07-13T00:19:28.134640Z","submitted_at":"2026-04-09T01:54:33Z","title":"IatroBench: Pre-Registered Evidence of Iatrogenic Harm from AI Safety Measures","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-05-10T18:25:53.037936Z"},"links":{"cited_paper":"/paper/2406.14598","citing_paper":"/paper/2604.07709"},"observation_digest":"sha256:77b17feb03b572b39f3cb81b1d7f3aa2fc368a8ec596c4e825e759d9a84cd33b","observation_id":"3deb2e8f-27cb-400c-be3d-2239f6a4af34","resolution":{"observed_at":"2026-05-11T00:35:52.512867Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14598","last_updated":"2025-03-01T21:45:36Z","snapshot_observed_at":"2026-07-06T18:34:29.513732Z","submitted_at":"2024-06-20T17:56:07Z","title":"SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14598","snapshot_observed_at":"2026-07-13T00:19:33.861692Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.07709","last_updated":"2026-06-03T21:15:24Z","snapshot_observed_at":"2026-07-13T00:19:28.134640Z","submitted_at":"2026-04-09T01:54:33Z","title":"IatroBench: Pre-Registered Evidence of Iatrogenic Harm from AI Safety Measures","version":4},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-07-13T00:19:33.861692Z"},"links":{"cited_paper":"/paper/2406.14598","citing_paper":"/paper/2604.07709"},"observation_digest":"sha256:b66d44b1a15d093576df4a2e9dcd57808743325c9c2d7313973ed5f79ab0c026","observation_id":"cb51319b-d4d7-4e55-81f7-3331eb471a22","resolution":{"observed_at":"2026-07-13T00:19:33.861692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14598","last_updated":"2025-03-01T21:45:36Z","snapshot_observed_at":"2026-07-06T18:34:29.513732Z","submitted_at":"2024-06-20T17:56:07Z","title":"SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal","version":2},"cited_work":{"arxiv_id":"2406.14598","doi":"10.48550/arxiv.2406.14598","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.14598","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv:2406.14598 (2025)","venue":"arXiv (Cornell University)","work_id":"5f6c39b5-65d4-4261-a0d0-63007ebce626","year":2025},"citing_paper":{"arxiv_id":"2604.14548","last_updated":"2026-04-20T07:51:45Z","snapshot_observed_at":"2026-07-06T23:02:18.425249Z","submitted_at":"2026-04-16T02:24:59Z","title":"VoxSafeBench: Not Just What Is Said, but Who, How, and Where","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T10:19:28.041282Z"},"links":{"cited_paper":"/paper/2406.14598","citing_paper":"/paper/2604.14548"},"observation_digest":"sha256:470e52f246b9031752ee7377149d45326b6305cb37fd10cf92499d61e86ff171","observation_id":"0b580803-0f28-4bb6-9bac-a812f763645e","resolution":{"observed_at":"2026-05-10T10:24:22.069363Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14598","last_updated":"2025-03-01T21:45:36Z","snapshot_observed_at":"2026-07-06T18:34:29.513732Z","submitted_at":"2024-06-20T17:56:07Z","title":"SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal","version":2},"cited_work":{"arxiv_id":"2406.14598","doi":"10.48550/arxiv.2406.14598","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.14598","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv:2406.14598 (2025)","venue":"arXiv (Cornell University)","work_id":"5f6c39b5-65d4-4261-a0d0-63007ebce626","year":2025},"citing_paper":{"arxiv_id":"2604.18946","last_updated":"2026-04-21T00:50:13Z","snapshot_observed_at":"2026-07-06T23:05:39.724237Z","submitted_at":"2026-04-21T00:50:13Z","title":"Reasoning Structure Matters for Safety Alignment of Reasoning Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-10T02:36:57.093584Z"},"links":{"cited_paper":"/paper/2406.14598","citing_paper":"/paper/2604.18946"},"observation_digest":"sha256:76e37a7d0aaa17d0fdcdf004f8f306f699c9bd4ec1225f8b831ca8ff4012a023","observation_id":"a051cc05-28bc-43f9-a159-250633e5e6f4","resolution":{"observed_at":"2026-05-11T12:56:03.984376Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14598","last_updated":"2025-03-01T21:45:36Z","snapshot_observed_at":"2026-07-06T18:34:29.513732Z","submitted_at":"2024-06-20T17:56:07Z","title":"SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal","version":2},"cited_work":{"arxiv_id":"2406.14598","doi":"10.48550/arxiv.2406.14598","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.14598","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv:2406.14598 (2025)","venue":"arXiv (Cornell University)","work_id":"5f6c39b5-65d4-4261-a0d0-63007ebce626","year":2025},"citing_paper":{"arxiv_id":"2605.00706","last_updated":"2026-05-01T14:51:24Z","snapshot_observed_at":"2026-08-02T18:51:22.836521Z","submitted_at":"2026-05-01T14:51:24Z","title":"FinSafetyBench: Evaluating LLM Safety in Real-World Financial Scenarios","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-09T19:06:29.779618Z"},"links":{"cited_paper":"/paper/2406.14598","citing_paper":"/paper/2605.00706"},"observation_digest":"sha256:689fc9999065e70a199b5aa27dff8943f15ae9aa8bc8294fa7b909cb97cd0b4f","observation_id":"66f106a5-f58d-4a15-b4e7-77231dad9779","resolution":{"observed_at":"2026-05-11T15:51:43.870558Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14598","last_updated":"2025-03-01T21:45:36Z","snapshot_observed_at":"2026-07-06T18:34:29.513732Z","submitted_at":"2024-06-20T17:56:07Z","title":"SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal","version":2},"cited_work":{"arxiv_id":"2406.14598","doi":"10.48550/arxiv.2406.14598","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.14598","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv:2406.14598 (2025)","venue":"arXiv (Cornell University)","work_id":"5f6c39b5-65d4-4261-a0d0-63007ebce626","year":2025},"citing_paper":{"arxiv_id":"2605.01123","last_updated":"2026-05-01T21:49:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-01T21:49:20Z","title":"PERSA: Reinforcement Learning for Professor-Style Personalized Feedback with LLMs","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-09T19:09:07.557773Z"},"links":{"cited_paper":"/paper/2406.14598","citing_paper":"/paper/2605.01123"},"observation_digest":"sha256:5962c3d7d364d4fb7b70ab3938ef06f6b7a213d66b43fa1667d1fd5817cec23a","observation_id":"023a6b59-0ace-4f14-b849-07e9ce053959","resolution":{"observed_at":"2026-05-11T15:51:42.601099Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14598","last_updated":"2025-03-01T21:45:36Z","snapshot_observed_at":"2026-07-06T18:34:29.513732Z","submitted_at":"2024-06-20T17:56:07Z","title":"SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal","version":2},"cited_work":{"arxiv_id":"2406.14598","doi":"10.48550/arxiv.2406.14598","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.14598","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv:2406.14598 (2025)","venue":"arXiv (Cornell University)","work_id":"5f6c39b5-65d4-4261-a0d0-63007ebce626","year":2025},"citing_paper":{"arxiv_id":"2605.01687","last_updated":"2026-05-03T02:55:30Z","snapshot_observed_at":"2026-07-06T23:14:52.417213Z","submitted_at":"2026-05-03T02:55:30Z","title":"MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-05-10T16:00:32.413225Z"},"links":{"cited_paper":"/paper/2406.14598","citing_paper":"/paper/2605.01687"},"observation_digest":"sha256:f8970d9f75d8497fac10a4ab3e8455c059a128e74d3ba2b4ac84ce2ba3d73d19","observation_id":"6a9c689d-4263-40dd-a3d4-7dd306a4c755","resolution":{"observed_at":"2026-05-11T09:31:00.988350Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14598","last_updated":"2025-03-01T21:45:36Z","snapshot_observed_at":"2026-07-06T18:34:29.513732Z","submitted_at":"2024-06-20T17:56:07Z","title":"SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal","version":2},"cited_work":{"arxiv_id":"2406.14598","doi":"10.48550/arxiv.2406.14598","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.14598","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv:2406.14598 (2025)","venue":"arXiv (Cornell University)","work_id":"5f6c39b5-65d4-4261-a0d0-63007ebce626","year":2025},"citing_paper":{"arxiv_id":"2605.03095","last_updated":"2026-05-04T19:17:50Z","snapshot_observed_at":"2026-07-06T23:16:05.372336Z","submitted_at":"2026-05-04T19:17:50Z","title":"Revisiting JBShield: Breaking and Rebuilding Representation-Level Jailbreak Defenses","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-07T02:16:49.785596Z"},"links":{"cited_paper":"/paper/2406.14598","citing_paper":"/paper/2605.03095"},"observation_digest":"sha256:d801793c970dba2155355f1260dd51433704b035c67e3c15dd4998df8583dddf","observation_id":"b3863060-2459-4805-a883-3af81d3d0a8d","resolution":{"observed_at":"2026-05-12T10:46:31.235979Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14598","last_updated":"2025-03-01T21:45:36Z","snapshot_observed_at":"2026-07-06T18:34:29.513732Z","submitted_at":"2024-06-20T17:56:07Z","title":"SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal","version":2},"cited_work":{"arxiv_id":"2406.14598","doi":"10.48550/arxiv.2406.14598","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.14598","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv:2406.14598 (2025)","venue":"arXiv (Cornell University)","work_id":"5f6c39b5-65d4-4261-a0d0-63007ebce626","year":2025},"citing_paper":{"arxiv_id":"2605.03179","last_updated":"2026-05-04T21:42:10Z","snapshot_observed_at":"2026-08-03T23:09:27.517424Z","submitted_at":"2026-05-04T21:42:10Z","title":"A Validated Prompt Bank for Malicious Code Generation: Separating Executable Weapons from Security Knowledge in 1,554 Consensus-Labeled Prompts","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-08T18:11:29.066362Z"},"links":{"cited_paper":"/paper/2406.14598","citing_paper":"/paper/2605.03179"},"observation_digest":"sha256:db1e50b8c614d01fe38502a1d693642cbc36d2d21dfb845422c02cc853c7b534","observation_id":"4fae6c5d-e014-4d68-9b6d-429bcb2548c2","resolution":{"observed_at":"2026-05-09T06:40:43.579732Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14598","last_updated":"2025-03-01T21:45:36Z","snapshot_observed_at":"2026-07-06T18:34:29.513732Z","submitted_at":"2024-06-20T17:56:07Z","title":"SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal","version":2},"cited_work":{"arxiv_id":"2406.14598","doi":"10.48550/arxiv.2406.14598","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.14598","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv:2406.14598 (2025)","venue":"arXiv (Cornell University)","work_id":"5f6c39b5-65d4-4261-a0d0-63007ebce626","year":2025},"citing_paper":{"arxiv_id":"2605.04700","last_updated":"2026-05-25T06:36:12Z","snapshot_observed_at":"2026-08-02T19:42:07.182660Z","submitted_at":"2026-05-06T09:52:29Z","title":"Sparse Tokens Suffice: Jailbreaking Audio Language Models via Token-Aware Gradient Optimization","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-05-08T18:08:16.051117Z"},"links":{"cited_paper":"/paper/2406.14598","citing_paper":"/paper/2605.04700"},"observation_digest":"sha256:5788c77aea0b87c27ca414954a58164be62fce95080221015d0f62b99e393b92","observation_id":"adbb2505-209d-4310-bee7-3bd379216a5a","resolution":{"observed_at":"2026-05-09T06:45:44.083441Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14598","last_updated":"2025-03-01T21:45:36Z","snapshot_observed_at":"2026-07-06T18:34:29.513732Z","submitted_at":"2024-06-20T17:56:07Z","title":"SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal","version":2},"cited_work":{"arxiv_id":"2406.14598","doi":"10.48550/arxiv.2406.14598","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.14598","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv:2406.14598 (2025)","venue":"arXiv (Cornell University)","work_id":"5f6c39b5-65d4-4261-a0d0-63007ebce626","year":2025},"citing_paper":{"arxiv_id":"2605.10998","last_updated":"2026-05-09T15:52:29Z","snapshot_observed_at":"2026-08-03T01:46:31.309604Z","submitted_at":"2026-05-09T15:52:29Z","title":"Few-Shot Truly Benign DPO Attack for Jailbreaking LLMs","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-05-13T07:06:46.387088Z"},"links":{"cited_paper":"/paper/2406.14598","citing_paper":"/paper/2605.10998"},"observation_digest":"sha256:6bb7d92516c1597b7e67d53a73865bbf28768ec5b342c3a3cd0c1965b001dc5b","observation_id":"98678dea-e9e8-42c1-8fb3-106423668e54","resolution":{"observed_at":"2026-05-13T07:07:27.020952Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14598","last_updated":"2025-03-01T21:45:36Z","snapshot_observed_at":"2026-07-06T18:34:29.513732Z","submitted_at":"2024-06-20T17:56:07Z","title":"SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal","version":2},"cited_work":{"arxiv_id":"2406.14598","doi":"10.48550/arxiv.2406.14598","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.14598","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv:2406.14598 (2025)","venue":"arXiv (Cornell University)","work_id":"5f6c39b5-65d4-4261-a0d0-63007ebce626","year":2025},"citing_paper":{"arxiv_id":"2605.12726","last_updated":"2026-07-09T09:24:42Z","snapshot_observed_at":"2026-07-12T23:17:31.495150Z","submitted_at":"2026-05-12T20:30:24Z","title":"Before the Last Token: Diagnosing Final-Token Safety Probe Failures","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-14T21:37:02.439454Z"},"links":{"cited_paper":"/paper/2406.14598","citing_paper":"/paper/2605.12726"},"observation_digest":"sha256:733fabe61cb919ebc37a407f4e4226ca5e76dcc83ceb100471cea7d92739720f","observation_id":"92bacfc6-ff43-4ce3-88c4-e004278317c7","resolution":{"observed_at":"2026-05-14T21:38:00.077747Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14598","last_updated":"2025-03-01T21:45:36Z","snapshot_observed_at":"2026-07-06T18:34:29.513732Z","submitted_at":"2024-06-20T17:56:07Z","title":"SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal","version":2},"cited_work":{"arxiv_id":"2406.14598","doi":"10.48550/arxiv.2406.14598","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.14598","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv:2406.14598 (2025)","venue":"arXiv (Cornell University)","work_id":"5f6c39b5-65d4-4261-a0d0-63007ebce626","year":2025},"citing_paper":{"arxiv_id":"2605.13334","last_updated":"2026-05-13T10:51:56Z","snapshot_observed_at":"2026-07-06T23:24:57.051440Z","submitted_at":"2026-05-13T10:51:56Z","title":"LLM-Based Persuasion Enables Guardrail Override in Frontier LLMs","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-05-14T20:20:04.306202Z"},"links":{"cited_paper":"/paper/2406.14598","citing_paper":"/paper/2605.13334"},"observation_digest":"sha256:9e67a93bb5ee6c9379c449dc40d1b0ba1653fdbddbc3e2f5e8bc448400c39142","observation_id":"65ef1288-e9c1-4c3e-8f3d-83fcc8138e28","resolution":{"observed_at":"2026-05-14T20:22:55.720651Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14598","last_updated":"2025-03-01T21:45:36Z","snapshot_observed_at":"2026-07-06T18:34:29.513732Z","submitted_at":"2024-06-20T17:56:07Z","title":"SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal","version":2},"cited_work":{"arxiv_id":"2406.14598","doi":"10.48550/arxiv.2406.14598","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.14598","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv:2406.14598 (2025)","venue":"arXiv (Cornell University)","work_id":"5f6c39b5-65d4-4261-a0d0-63007ebce626","year":2025},"citing_paper":{"arxiv_id":"2605.21545","last_updated":"2026-05-20T09:53:31Z","snapshot_observed_at":"2026-07-06T23:32:01.202542Z","submitted_at":"2026-05-20T09:53:31Z","title":"RefusalBench: Why Refusal Rate Misranks Frontier LLMs on Biological Research Prompts","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-22T01:19:00.268857Z"},"links":{"cited_paper":"/paper/2406.14598","citing_paper":"/paper/2605.21545"},"observation_digest":"sha256:8add8f9b4b4b3ac064290bf701d7e6cd8341104cb72cd88cda8d354d7e44966f","observation_id":"6b539532-c25e-4445-ad80-74ef7a44f0c4","resolution":{"observed_at":"2026-05-22T01:20:51.907305Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14598","last_updated":"2025-03-01T21:45:36Z","snapshot_observed_at":"2026-07-06T18:34:29.513732Z","submitted_at":"2024-06-20T17:56:07Z","title":"SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal","version":2},"cited_work":{"arxiv_id":"2406.14598","doi":"10.48550/arxiv.2406.14598","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.14598","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv:2406.14598 (2025)","venue":"arXiv (Cornell University)","work_id":"5f6c39b5-65d4-4261-a0d0-63007ebce626","year":2025},"citing_paper":{"arxiv_id":"2605.29659","last_updated":"2026-05-28T09:21:42Z","snapshot_observed_at":"2026-07-06T23:39:05.858969Z","submitted_at":"2026-05-28T09:21:42Z","title":"Opir: Efficient Multi-Task Safety Classification for Toxicity, Jailbreaks, Hate Speech, and Harmful Content","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-29T09:11:58.843585Z"},"links":{"cited_paper":"/paper/2406.14598","citing_paper":"/paper/2605.29659"},"observation_digest":"sha256:027d606b9a526cb73b735e41a650e37b468e083eda9aac6c79cca67740cae7f5","observation_id":"3bc4c532-d970-4940-bee3-b93c29046270","resolution":{"observed_at":"2026-06-29T09:13:15.944664Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14598","last_updated":"2025-03-01T21:45:36Z","snapshot_observed_at":"2026-07-06T18:34:29.513732Z","submitted_at":"2024-06-20T17:56:07Z","title":"SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal","version":2},"cited_work":{"arxiv_id":"2406.14598","doi":"10.48550/arxiv.2406.14598","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.14598","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv:2406.14598 (2025)","venue":"arXiv (Cornell University)","work_id":"5f6c39b5-65d4-4261-a0d0-63007ebce626","year":2025},"citing_paper":{"arxiv_id":"2606.09165","last_updated":"2026-06-08T08:02:57Z","snapshot_observed_at":"2026-08-01T19:14:56.235029Z","submitted_at":"2026-06-08T08:02:57Z","title":"Reliable to Expressive: A Curriculum for Rubric-Following Safety Judges","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-27T17:01:03.040933Z"},"links":{"cited_paper":"/paper/2406.14598","citing_paper":"/paper/2606.09165"},"observation_digest":"sha256:52d9df8014527ef0d30e5d6881127c4ae5df3cfa02a08a3faa051c23df281c36","observation_id":"2d07b2ba-8fc4-4367-aca1-c377a5a35717","resolution":{"observed_at":"2026-07-03T00:47:30.681311Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14598","last_updated":"2025-03-01T21:45:36Z","snapshot_observed_at":"2026-07-06T18:34:29.513732Z","submitted_at":"2024-06-20T17:56:07Z","title":"SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal","version":2},"cited_work":{"arxiv_id":"2406.14598","doi":"10.48550/arxiv.2406.14598","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.14598","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv:2406.14598 (2025)","venue":"arXiv (Cornell University)","work_id":"5f6c39b5-65d4-4261-a0d0-63007ebce626","year":2025},"citing_paper":{"arxiv_id":"2606.11316","last_updated":"2026-06-09T18:01:19Z","snapshot_observed_at":"2026-08-01T20:26:14.151904Z","submitted_at":"2026-06-09T18:01:19Z","title":"Sch\\\"utzen: Evaluating LLM Safety in Bulgarian and German Contexts","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-06-27T13:32:18.368158Z"},"links":{"cited_paper":"/paper/2406.14598","citing_paper":"/paper/2606.11316"},"observation_digest":"sha256:0e50ec1e323030152ba40c6e12c87b0ea97391c4756c6c79001020c623990bf4","observation_id":"0a7864e0-598b-4367-b31d-4ca3a104b58f","resolution":{"observed_at":"2026-07-03T04:57:38.388352Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14598","last_updated":"2025-03-01T21:45:36Z","snapshot_observed_at":"2026-07-06T18:34:29.513732Z","submitted_at":"2024-06-20T17:56:07Z","title":"SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal","version":2},"cited_work":{"arxiv_id":"2406.14598","doi":"10.48550/arxiv.2406.14598","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.14598","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv:2406.14598 (2025)","venue":"arXiv (Cornell University)","work_id":"5f6c39b5-65d4-4261-a0d0-63007ebce626","year":2025},"citing_paper":{"arxiv_id":"2606.20508","last_updated":"2026-06-18T17:25:38Z","snapshot_observed_at":"2026-07-06T23:55:38.979306Z","submitted_at":"2026-06-18T17:25:38Z","title":"What Do Safety-Aligned LLMs Learn From Mixed Compliance Demonstrations?","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-26T17:43:17.000740Z"},"links":{"cited_paper":"/paper/2406.14598","citing_paper":"/paper/2606.20508"},"observation_digest":"sha256:c5c60e733388de167648a89f42de9e3c71524e09c994b21eabf0c154846aa615","observation_id":"f3b4a5b4-c87c-4933-9cfb-bd5cf21446bb","resolution":{"observed_at":"2026-07-04T03:39:31.052108Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14598","last_updated":"2025-03-01T21:45:36Z","snapshot_observed_at":"2026-07-06T18:34:29.513732Z","submitted_at":"2024-06-20T17:56:07Z","title":"SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal","version":2},"cited_work":{"arxiv_id":"2406.14598","doi":"10.48550/arxiv.2406.14598","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.14598","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv:2406.14598 (2025)","venue":"arXiv (Cornell University)","work_id":"5f6c39b5-65d4-4261-a0d0-63007ebce626","year":2025},"citing_paper":{"arxiv_id":"2606.20626","last_updated":"2026-05-26T17:35:31Z","snapshot_observed_at":"2026-07-06T23:55:43.830896Z","submitted_at":"2026-05-26T17:35:31Z","title":"Efficient Safety Benchmarking via Item Response Theory","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-01T15:51:00.484343Z"},"links":{"cited_paper":"/paper/2406.14598","citing_paper":"/paper/2606.20626"},"observation_digest":"sha256:3f6f4de643a2bcc7a53a1677c3f223dbce4bcddc0522cbe4f6d094569cd85574","observation_id":"50313c44-6044-420c-8078-5018a7021242","resolution":{"observed_at":"2026-07-01T15:55:48.976540Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14598","last_updated":"2025-03-01T21:45:36Z","snapshot_observed_at":"2026-07-06T18:34:29.513732Z","submitted_at":"2024-06-20T17:56:07Z","title":"SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal","version":2},"cited_work":{"arxiv_id":"2406.14598","doi":"10.48550/arxiv.2406.14598","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.14598","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv:2406.14598 (2025)","venue":"arXiv (Cornell University)","work_id":"5f6c39b5-65d4-4261-a0d0-63007ebce626","year":2025},"citing_paper":{"arxiv_id":"2606.21296","last_updated":"2026-06-19T10:19:54Z","snapshot_observed_at":"2026-08-02T18:19:53.372016Z","submitted_at":"2026-06-19T10:19:54Z","title":"Discriminatory Compliance: How LLMs Answer Queries from Protected Groups","version":1},"reference_index":106,"source":"arxiv_source","source_observed_at":"2026-06-26T12:58:09.227648Z"},"links":{"cited_paper":"/paper/2406.14598","citing_paper":"/paper/2606.21296"},"observation_digest":"sha256:21984e79e9c9c3411d5ef477b09f4b433d8684b2b67c6ddc4d491a91eb859acb","observation_id":"b6f120d8-6269-4093-8125-48c31a9e5266","resolution":{"observed_at":"2026-06-26T12:59:29.405506Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14598","last_updated":"2025-03-01T21:45:36Z","snapshot_observed_at":"2026-07-06T18:34:29.513732Z","submitted_at":"2024-06-20T17:56:07Z","title":"SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal","version":2},"cited_work":{"arxiv_id":"2406.14598","doi":"10.48550/arxiv.2406.14598","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.14598","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv:2406.14598 (2025)","venue":"arXiv (Cornell University)","work_id":"5f6c39b5-65d4-4261-a0d0-63007ebce626","year":2025},"citing_paper":{"arxiv_id":"2606.24388","last_updated":"2026-06-23T10:20:40Z","snapshot_observed_at":"2026-07-06T23:58:58.854077Z","submitted_at":"2026-06-23T10:20:40Z","title":"PHANTOM: A Large-Scale Dataset of Multimodal Adversarial Attacks for Vision-Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-25T23:52:02.327522Z"},"links":{"cited_paper":"/paper/2406.14598","citing_paper":"/paper/2606.24388"},"observation_digest":"sha256:41eeebf5ffcd81896a64b4a1974c3897054cc6adf52725a79e8f35d4ddfac883","observation_id":"b860b720-92ce-4383-9e4d-59ea998a0212","resolution":{"observed_at":"2026-07-04T17:09:59.500402Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14598","last_updated":"2025-03-01T21:45:36Z","snapshot_observed_at":"2026-07-06T18:34:29.513732Z","submitted_at":"2024-06-20T17:56:07Z","title":"SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal","version":2},"cited_work":{"arxiv_id":"2406.14598","doi":"10.48550/arxiv.2406.14598","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.14598","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv:2406.14598 (2025)","venue":"arXiv (Cornell University)","work_id":"5f6c39b5-65d4-4261-a0d0-63007ebce626","year":2025},"citing_paper":{"arxiv_id":"2606.25782","last_updated":"2026-06-24T13:00:25Z","snapshot_observed_at":"2026-08-02T05:56:42.277319Z","submitted_at":"2026-06-24T13:00:25Z","title":"Do Encoders Suffice? A Systematic Comparison of Encoder and Decoder Safety Judges for LLM Adversarial Evaluation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-25T20:55:44.549142Z"},"links":{"cited_paper":"/paper/2406.14598","citing_paper":"/paper/2606.25782"},"observation_digest":"sha256:12c98b211b0949dbf2df70abffad5cb738ede1b675fdffe695d942721d318a69","observation_id":"bcc533d1-39a6-4439-9ad0-f61a47f1db0b","resolution":{"observed_at":"2026-07-04T20:00:07.985799Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14598","last_updated":"2025-03-01T21:45:36Z","snapshot_observed_at":"2026-07-06T18:34:29.513732Z","submitted_at":"2024-06-20T17:56:07Z","title":"SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal","version":2},"cited_work":{"arxiv_id":"2406.14598","doi":"10.48550/arxiv.2406.14598","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.14598","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv:2406.14598 (2025)","venue":"arXiv (Cornell University)","work_id":"5f6c39b5-65d4-4261-a0d0-63007ebce626","year":2025},"citing_paper":{"arxiv_id":"2606.28733","last_updated":"2026-06-27T04:49:37Z","snapshot_observed_at":"2026-07-07T00:02:47.924620Z","submitted_at":"2026-06-27T04:49:37Z","title":"Agentic Abstention: Do Agents Know When to Stop Instead of Act?","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-06-30T09:54:07.138157Z"},"links":{"cited_paper":"/paper/2406.14598","citing_paper":"/paper/2606.28733"},"observation_digest":"sha256:0f115a75726b9287b7dd436eb34ae88b900ec86efaea04b9cfad856062f21479","observation_id":"19a1a96f-8173-463b-ac50-a83ed3eff9b3","resolution":{"observed_at":"2026-06-30T09:54:34.380647Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14598","last_updated":"2025-03-01T21:45:36Z","snapshot_observed_at":"2026-07-06T18:34:29.513732Z","submitted_at":"2024-06-20T17:56:07Z","title":"SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal","version":2},"cited_work":{"arxiv_id":"2406.14598","doi":"10.48550/arxiv.2406.14598","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.14598","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv:2406.14598 (2025)","venue":"arXiv (Cornell University)","work_id":"5f6c39b5-65d4-4261-a0d0-63007ebce626","year":2025},"citing_paper":{"arxiv_id":"2606.31748","last_updated":"2026-06-30T14:38:49Z","snapshot_observed_at":"2026-07-07T00:05:27.130060Z","submitted_at":"2026-06-30T14:38:49Z","title":"Addressing Over-Refusal in LLMs with Competing Rewards","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-07-01T06:59:12.695984Z"},"links":{"cited_paper":"/paper/2406.14598","citing_paper":"/paper/2606.31748"},"observation_digest":"sha256:34b0d5be61d008090d1f80117a9c8660f365e35ec63dff803d183759f68a3e29","observation_id":"4816bf2f-87a9-4924-8233-5347664420a4","resolution":{"observed_at":"2026-07-01T07:05:29.223049Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14598","last_updated":"2025-03-01T21:45:36Z","snapshot_observed_at":"2026-07-06T18:34:29.513732Z","submitted_at":"2024-06-20T17:56:07Z","title":"SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14598","snapshot_observed_at":"2026-07-12T07:33:43.015966Z","title":"SORRY-Bench: Systematically evaluating large language model safety refusal behaviors.arXiv preprint arXiv:2406.14598,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02714","last_updated":"2026-07-07T12:39:55Z","snapshot_observed_at":"2026-08-05T08:13:12.335723Z","submitted_at":"2026-07-02T19:05:07Z","title":"Not All Refusals Are Equal: How Safety Alignment Fails Cybersecurity at Scale","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-12T07:33:43.015966Z"},"links":{"cited_paper":"/paper/2406.14598","citing_paper":"/paper/2607.02714"},"observation_digest":"sha256:8dabd5f138df039649001c0723cb1b42e63f0a8382da1c56c44db8ca6a256e46","observation_id":"0aeee549-91e6-40e4-a8b4-d131e713f3eb","resolution":{"observed_at":"2026-07-12T07:33:43.015966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14598","last_updated":"2025-03-01T21:45:36Z","snapshot_observed_at":"2026-07-06T18:34:29.513732Z","submitted_at":"2024-06-20T17:56:07Z","title":"SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14598","snapshot_observed_at":"2026-08-02T02:00:44.842416Z","title":"SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal, April 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14479","last_updated":"2026-07-16T01:52:54Z","snapshot_observed_at":"2026-08-02T02:00:42.750783Z","submitted_at":"2026-07-16T01:52:54Z","title":"BioTIER: A Refusal Benchmark for Targeted Biological Risk Mitigation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T02:00:44.842416Z"},"links":{"cited_paper":"/paper/2406.14598","citing_paper":"/paper/2607.14479"},"observation_digest":"sha256:3e609c81670e92fb2de798741c13cc0aba63d52d5e2491ace20b9863914e46e3","observation_id":"2579c87e-8a8f-4c25-bc4e-2702148f01ed","resolution":{"observed_at":"2026-08-02T02:00:44.842416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14598","last_updated":"2025-03-01T21:45:36Z","snapshot_observed_at":"2026-07-06T18:34:29.513732Z","submitted_at":"2024-06-20T17:56:07Z","title":"SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14598","snapshot_observed_at":"2026-08-01T18:54:57.199932Z","title":"arXiv preprint arXiv:2406.14598 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17152","last_updated":"2026-07-19T09:18:35Z","snapshot_observed_at":"2026-08-01T18:54:50.722684Z","submitted_at":"2026-07-19T09:18:35Z","title":"How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-01T18:54:57.199932Z"},"links":{"cited_paper":"/paper/2406.14598","citing_paper":"/paper/2607.17152"},"observation_digest":"sha256:8d16f138b2abb9c37530cd686e58672aab63de8b27ceca67404c9da1c0cb6c03","observation_id":"0d12b4db-f03f-48e6-83eb-facc8d89715b","resolution":{"observed_at":"2026-08-01T18:54:57.199932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14598","last_updated":"2025-03-01T21:45:36Z","snapshot_observed_at":"2026-07-06T18:34:29.513732Z","submitted_at":"2024-06-20T17:56:07Z","title":"SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14598","snapshot_observed_at":"2026-08-02T13:21:55.083013Z","title":"Xianyang Zhan, Agam Goyal, Yilun Chen, Eshwar Chandrasekharan, and Koustuv Saha","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18268","last_updated":"2026-05-22T16:05:50Z","snapshot_observed_at":"2026-08-05T10:33:42.348277Z","submitted_at":"2026-05-22T16:05:50Z","title":"Fence: Specialized SLM Guardrails for LLM Applications","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T13:21:55.083013Z"},"links":{"cited_paper":"/paper/2406.14598","citing_paper":"/paper/2607.18268"},"observation_digest":"sha256:07e8ba7ce066e4b536036c5867a5831ddc2eb09bb3a2d493968daa58c0782f7f","observation_id":"1805f2bd-03c7-4e0c-856d-5a072c199b0c","resolution":{"observed_at":"2026-08-02T13:21:55.083013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14598","last_updated":"2025-03-01T21:45:36Z","snapshot_observed_at":"2026-07-06T18:34:29.513732Z","submitted_at":"2024-06-20T17:56:07Z","title":"SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14598","snapshot_observed_at":"2026-08-01T02:23:11.890673Z","title":"Sorry-bench: Systematically evaluating large language model safety refusal,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25479","last_updated":"2026-07-28T09:12:11Z","snapshot_observed_at":"2026-08-03T11:57:30.157643Z","submitted_at":"2026-07-28T09:12:11Z","title":"Architectural Backdoors in Vision-Language Model Supply Chains via Representation Steering","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-01T02:23:11.890673Z"},"links":{"cited_paper":"/paper/2406.14598","citing_paper":"/paper/2607.25479"},"observation_digest":"sha256:d4792755bc29fe776ed8f0e80bf61895b8b481344d45ca08bc0477937245ed21","observation_id":"9066c1b2-ab38-40eb-9c4c-92a390a3db51","resolution":{"observed_at":"2026-08-01T02:23:11.890673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14598","last_updated":"2025-03-01T21:45:36Z","snapshot_observed_at":"2026-07-06T18:34:29.513732Z","submitted_at":"2024-06-20T17:56:07Z","title":"SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14598","snapshot_observed_at":"2026-07-31T02:04:06.864702Z","title":"Sorry-bench: Systematically evaluating large language model safety refusal.arXiv preprint arXiv:2406.14598,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28617","last_updated":"2026-07-30T17:58:58Z","snapshot_observed_at":"2026-08-03T10:15:06.066795Z","submitted_at":"2026-07-30T17:58:58Z","title":"AISPA: User-Centric System Prompt Auditing for Large Language Model Applications","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-31T02:04:06.864702Z"},"links":{"cited_paper":"/paper/2406.14598","citing_paper":"/paper/2607.28617"},"observation_digest":"sha256:56f0683affa1fa590ed6a0507bbca792397ab96a019c01de9f8820610dff524b","observation_id":"bb055c66-c166-43b2-9b36-00df8cf1e36f","resolution":{"observed_at":"2026-07-31T02:04:06.864702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14598","last_updated":"2025-03-01T21:45:36Z","snapshot_observed_at":"2026-07-06T18:34:29.513732Z","submitted_at":"2024-06-20T17:56:07Z","title":"SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14598","snapshot_observed_at":"2026-08-03T00:55:22.240966Z","title":"arXiv preprint arXiv:2406.14598 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28636","last_updated":"2026-05-19T13:56:13Z","snapshot_observed_at":"2026-08-05T12:13:17.653622Z","submitted_at":"2026-05-19T13:56:13Z","title":"Chain-of-Models: Cross-Model Auditing for Bias-Robust LLM Judges","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-03T00:55:22.240966Z"},"links":{"cited_paper":"/paper/2406.14598","citing_paper":"/paper/2607.28636"},"observation_digest":"sha256:649b35ebf8b956724839823c63ad77c6136294f13b394bf3ebf502ae1269cba2","observation_id":"b050bf87-bc25-450d-993d-c098885d63cf","resolution":{"observed_at":"2026-08-03T00:55:22.240966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2406.14598/citation-record","integrity":"/paper/2406.14598/integrity","json":"/paper/2406.14598/citation-record.json","paper":"/paper/2406.14598"},"outbound":[],"paper":{"arxiv_id":"2406.14598","last_updated":"2025-03-01T21:45:36Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-07-06T18:34:29.513732Z","submitted_at":"2024-06-20T17:56:07Z","title":"SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 40 inbound Pith citation observations for arXiv:2406.14598."}