{"as_of":"2026-08-09T18:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b31c2ee5c52048386ac40e1236883f4c9f92e3cb3fb3db8a41108430c22715b0","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":23,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:33:40.319869Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T03:59:32.652255Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2311.08370","last_updated":"2024-02-16T09:42:19Z","snapshot_observed_at":"2026-08-07T06:51:25.278756Z","submitted_at":"2023-11-14T18:33:43Z","title":"SimpleSafetyTests: a Test Suite for Identifying Critical Safety Risks in Large Language Models","version":2},"cited_work":{"arxiv_id":"2311.08370","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.08370","snapshot_observed_at":"2026-07-04T03:59:32.652255Z","title":"arXiv preprint arXiv:2311.08370 , year=","venue":null,"work_id":"640cffcd-ef2c-4e9c-9585-872794809e9e","year":2023},"citing_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-08-06T04:32:59.039501Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-17T16:25:14.744887Z"},"links":{"cited_paper":"/paper/2311.08370","citing_paper":"/paper/2406.18495"},"observation_digest":"sha256:9aad7623d5230fb986565e00590554eb357f816cb552586261f2d138635b9472","observation_id":"4f5f243a-d99e-431f-9ae2-b485bdeb8495","resolution":{"observed_at":"2026-05-17T16:25:14.904441Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08370","last_updated":"2024-02-16T09:42:19Z","snapshot_observed_at":"2026-08-07T06:51:25.278756Z","submitted_at":"2023-11-14T18:33:43Z","title":"SimpleSafetyTests: a Test Suite for Identifying Critical Safety Risks in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08370","snapshot_observed_at":"2026-08-06T23:33:40.319869Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17209","last_updated":"2025-06-20T17:57:12Z","snapshot_observed_at":"2026-08-08T06:00:05.474887Z","submitted_at":"2025-06-20T17:57:12Z","title":"Fine-Tuning Lowers Safety and Disrupts Evaluation Consistency","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T23:33:40.319869Z"},"links":{"cited_paper":"/paper/2311.08370","citing_paper":"/paper/2506.17209"},"observation_digest":"sha256:7552bbb1d0043644c3eab9c5e22702f373389ebaea1c162897a98012d8a1197f","observation_id":"f83ef09f-72de-4e00-92e2-0405adcdb8d1","resolution":{"observed_at":"2026-08-06T23:33:40.319869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08370","last_updated":"2024-02-16T09:42:19Z","snapshot_observed_at":"2026-08-07T06:51:25.278756Z","submitted_at":"2023-11-14T18:33:43Z","title":"SimpleSafetyTests: a Test Suite for Identifying Critical Safety Risks in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08370","snapshot_observed_at":"2026-08-05T10:39:08.309134Z","title":"Simplesafetytests: a test suite for identifying critical safety risks in large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-08T03:54:26.940042Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":290,"source":"pdf_text","source_observed_at":"2026-08-05T10:39:08.309134Z"},"links":{"cited_paper":"/paper/2311.08370","citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:b7f515dc6d233aaf79c7836488d48f86c0136bfd69d3e878e4038693ea2e1a7f","observation_id":"09a1df70-ccc8-4ba9-9cf1-87fe13daffc1","resolution":{"observed_at":"2026-08-05T10:39:08.309134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08370","last_updated":"2024-02-16T09:42:19Z","snapshot_observed_at":"2026-08-07T06:51:25.278756Z","submitted_at":"2023-11-14T18:33:43Z","title":"SimpleSafetyTests: a Test Suite for Identifying Critical Safety Risks in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08370","snapshot_observed_at":"2026-08-05T11:25:23.366764Z","title":"Sim- plesafetytests: a test suite for identifying critical safety risks in large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.04512","last_updated":"2025-09-02T20:53:03Z","snapshot_observed_at":"2026-08-07T10:36:58.496060Z","submitted_at":"2025-09-02T20:53:03Z","title":"Scaling behavior of large language models in emotional safety classification across sizes and tasks","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T11:25:23.366764Z"},"links":{"cited_paper":"/paper/2311.08370","citing_paper":"/paper/2509.04512"},"observation_digest":"sha256:c3bd38c3f4109685646c9ea18425c6d83afbb366942535d45b170a4ea8a220f4","observation_id":"dd6466c5-a3a4-419c-afb5-52a2f4965a5b","resolution":{"observed_at":"2026-08-05T11:25:23.366764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08370","last_updated":"2024-02-16T09:42:19Z","snapshot_observed_at":"2026-08-07T06:51:25.278756Z","submitted_at":"2023-11-14T18:33:43Z","title":"SimpleSafetyTests: a Test Suite for Identifying Critical Safety Risks in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08370","snapshot_observed_at":"2026-08-03T08:52:34.725666Z","title":"ISBN 979-8-89176-335-7","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.15588","last_updated":"2026-07-02T12:42:02Z","snapshot_observed_at":"2026-08-04T10:32:44.442857Z","submitted_at":"2026-01-22T02:23:18Z","title":"YuFeng-XGuard: A Reasoning-Centric, Interpretable, and Flexible Guardrail Model for Large Language Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T08:52:34.725666Z"},"links":{"cited_paper":"/paper/2311.08370","citing_paper":"/paper/2601.15588"},"observation_digest":"sha256:415732d0aa1ff04e8731158199d661557f558157a953afb5eb8ad6f23127b4f3","observation_id":"7923d2dd-4db1-40a6-ae09-5a6959bf521e","resolution":{"observed_at":"2026-08-03T08:52:34.725666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08370","last_updated":"2024-02-16T09:42:19Z","snapshot_observed_at":"2026-08-07T06:51:25.278756Z","submitted_at":"2023-11-14T18:33:43Z","title":"SimpleSafetyTests: a Test Suite for Identifying Critical Safety Risks in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08370","snapshot_observed_at":"2026-07-13T11:43:31.089245Z","title":"Alexander Wei, Nika Haghtalab, and Jacob Steinhardt","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2604.03962","last_updated":"2026-04-05T04:48:15Z","snapshot_observed_at":"2026-07-13T11:43:29.708599Z","submitted_at":"2026-04-05T04:48:15Z","title":"Predict, Don't React: Value-Based Safety Forecasting for LLM Streaming","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-13T11:43:31.089245Z"},"links":{"cited_paper":"/paper/2311.08370","citing_paper":"/paper/2604.03962"},"observation_digest":"sha256:500415f99999b7268c99a4390a9852f3fbd1764fae2cc5edd35ef69fab1768e6","observation_id":"4a269938-0b2e-41e3-89cb-813df70be459","resolution":{"observed_at":"2026-07-13T11:43:31.089245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08370","last_updated":"2024-02-16T09:42:19Z","snapshot_observed_at":"2026-08-07T06:51:25.278756Z","submitted_at":"2023-11-14T18:33:43Z","title":"SimpleSafetyTests: a Test Suite for Identifying Critical Safety Risks in Large Language Models","version":2},"cited_work":{"arxiv_id":"2311.08370","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.08370","snapshot_observed_at":"2026-07-04T03:59:32.652255Z","title":"arXiv preprint arXiv:2311.08370 , year=","venue":null,"work_id":"640cffcd-ef2c-4e9c-9585-872794809e9e","year":2023},"citing_paper":{"arxiv_id":"2604.06233","last_updated":"2026-04-03T13:53:23Z","snapshot_observed_at":"2026-07-06T22:54:44.656835Z","submitted_at":"2026-04-03T13:53:23Z","title":"Blind Refusal: Language Models Refuse to Help Users Evade Unjust, Absurd, and Illegitimate Rules","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-05-13T19:24:54.381722Z"},"links":{"cited_paper":"/paper/2311.08370","citing_paper":"/paper/2604.06233"},"observation_digest":"sha256:e9982197c398ab2920526f6e53d4fe9e9b88f9ee12fecdb1df0dcd2439d0c584","observation_id":"541b6e26-2efd-412e-afee-8da6d76b1fcd","resolution":{"observed_at":"2026-05-13T19:28:09.962511Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08370","last_updated":"2024-02-16T09:42:19Z","snapshot_observed_at":"2026-08-07T06:51:25.278756Z","submitted_at":"2023-11-14T18:33:43Z","title":"SimpleSafetyTests: a Test Suite for Identifying Critical Safety Risks in Large Language Models","version":2},"cited_work":{"arxiv_id":"2311.08370","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.08370","snapshot_observed_at":"2026-07-04T03:59:32.652255Z","title":"arXiv preprint arXiv:2311.08370 , year=","venue":null,"work_id":"640cffcd-ef2c-4e9c-9585-872794809e9e","year":2023},"citing_paper":{"arxiv_id":"2604.07655","last_updated":"2026-04-08T23:47:29Z","snapshot_observed_at":"2026-08-02T09:41:13.361711Z","submitted_at":"2026-04-08T23:47:29Z","title":"Guardian-as-an-Advisor: Advancing Next-Generation Guardian Models for Trustworthy LLMs","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-10T17:27:13.339411Z"},"links":{"cited_paper":"/paper/2311.08370","citing_paper":"/paper/2604.07655"},"observation_digest":"sha256:e02d6b6436679f0e67fb348bf234e0c09f6dfd19b19e20402f0a50a782ee48dc","observation_id":"cc973d17-47c9-489b-82d9-1ab742d3aec2","resolution":{"observed_at":"2026-05-11T06:46:35.378670Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08370","last_updated":"2024-02-16T09:42:19Z","snapshot_observed_at":"2026-08-07T06:51:25.278756Z","submitted_at":"2023-11-14T18:33:43Z","title":"SimpleSafetyTests: a Test Suite for Identifying Critical Safety Risks in Large Language Models","version":2},"cited_work":{"arxiv_id":"2311.08370","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.08370","snapshot_observed_at":"2026-07-04T03:59:32.652255Z","title":"arXiv preprint arXiv:2311.08370 , year=","venue":null,"work_id":"640cffcd-ef2c-4e9c-9585-872794809e9e","year":2023},"citing_paper":{"arxiv_id":"2604.18519","last_updated":"2026-04-20T17:17:07Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:17:07Z","title":"LLM Safety From Within: Detecting Harmful Content with Internal Representations","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-10T04:33:54.058475Z"},"links":{"cited_paper":"/paper/2311.08370","citing_paper":"/paper/2604.18519"},"observation_digest":"sha256:17fff8a25f50dd3a030a41b5209fbd9f967d90447c6cc0f3c23d375984f32658","observation_id":"3e4d273c-0bd7-403f-bafe-ec9e1246d42a","resolution":{"observed_at":"2026-05-10T12:20:23.111469Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08370","last_updated":"2024-02-16T09:42:19Z","snapshot_observed_at":"2026-08-07T06:51:25.278756Z","submitted_at":"2023-11-14T18:33:43Z","title":"SimpleSafetyTests: a Test Suite for Identifying Critical Safety Risks in Large Language Models","version":2},"cited_work":{"arxiv_id":"2311.08370","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.08370","snapshot_observed_at":"2026-07-04T03:59:32.652255Z","title":"arXiv preprint arXiv:2311.08370 , year=","venue":null,"work_id":"640cffcd-ef2c-4e9c-9585-872794809e9e","year":2023},"citing_paper":{"arxiv_id":"2605.05678","last_updated":"2026-05-07T05:12:56Z","snapshot_observed_at":"2026-08-02T07:12:00.817422Z","submitted_at":"2026-05-07T05:12:56Z","title":"Chain of Risk: Safety Failures in Large Reasoning Models and Mitigation via Adaptive Multi-Principle Steering","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-08T11:49:47.994456Z"},"links":{"cited_paper":"/paper/2311.08370","citing_paper":"/paper/2605.05678"},"observation_digest":"sha256:b3d41d0dc98c77a91f71382148f750c62549d9f328d6b3c30cbdb5ca8e0a9c80","observation_id":"9ea79794-54cc-4934-974d-0f9707be9d06","resolution":{"observed_at":"2026-05-11T19:31:08.476793Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08370","last_updated":"2024-02-16T09:42:19Z","snapshot_observed_at":"2026-08-07T06:51:25.278756Z","submitted_at":"2023-11-14T18:33:43Z","title":"SimpleSafetyTests: a Test Suite for Identifying Critical Safety Risks in Large Language Models","version":2},"cited_work":{"arxiv_id":"2311.08370","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.08370","snapshot_observed_at":"2026-07-04T03:59:32.652255Z","title":"arXiv preprint arXiv:2311.08370 , year=","venue":null,"work_id":"640cffcd-ef2c-4e9c-9585-872794809e9e","year":2023},"citing_paper":{"arxiv_id":"2605.06605","last_updated":"2026-07-21T14:46:47Z","snapshot_observed_at":"2026-08-04T20:44:52.139668Z","submitted_at":"2026-05-07T17:25:15Z","title":"How Many Iterations to Jailbreak? Dynamic Budget Allocation for Multi-Turn LLM Evaluation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-08T12:13:16.896486Z"},"links":{"cited_paper":"/paper/2311.08370","citing_paper":"/paper/2605.06605"},"observation_digest":"sha256:73a80051f147a1fd33a4d7a4026ec25c2458d4773a012a00849fa2887939ce9a","observation_id":"bb71f8f2-96a5-477f-90a6-42c06ca75125","resolution":{"observed_at":"2026-05-11T19:21:07.880901Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08370","last_updated":"2024-02-16T09:42:19Z","snapshot_observed_at":"2026-08-07T06:51:25.278756Z","submitted_at":"2023-11-14T18:33:43Z","title":"SimpleSafetyTests: a Test Suite for Identifying Critical Safety Risks in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08370","snapshot_observed_at":"2026-08-02T14:49:14.212795Z","title":"SimpleSafetyTests: a Test Suite for Identifying Critical Safety Risks in Large Language Models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.06605","last_updated":"2026-07-21T14:46:47Z","snapshot_observed_at":"2026-08-04T20:44:52.139668Z","submitted_at":"2026-05-07T17:25:15Z","title":"How Many Iterations to Jailbreak? Dynamic Budget Allocation for Multi-Turn LLM Evaluation","version":5},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T14:49:14.212795Z"},"links":{"cited_paper":"/paper/2311.08370","citing_paper":"/paper/2605.06605"},"observation_digest":"sha256:4e3a2e0d06228a6b5828e29588209fe963eefee39af02226a1a5ab862b02fe47","observation_id":"b388b35e-96a5-4604-a763-b991bc3f650c","resolution":{"observed_at":"2026-08-02T14:49:14.212795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08370","last_updated":"2024-02-16T09:42:19Z","snapshot_observed_at":"2026-08-07T06:51:25.278756Z","submitted_at":"2023-11-14T18:33:43Z","title":"SimpleSafetyTests: a Test Suite for Identifying Critical Safety Risks in Large Language Models","version":2},"cited_work":{"arxiv_id":"2311.08370","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.08370","snapshot_observed_at":"2026-07-04T03:59:32.652255Z","title":"arXiv preprint arXiv:2311.08370 , year=","venue":null,"work_id":"640cffcd-ef2c-4e9c-9585-872794809e9e","year":2023},"citing_paper":{"arxiv_id":"2605.07982","last_updated":"2026-05-08T16:44:07Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T16:44:07Z","title":"GLiGuard: Schema-Conditioned Classification for LLM Safeguard","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-05-11T03:19:11.495230Z"},"links":{"cited_paper":"/paper/2311.08370","citing_paper":"/paper/2605.07982"},"observation_digest":"sha256:f8699eb85c66720993ba67d7b90ad8a967543969bc0f22ebdf09db465cbe055c","observation_id":"93da4356-bb7f-465f-8d4c-42dab9e7f2f1","resolution":{"observed_at":"2026-05-11T03:20:55.261341Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08370","last_updated":"2024-02-16T09:42:19Z","snapshot_observed_at":"2026-08-07T06:51:25.278756Z","submitted_at":"2023-11-14T18:33:43Z","title":"SimpleSafetyTests: a Test Suite for Identifying Critical Safety Risks in Large Language Models","version":2},"cited_work":{"arxiv_id":"2311.08370","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.08370","snapshot_observed_at":"2026-07-04T03:59:32.652255Z","title":"arXiv preprint arXiv:2311.08370 , year=","venue":null,"work_id":"640cffcd-ef2c-4e9c-9585-872794809e9e","year":2023},"citing_paper":{"arxiv_id":"2605.10639","last_updated":"2026-05-11T14:27:39Z","snapshot_observed_at":"2026-08-02T13:54:55.570407Z","submitted_at":"2026-05-11T14:27:39Z","title":"Navigating the Sea of LLM Evaluation: Investigating Bias in Toxicity Benchmarks","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-12T05:28:45.453455Z"},"links":{"cited_paper":"/paper/2311.08370","citing_paper":"/paper/2605.10639"},"observation_digest":"sha256:49a913ed466668465671ae90e035afcb1c3940030854fd1e6a46beed4e878bc3","observation_id":"33dfac57-ee03-403b-82b1-6f1f32950cde","resolution":{"observed_at":"2026-05-12T05:31:23.905179Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08370","last_updated":"2024-02-16T09:42:19Z","snapshot_observed_at":"2026-08-07T06:51:25.278756Z","submitted_at":"2023-11-14T18:33:43Z","title":"SimpleSafetyTests: a Test Suite for Identifying Critical Safety Risks in Large Language Models","version":2},"cited_work":{"arxiv_id":"2311.08370","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.08370","snapshot_observed_at":"2026-07-04T03:59:32.652255Z","title":"arXiv preprint arXiv:2311.08370 , year=","venue":null,"work_id":"640cffcd-ef2c-4e9c-9585-872794809e9e","year":2023},"citing_paper":{"arxiv_id":"2605.22435","last_updated":"2026-05-21T13:02:08Z","snapshot_observed_at":"2026-07-06T23:32:44.699825Z","submitted_at":"2026-05-21T13:02:08Z","title":"Assisted Counterspeech Writing at the Crossroads of Hate Speech and Misinformation","version":1},"reference_index":127,"source":"arxiv_source","source_observed_at":"2026-05-22T07:07:36.726431Z"},"links":{"cited_paper":"/paper/2311.08370","citing_paper":"/paper/2605.22435"},"observation_digest":"sha256:5fd37d0fe302a2245e0c70f8120443a374f924e634899bce535314e5da473bbe","observation_id":"d56d2ff7-7585-4262-bde0-e4d5dfb61862","resolution":{"observed_at":"2026-05-22T07:11:12.991681Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08370","last_updated":"2024-02-16T09:42:19Z","snapshot_observed_at":"2026-08-07T06:51:25.278756Z","submitted_at":"2023-11-14T18:33:43Z","title":"SimpleSafetyTests: a Test Suite for Identifying Critical Safety Risks in Large Language Models","version":2},"cited_work":{"arxiv_id":"2311.08370","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.08370","snapshot_observed_at":"2026-07-04T03:59:32.652255Z","title":"arXiv preprint arXiv:2311.08370 , year=","venue":null,"work_id":"640cffcd-ef2c-4e9c-9585-872794809e9e","year":2023},"citing_paper":{"arxiv_id":"2605.29659","last_updated":"2026-05-28T09:21:42Z","snapshot_observed_at":"2026-08-06T20:43:40.479073Z","submitted_at":"2026-05-28T09:21:42Z","title":"Opir: Efficient Multi-Task Safety Classification for Toxicity, Jailbreaks, Hate Speech, and Harmful Content","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-29T09:11:58.843585Z"},"links":{"cited_paper":"/paper/2311.08370","citing_paper":"/paper/2605.29659"},"observation_digest":"sha256:0e8e954ed143431d49c4ca7391e32748a34501ca35193e99caf9de8660ad06d6","observation_id":"98611d6b-ce7f-4d3c-a713-58155635b318","resolution":{"observed_at":"2026-06-29T09:13:15.953047Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08370","last_updated":"2024-02-16T09:42:19Z","snapshot_observed_at":"2026-08-07T06:51:25.278756Z","submitted_at":"2023-11-14T18:33:43Z","title":"SimpleSafetyTests: a Test Suite for Identifying Critical Safety Risks in Large Language Models","version":2},"cited_work":{"arxiv_id":"2311.08370","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.08370","snapshot_observed_at":"2026-07-04T03:59:32.652255Z","title":"arXiv preprint arXiv:2311.08370 , year=","venue":null,"work_id":"640cffcd-ef2c-4e9c-9585-872794809e9e","year":2023},"citing_paper":{"arxiv_id":"2606.19168","last_updated":"2026-06-17T15:11:43Z","snapshot_observed_at":"2026-08-05T23:22:13.413659Z","submitted_at":"2026-06-17T15:11:43Z","title":"Beyond Safe Data: Pretraining-Stage Alignment with Regular Safety Reflection","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-06-26T20:40:15.506976Z"},"links":{"cited_paper":"/paper/2311.08370","citing_paper":"/paper/2606.19168"},"observation_digest":"sha256:5898c1f1da79b9d55e90582ac49b6851dd52364d71fa924a20d7b237973545d9","observation_id":"038c79bb-5e1e-48f9-99d3-ef3b851d43f2","resolution":{"observed_at":"2026-07-04T01:09:18.912001Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08370","last_updated":"2024-02-16T09:42:19Z","snapshot_observed_at":"2026-08-07T06:51:25.278756Z","submitted_at":"2023-11-14T18:33:43Z","title":"SimpleSafetyTests: a Test Suite for Identifying Critical Safety Risks in Large Language Models","version":2},"cited_work":{"arxiv_id":"2311.08370","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.08370","snapshot_observed_at":"2026-07-04T03:59:32.652255Z","title":"arXiv preprint arXiv:2311.08370 , year=","venue":null,"work_id":"640cffcd-ef2c-4e9c-9585-872794809e9e","year":2023},"citing_paper":{"arxiv_id":"2606.20369","last_updated":"2026-06-18T15:32:14Z","snapshot_observed_at":"2026-07-30T09:53:42.916716Z","submitted_at":"2026-06-18T15:32:14Z","title":"CATCH-ME if you RAG: a dataset of Contextually Annotated multi-Turn Counterspeech against Hate and Misinformation Exchanges","version":1},"reference_index":138,"source":"arxiv_source","source_observed_at":"2026-06-26T17:30:07.053955Z"},"links":{"cited_paper":"/paper/2311.08370","citing_paper":"/paper/2606.20369"},"observation_digest":"sha256:77abdd5abc181c8b01cf0260cc763e7f4204e67608d34142b68abf303e01436a","observation_id":"3136f6e0-4c54-4f1d-9371-5d9978f37405","resolution":{"observed_at":"2026-07-04T03:59:32.654360Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08370","last_updated":"2024-02-16T09:42:19Z","snapshot_observed_at":"2026-08-07T06:51:25.278756Z","submitted_at":"2023-11-14T18:33:43Z","title":"SimpleSafetyTests: a Test Suite for Identifying Critical Safety Risks in Large Language Models","version":2},"cited_work":{"arxiv_id":"2311.08370","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.08370","snapshot_observed_at":"2026-07-04T03:59:32.652255Z","title":"arXiv preprint arXiv:2311.08370 , year=","venue":null,"work_id":"640cffcd-ef2c-4e9c-9585-872794809e9e","year":2023},"citing_paper":{"arxiv_id":"2606.20626","last_updated":"2026-05-26T17:35:31Z","snapshot_observed_at":"2026-08-06T08:20:13.528819Z","submitted_at":"2026-05-26T17:35:31Z","title":"Efficient Safety Benchmarking via Item Response Theory","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-01T15:51:00.484343Z"},"links":{"cited_paper":"/paper/2311.08370","citing_paper":"/paper/2606.20626"},"observation_digest":"sha256:57b646126536716b5723a25ddd40d93a6afcf170ef0026aa53262ed0cd7a5e6d","observation_id":"e7cfaa08-b924-4810-9d1c-e6f39525d57e","resolution":{"observed_at":"2026-07-01T15:55:48.964480Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08370","last_updated":"2024-02-16T09:42:19Z","snapshot_observed_at":"2026-08-07T06:51:25.278756Z","submitted_at":"2023-11-14T18:33:43Z","title":"SimpleSafetyTests: a Test Suite for Identifying Critical Safety Risks in Large Language Models","version":2},"cited_work":{"arxiv_id":"2311.08370","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.08370","snapshot_observed_at":"2026-07-04T03:59:32.652255Z","title":"arXiv preprint arXiv:2311.08370 , year=","venue":null,"work_id":"640cffcd-ef2c-4e9c-9585-872794809e9e","year":2023},"citing_paper":{"arxiv_id":"2606.28153","last_updated":"2026-06-29T15:00:34Z","snapshot_observed_at":"2026-07-07T00:02:18.989389Z","submitted_at":"2026-06-26T14:51:16Z","title":"Robust Harmful Features Under Jailbreak Attacks: Mechanistic Evidence from Attention Head Specialization in Large Language Models","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-06-29T03:35:34.594617Z"},"links":{"cited_paper":"/paper/2311.08370","citing_paper":"/paper/2606.28153"},"observation_digest":"sha256:349f434e1d2675c6fa5147ea4ca2618b333c6b14881975c99899df9f7179724c","observation_id":"b6c5d441-8210-43b1-b07c-0172b1668320","resolution":{"observed_at":"2026-07-01T17:35:51.347673Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08370","last_updated":"2024-02-16T09:42:19Z","snapshot_observed_at":"2026-08-07T06:51:25.278756Z","submitted_at":"2023-11-14T18:33:43Z","title":"SimpleSafetyTests: a Test Suite for Identifying Critical Safety Risks in Large Language Models","version":2},"cited_work":{"arxiv_id":"2311.08370","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.08370","snapshot_observed_at":"2026-07-04T03:59:32.652255Z","title":"arXiv preprint arXiv:2311.08370 , year=","venue":null,"work_id":"640cffcd-ef2c-4e9c-9585-872794809e9e","year":2023},"citing_paper":{"arxiv_id":"2606.28153","last_updated":"2026-06-29T15:00:34Z","snapshot_observed_at":"2026-07-07T00:02:18.989389Z","submitted_at":"2026-06-26T14:51:16Z","title":"Robust Harmful Features Under Jailbreak Attacks: Mechanistic Evidence from Attention Head Specialization in Large Language Models","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-06-30T09:32:59.824110Z"},"links":{"cited_paper":"/paper/2311.08370","citing_paper":"/paper/2606.28153"},"observation_digest":"sha256:662d3733c38c0eca7ae2bfdda5e38416c1299448b24265dbb1f715082280cf94","observation_id":"88e4652b-bc78-4315-926b-f45ec0be14ba","resolution":{"observed_at":"2026-06-30T09:34:34.459004Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08370","last_updated":"2024-02-16T09:42:19Z","snapshot_observed_at":"2026-08-07T06:51:25.278756Z","submitted_at":"2023-11-14T18:33:43Z","title":"SimpleSafetyTests: a Test Suite for Identifying Critical Safety Risks in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08370","snapshot_observed_at":"2026-08-01T07:36:57.443689Z","title":"arXiv preprint arXiv:2311.08370","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21401","last_updated":"2026-07-23T15:02:24Z","snapshot_observed_at":"2026-08-04T03:07:11.235926Z","submitted_at":"2026-07-23T15:02:24Z","title":"When Are Reasoning-Based Guardrails Not Efficient? ResponseGuard: A Fast Vision-Language Guard for Real-Time Moderation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T07:36:57.443689Z"},"links":{"cited_paper":"/paper/2311.08370","citing_paper":"/paper/2607.21401"},"observation_digest":"sha256:6c7ba6289e608831bf458839e093b163ba75d8b90b7a5de551a6a25572aea29f","observation_id":"431a847b-be93-46c0-b3b2-f91be2408787","resolution":{"observed_at":"2026-08-01T07:36:57.443689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08370","last_updated":"2024-02-16T09:42:19Z","snapshot_observed_at":"2026-08-07T06:51:25.278756Z","submitted_at":"2023-11-14T18:33:43Z","title":"SimpleSafetyTests: a Test Suite for Identifying Critical Safety Risks in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08370","snapshot_observed_at":"2026-08-02T14:52:12.602287Z","title":"SimpleSafetyTests: A Test Suite for Identifying Critical Safety Risks in Large Language Models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.22545","last_updated":"2026-05-06T10:14:30Z","snapshot_observed_at":"2026-08-09T18:04:23.587872Z","submitted_at":"2026-05-06T10:14:30Z","title":"Semalith v1.4: A Calibrated 184M Safety Classifier Achieving State-of-the-Art Prompt-Injection Detection at 44x Fewer Parameters than Llama-Guard-3-8B","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T14:52:12.602287Z"},"links":{"cited_paper":"/paper/2311.08370","citing_paper":"/paper/2607.22545"},"observation_digest":"sha256:f21caf5125df9b88677e6c8ec75dcdacd2b87b65a5ccb0209e138c19b1cd21f4","observation_id":"9f208a3a-3e98-4988-bd5a-a9a9a43da872","resolution":{"observed_at":"2026-08-02T14:52:12.602287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2311.08370/citation-record","integrity":"/paper/2311.08370/integrity","json":"/paper/2311.08370/citation-record.json","paper":"/paper/2311.08370"},"outbound":[],"paper":{"arxiv_id":"2311.08370","last_updated":"2024-02-16T09:42:19Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T06:51:25.278756Z","submitted_at":"2023-11-14T18:33:43Z","title":"SimpleSafetyTests: a Test Suite for Identifying Critical Safety Risks in Large Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 23 inbound Pith citation observations for arXiv:2311.08370."}