{"as_of":"2026-08-10T11:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d13712107c40bfe5b316288baa374849b86e629d163f4acf3a010d71282cd9af","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":39,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T13:14:34.116590Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":4,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2308.13387","last_updated":"2023-09-04T01:47:30Z","snapshot_observed_at":"2026-07-06T16:10:23.328130Z","submitted_at":"2023-08-25T14:02:12Z","title":"Do-Not-Answer: A Dataset for Evaluating Safeguards in LLMs","version":2},"cited_work":{"arxiv_id":"2308.13387","doi":"10.48550/arxiv.2308.13387","metadata_source":"arxiv_reference","pith_arxiv_id":"2308.13387","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Towards veri- fying the geometric robustness of large-scale neural net- works","venue":"arXiv (Cornell University)","work_id":"7d461849-cc8d-4f7f-bf07-6c5e9ea94914","year":2023},"citing_paper":{"arxiv_id":"2310.02446","last_updated":"2024-01-27T22:54:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-03T21:30:56Z","title":"Low-Resource Languages Jailbreak GPT-4","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-17T09:24:13.911401Z"},"links":{"cited_paper":"/paper/2308.13387","citing_paper":"/paper/2310.02446"},"observation_digest":"sha256:d2519b09e2080486c600d3825daa9b8263e0d89aca1ec48cea3fa1d3756139f5","observation_id":"49da06db-1474-4a09-96ad-1dec12bda0b5","resolution":{"observed_at":"2026-05-17T09:24:14.124720Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.13387","last_updated":"2023-09-04T01:47:30Z","snapshot_observed_at":"2026-07-06T16:10:23.328130Z","submitted_at":"2023-08-25T14:02:12Z","title":"Do-Not-Answer: A Dataset for Evaluating Safeguards in LLMs","version":2},"cited_work":{"arxiv_id":"2308.13387","doi":"10.48550/arxiv.2308.13387","metadata_source":"arxiv_reference","pith_arxiv_id":"2308.13387","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Towards veri- fying the geometric robustness of large-scale neural net- works","venue":"arXiv (Cornell University)","work_id":"7d461849-cc8d-4f7f-bf07-6c5e9ea94914","year":2023},"citing_paper":{"arxiv_id":"2401.02954","last_updated":"2024-01-05T18:59:13Z","snapshot_observed_at":"2026-08-02T13:11:16.882565Z","submitted_at":"2024-01-05T18:59:13Z","title":"DeepSeek LLM: Scaling Open-Source Language Models with Longtermism","version":1},"reference_index":151,"source":"arxiv_source","source_observed_at":"2026-05-11T06:08:05.550346Z"},"links":{"cited_paper":"/paper/2308.13387","citing_paper":"/paper/2401.02954"},"observation_digest":"sha256:ddbb397856ec4c9e70a77061e6dbde06e969a068a80c2a138529c216f77c2273","observation_id":"d214990f-e87f-4a7c-bd7c-551b0ac587d2","resolution":{"observed_at":"2026-05-11T06:08:05.807659Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.13387","last_updated":"2023-09-04T01:47:30Z","snapshot_observed_at":"2026-07-06T16:10:23.328130Z","submitted_at":"2023-08-25T14:02:12Z","title":"Do-Not-Answer: A Dataset for Evaluating Safeguards in LLMs","version":2},"cited_work":{"arxiv_id":"2308.13387","doi":"10.48550/arxiv.2308.13387","metadata_source":"arxiv_reference","pith_arxiv_id":"2308.13387","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Towards veri- fying the geometric robustness of large-scale neural net- works","venue":"arXiv (Cornell University)","work_id":"7d461849-cc8d-4f7f-bf07-6c5e9ea94914","year":2023},"citing_paper":{"arxiv_id":"2401.05561","last_updated":"2024-09-30T10:17:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-10T22:07:21Z","title":"TrustLLM: Trustworthiness in Large Language Models","version":6},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-18T11:17:08.108565Z"},"links":{"cited_paper":"/paper/2308.13387","citing_paper":"/paper/2401.05561"},"observation_digest":"sha256:c1c1a1cd91caed8949623cbbaa8a072bb3e4df26b15526bc2f8a0c3da65cedff","observation_id":"f80178cc-aec5-402b-b6c5-a92bbc41ba05","resolution":{"observed_at":"2026-05-18T11:17:08.446480Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.13387","last_updated":"2023-09-04T01:47:30Z","snapshot_observed_at":"2026-07-06T16:10:23.328130Z","submitted_at":"2023-08-25T14:02:12Z","title":"Do-Not-Answer: A Dataset for Evaluating Safeguards in LLMs","version":2},"cited_work":{"arxiv_id":"2308.13387","doi":"10.48550/arxiv.2308.13387","metadata_source":"arxiv_reference","pith_arxiv_id":"2308.13387","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Towards veri- fying the geometric robustness of large-scale neural net- works","venue":"arXiv (Cornell University)","work_id":"7d461849-cc8d-4f7f-bf07-6c5e9ea94914","year":2023},"citing_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"reference_index":149,"source":"arxiv_source","source_observed_at":"2026-05-11T05:36:26.207359Z"},"links":{"cited_paper":"/paper/2308.13387","citing_paper":"/paper/2405.04434"},"observation_digest":"sha256:322974afcf972a6a0002f6a0baf17096a8438ccec797b6c0a92bc7233f04f7fe","observation_id":"dbae861b-3cd9-4b8d-ad84-67e64f05caba","resolution":{"observed_at":"2026-05-11T05:36:26.527158Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.13387","last_updated":"2023-09-04T01:47:30Z","snapshot_observed_at":"2026-07-06T16:10:23.328130Z","submitted_at":"2023-08-25T14:02:12Z","title":"Do-Not-Answer: A Dataset for Evaluating Safeguards in LLMs","version":2},"cited_work":{"arxiv_id":"2308.13387","doi":"10.48550/arxiv.2308.13387","metadata_source":"arxiv_reference","pith_arxiv_id":"2308.13387","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Towards veri- fying the geometric robustness of large-scale neural net- works","venue":"arXiv (Cornell University)","work_id":"7d461849-cc8d-4f7f-bf07-6c5e9ea94914","year":2023},"citing_paper":{"arxiv_id":"2407.04295","last_updated":"2024-08-30T11:57:47Z","snapshot_observed_at":"2026-08-04T23:34:13.332065Z","submitted_at":"2024-07-05T06:57:30Z","title":"Jailbreak Attacks and Defenses Against Large Language Models: A Survey","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-05-15T02:20:44.368219Z"},"links":{"cited_paper":"/paper/2308.13387","citing_paper":"/paper/2407.04295"},"observation_digest":"sha256:06a86486a913ef79fbdd7f9dc7b9995f0ef1675453838f9b5b450180976cdc55","observation_id":"4b290f1a-438c-44dc-a7ec-95464f90b851","resolution":{"observed_at":"2026-05-15T02:20:44.861198Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.13387","last_updated":"2023-09-04T01:47:30Z","snapshot_observed_at":"2026-07-06T16:10:23.328130Z","submitted_at":"2023-08-25T14:02:12Z","title":"Do-Not-Answer: A Dataset for Evaluating Safeguards in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.13387","snapshot_observed_at":"2026-08-09T13:14:34.116590Z","title":"Do-not-answer: A dataset for evaluating safeguards in llms","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02153","last_updated":"2025-02-04T09:31:54Z","snapshot_observed_at":"2026-08-10T00:34:18.762743Z","submitted_at":"2025-02-04T09:31:54Z","title":"Vulnerability Mitigation for Safety-Aligned Language Models via Debiasing","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-09T13:14:34.116590Z"},"links":{"cited_paper":"/paper/2308.13387","citing_paper":"/paper/2502.02153"},"observation_digest":"sha256:ab691083d954c5d11f8135e153bbc79580a39f7a1bdc091505f1c7d3d678d740","observation_id":"aebf8f1a-3c1c-4fe8-a5c7-c90c725ec6d2","resolution":{"observed_at":"2026-08-09T13:14:34.116590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.13387","last_updated":"2023-09-04T01:47:30Z","snapshot_observed_at":"2026-07-06T16:10:23.328130Z","submitted_at":"2023-08-25T14:02:12Z","title":"Do-Not-Answer: A Dataset for Evaluating Safeguards in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.13387","snapshot_observed_at":"2026-08-08T23:50:36.181837Z","title":"Do-not-answer: A dataset for evaluating safeguards in llms","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04040","last_updated":"2025-05-30T09:43:42Z","snapshot_observed_at":"2026-08-08T23:43:13.905441Z","submitted_at":"2025-02-06T13:01:44Z","title":"Safety Reasoning with Guidelines","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-08T23:50:36.181837Z"},"links":{"cited_paper":"/paper/2308.13387","citing_paper":"/paper/2502.04040"},"observation_digest":"sha256:7ac8745f167d28488d2faee8b8f801a63beb8152640d1171e673ad28e0733649","observation_id":"025fa25f-3b8a-4744-8796-914ab383d9b6","resolution":{"observed_at":"2026-08-08T23:50:36.181837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.13387","last_updated":"2023-09-04T01:47:30Z","snapshot_observed_at":"2026-07-06T16:10:23.328130Z","submitted_at":"2023-08-25T14:02:12Z","title":"Do-Not-Answer: A Dataset for Evaluating Safeguards in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.13387","snapshot_observed_at":"2026-08-07T14:52:30.727155Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17332","last_updated":"2025-05-22T22:56:58Z","snapshot_observed_at":"2026-08-09T16:51:28.094742Z","submitted_at":"2025-05-22T22:56:58Z","title":"SweEval: Do LLMs Really Swear? A Safety Benchmark for Testing Limits for Enterprise Use","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T14:52:30.727155Z"},"links":{"cited_paper":"/paper/2308.13387","citing_paper":"/paper/2505.17332"},"observation_digest":"sha256:a1d92261f55b3e7d424e7cc37241efb4e69a64a2916172b361bdc2869e2b505e","observation_id":"8dea832e-a657-4a75-9287-1323bcb16dd5","resolution":{"observed_at":"2026-08-07T14:52:30.727155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.13387","last_updated":"2023-09-04T01:47:30Z","snapshot_observed_at":"2026-07-06T16:10:23.328130Z","submitted_at":"2023-08-25T14:02:12Z","title":"Do-Not-Answer: A Dataset for Evaluating Safeguards in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.13387","snapshot_observed_at":"2026-08-07T13:26:10.644766Z","title":"arXiv preprint arXiv:2308.13387","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.21849","last_updated":"2025-05-28T00:30:22Z","snapshot_observed_at":"2026-08-09T15:03:24.745653Z","submitted_at":"2025-05-28T00:30:22Z","title":"Xinyu AI Search: Enhanced Relevance and Comprehensive Results with Rich Answer Presentations","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:10.644766Z"},"links":{"cited_paper":"/paper/2308.13387","citing_paper":"/paper/2505.21849"},"observation_digest":"sha256:a1751657865cd4f2cdb1b822d8e2155fdbf760934d8abb37f2dcf196343a1ded","observation_id":"b4e6b0ea-e62c-4c59-a12d-910c41a6b0cb","resolution":{"observed_at":"2026-08-07T13:26:10.644766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.13387","last_updated":"2023-09-04T01:47:30Z","snapshot_observed_at":"2026-07-06T16:10:23.328130Z","submitted_at":"2023-08-25T14:02:12Z","title":"Do-Not-Answer: A Dataset for Evaluating Safeguards in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.13387","snapshot_observed_at":"2026-08-07T11:26:06.467953Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02592","last_updated":"2025-06-03T08:12:47Z","snapshot_observed_at":"2026-08-07T15:19:01.070855Z","submitted_at":"2025-06-03T08:12:47Z","title":"Beyond the Surface: Measuring Self-Preference in LLM Judgments","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:06.467953Z"},"links":{"cited_paper":"/paper/2308.13387","citing_paper":"/paper/2506.02592"},"observation_digest":"sha256:58679436cdef6e143e240cc40ea29e1af232e6fd203a8da2739c422cd12a21b1","observation_id":"2d3a899b-48da-4516-b36b-31962dfbab41","resolution":{"observed_at":"2026-08-07T11:26:06.467953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.13387","last_updated":"2023-09-04T01:47:30Z","snapshot_observed_at":"2026-07-06T16:10:23.328130Z","submitted_at":"2023-08-25T14:02:12Z","title":"Do-Not-Answer: A Dataset for Evaluating Safeguards in LLMs","version":2},"cited_work":{"arxiv_id":"2308.13387","doi":"10.48550/arxiv.2308.13387","metadata_source":"arxiv_reference","pith_arxiv_id":"2308.13387","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Towards veri- fying the geometric robustness of large-scale neural net- works","venue":"arXiv (Cornell University)","work_id":"7d461849-cc8d-4f7f-bf07-6c5e9ea94914","year":2023},"citing_paper":{"arxiv_id":"2507.00432","last_updated":"2025-10-20T14:27:09Z","snapshot_observed_at":"2026-08-09T08:43:45.790818Z","submitted_at":"2025-07-01T05:23:05Z","title":"Does Math Reasoning Improve General LLM Capabilities? Understanding Transferability of LLM Reasoning","version":2},"reference_index":234,"source":"arxiv_source","source_observed_at":"2026-05-19T01:01:09.840919Z"},"links":{"cited_paper":"/paper/2308.13387","citing_paper":"/paper/2507.00432"},"observation_digest":"sha256:9736ce942b8d67e505ce18c6b6f57875669707f43ef9ac7900abce942a16bae7","observation_id":"a77cdee8-0522-41fa-84d8-875e81486a24","resolution":{"observed_at":"2026-05-19T01:01:09.979243Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.13387","last_updated":"2023-09-04T01:47:30Z","snapshot_observed_at":"2026-07-06T16:10:23.328130Z","submitted_at":"2023-08-25T14:02:12Z","title":"Do-Not-Answer: A Dataset for Evaluating Safeguards in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.13387","snapshot_observed_at":"2026-08-06T18:28:45.637554Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08898","last_updated":"2025-07-17T08:01:44Z","snapshot_observed_at":"2026-08-08T14:51:56.908190Z","submitted_at":"2025-07-11T05:15:35Z","title":"SEALGuard: Safeguarding the Multilingual Conversations in Southeast Asian Languages for LLM Software Systems","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T18:28:45.637554Z"},"links":{"cited_paper":"/paper/2308.13387","citing_paper":"/paper/2507.08898"},"observation_digest":"sha256:64d3144208c68fd552dba94a5883cc337daf2c44076b288b132e8987485b500c","observation_id":"0c3a4973-30b9-47b5-9a48-97af1325e9d3","resolution":{"observed_at":"2026-08-06T18:28:45.637554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.13387","last_updated":"2023-09-04T01:47:30Z","snapshot_observed_at":"2026-07-06T16:10:23.328130Z","submitted_at":"2023-08-25T14:02:12Z","title":"Do-Not-Answer: A Dataset for Evaluating Safeguards in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.13387","snapshot_observed_at":"2026-08-05T23:13:04.544081Z","title":"arXiv preprint arXiv:2308.13387 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":124,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:04.544081Z"},"links":{"cited_paper":"/paper/2308.13387","citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:0ce97458623890bd033daaef3828698927e77a00401725ac35ab953aaac5fd08","observation_id":"6e3d5fd9-d925-426f-aeed-56809efd5295","resolution":{"observed_at":"2026-08-05T23:13:04.544081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.13387","last_updated":"2023-09-04T01:47:30Z","snapshot_observed_at":"2026-07-06T16:10:23.328130Z","submitted_at":"2023-08-25T14:02:12Z","title":"Do-Not-Answer: A Dataset for Evaluating Safeguards in LLMs","version":2},"cited_work":{"arxiv_id":"2308.13387","doi":"10.48550/arxiv.2308.13387","metadata_source":"arxiv_reference","pith_arxiv_id":"2308.13387","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Towards veri- fying the geometric robustness of large-scale neural net- works","venue":"arXiv (Cornell University)","work_id":"7d461849-cc8d-4f7f-bf07-6c5e9ea94914","year":2023},"citing_paper":{"arxiv_id":"2602.07340","last_updated":"2026-05-21T07:39:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-07T03:46:33Z","title":"Revisiting Robustness for LLM Safety Alignment via Selective Geometry Control","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-22T11:17:03.104902Z"},"links":{"cited_paper":"/paper/2308.13387","citing_paper":"/paper/2602.07340"},"observation_digest":"sha256:01fa65a4bb0a358fe731f44c1b084ae917bc653a8fbda54fc5e40018a3108e00","observation_id":"dde2c32f-5be4-4115-a64b-ff810cd02d84","resolution":{"observed_at":"2026-05-22T11:21:28.969308Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.13387","last_updated":"2023-09-04T01:47:30Z","snapshot_observed_at":"2026-07-06T16:10:23.328130Z","submitted_at":"2023-08-25T14:02:12Z","title":"Do-Not-Answer: A Dataset for Evaluating Safeguards in LLMs","version":2},"cited_work":{"arxiv_id":"2308.13387","doi":"10.48550/arxiv.2308.13387","metadata_source":"arxiv_reference","pith_arxiv_id":"2308.13387","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Towards veri- fying the geometric robustness of large-scale neural net- works","venue":"arXiv (Cornell University)","work_id":"7d461849-cc8d-4f7f-bf07-6c5e9ea94914","year":2023},"citing_paper":{"arxiv_id":"2604.01444","last_updated":"2026-04-03T15:46:12Z","snapshot_observed_at":"2026-07-06T22:51:35.522923Z","submitted_at":"2026-04-01T22:38:38Z","title":"Cooking Up Risks: Benchmarking and Reducing Food Safety Risks in Large Language Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-13T22:02:12.555644Z"},"links":{"cited_paper":"/paper/2308.13387","citing_paper":"/paper/2604.01444"},"observation_digest":"sha256:3a34e24d11a6aaa1c0189caeb2aab7e432375d6a086bdbdfeb825fdaad69cce0","observation_id":"aff94550-37b0-4bdf-8fcb-7c74bfd3e047","resolution":{"observed_at":"2026-05-13T22:03:20.386027Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.13387","last_updated":"2023-09-04T01:47:30Z","snapshot_observed_at":"2026-07-06T16:10:23.328130Z","submitted_at":"2023-08-25T14:02:12Z","title":"Do-Not-Answer: A Dataset for Evaluating Safeguards in LLMs","version":2},"cited_work":{"arxiv_id":"2308.13387","doi":"10.48550/arxiv.2308.13387","metadata_source":"arxiv_reference","pith_arxiv_id":"2308.13387","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Towards veri- fying the geometric robustness of large-scale neural net- works","venue":"arXiv (Cornell University)","work_id":"7d461849-cc8d-4f7f-bf07-6c5e9ea94914","year":2023},"citing_paper":{"arxiv_id":"2604.07655","last_updated":"2026-04-08T23:47:29Z","snapshot_observed_at":"2026-08-02T09:41:13.361711Z","submitted_at":"2026-04-08T23:47:29Z","title":"Guardian-as-an-Advisor: Advancing Next-Generation Guardian Models for Trustworthy LLMs","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-10T17:27:13.339411Z"},"links":{"cited_paper":"/paper/2308.13387","citing_paper":"/paper/2604.07655"},"observation_digest":"sha256:a33cb8156db8b84854b0cdc0ad9021c7ce55e3e210e669a6055cca12c32a4bd8","observation_id":"c4abdfe4-cb30-48df-a7cd-305efd06f8d7","resolution":{"observed_at":"2026-05-11T06:46:36.406518Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.13387","last_updated":"2023-09-04T01:47:30Z","snapshot_observed_at":"2026-07-06T16:10:23.328130Z","submitted_at":"2023-08-25T14:02:12Z","title":"Do-Not-Answer: A Dataset for Evaluating Safeguards in LLMs","version":2},"cited_work":{"arxiv_id":"2308.13387","doi":"10.48550/arxiv.2308.13387","metadata_source":"arxiv_reference","pith_arxiv_id":"2308.13387","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Towards veri- fying the geometric robustness of large-scale neural net- works","venue":"arXiv (Cornell University)","work_id":"7d461849-cc8d-4f7f-bf07-6c5e9ea94914","year":2023},"citing_paper":{"arxiv_id":"2604.07754","last_updated":"2026-04-09T03:20:29Z","snapshot_observed_at":"2026-07-06T22:57:00.904627Z","submitted_at":"2026-04-09T03:20:29Z","title":"The Art of (Mis)alignment: How Fine-Tuning Methods Effectively Misalign and Realign LLMs in Post-Training","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-10T18:18:56.476698Z"},"links":{"cited_paper":"/paper/2308.13387","citing_paper":"/paper/2604.07754"},"observation_digest":"sha256:41b01508993c358a8cb46ba44bc7bb00bce50cd0184d1564ccc799827c1ce22c","observation_id":"931bb8ab-2a49-4933-bdbc-cea2a466d8e6","resolution":{"observed_at":"2026-05-11T00:45:50.631891Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.13387","last_updated":"2023-09-04T01:47:30Z","snapshot_observed_at":"2026-07-06T16:10:23.328130Z","submitted_at":"2023-08-25T14:02:12Z","title":"Do-Not-Answer: A Dataset for Evaluating Safeguards in LLMs","version":2},"cited_work":{"arxiv_id":"2308.13387","doi":"10.48550/arxiv.2308.13387","metadata_source":"arxiv_reference","pith_arxiv_id":"2308.13387","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Towards veri- fying the geometric robustness of large-scale neural net- works","venue":"arXiv (Cornell University)","work_id":"7d461849-cc8d-4f7f-bf07-6c5e9ea94914","year":2023},"citing_paper":{"arxiv_id":"2604.21152","last_updated":"2026-04-22T23:33:18Z","snapshot_observed_at":"2026-08-08T02:09:22.518771Z","submitted_at":"2026-04-22T23:33:18Z","title":"Dialect vs Demographics: Quantifying LLM Bias from Implicit Linguistic Signals vs. Explicit User Profiles","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-09T22:35:03.952451Z"},"links":{"cited_paper":"/paper/2308.13387","citing_paper":"/paper/2604.21152"},"observation_digest":"sha256:0235e323f5442dd6318496ac921fa810bf6197d4008187e39ccb65fb08bb4dba","observation_id":"329b1e73-7a7a-4401-ac4b-213d93b31f5d","resolution":{"observed_at":"2026-05-09T22:39:14.506405Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.13387","last_updated":"2023-09-04T01:47:30Z","snapshot_observed_at":"2026-07-06T16:10:23.328130Z","submitted_at":"2023-08-25T14:02:12Z","title":"Do-Not-Answer: A Dataset for Evaluating Safeguards in LLMs","version":2},"cited_work":{"arxiv_id":"2308.13387","doi":"10.48550/arxiv.2308.13387","metadata_source":"arxiv_reference","pith_arxiv_id":"2308.13387","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Towards veri- fying the geometric robustness of large-scale neural net- works","venue":"arXiv (Cornell University)","work_id":"7d461849-cc8d-4f7f-bf07-6c5e9ea94914","year":2023},"citing_paper":{"arxiv_id":"2605.01687","last_updated":"2026-05-03T02:55:30Z","snapshot_observed_at":"2026-07-06T23:14:52.417213Z","submitted_at":"2026-05-03T02:55:30Z","title":"MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-10T16:00:32.413225Z"},"links":{"cited_paper":"/paper/2308.13387","citing_paper":"/paper/2605.01687"},"observation_digest":"sha256:1f166539dcd0f7b6164e0022c26066973b0478db748031cdbcac6cf3d48631e0","observation_id":"67893cbf-c80c-41c7-b2d2-f3776cc73794","resolution":{"observed_at":"2026-05-11T09:31:01.138639Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.13387","last_updated":"2023-09-04T01:47:30Z","snapshot_observed_at":"2026-07-06T16:10:23.328130Z","submitted_at":"2023-08-25T14:02:12Z","title":"Do-Not-Answer: A Dataset for Evaluating Safeguards in LLMs","version":2},"cited_work":{"arxiv_id":"2308.13387","doi":"10.48550/arxiv.2308.13387","metadata_source":"arxiv_reference","pith_arxiv_id":"2308.13387","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Towards veri- fying the geometric robustness of large-scale neural net- works","venue":"arXiv (Cornell University)","work_id":"7d461849-cc8d-4f7f-bf07-6c5e9ea94914","year":2023},"citing_paper":{"arxiv_id":"2605.03179","last_updated":"2026-05-04T21:42:10Z","snapshot_observed_at":"2026-08-05T14:29:07.431614Z","submitted_at":"2026-05-04T21:42:10Z","title":"A Validated Prompt Bank for Malicious Code Generation: Separating Executable Weapons from Security Knowledge in 1,554 Consensus-Labeled Prompts","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-08T18:11:29.066362Z"},"links":{"cited_paper":"/paper/2308.13387","citing_paper":"/paper/2605.03179"},"observation_digest":"sha256:65f4ade05cbd61e4cf998fc925e36647555f3554184206625371172668e568a5","observation_id":"6bacf8e7-54c3-4907-94b3-e089133574ce","resolution":{"observed_at":"2026-05-09T06:40:43.791322Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.13387","last_updated":"2023-09-04T01:47:30Z","snapshot_observed_at":"2026-07-06T16:10:23.328130Z","submitted_at":"2023-08-25T14:02:12Z","title":"Do-Not-Answer: A Dataset for Evaluating Safeguards in LLMs","version":2},"cited_work":{"arxiv_id":"2308.13387","doi":"10.48550/arxiv.2308.13387","metadata_source":"arxiv_reference","pith_arxiv_id":"2308.13387","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Towards veri- fying the geometric robustness of large-scale neural net- works","venue":"arXiv (Cornell University)","work_id":"7d461849-cc8d-4f7f-bf07-6c5e9ea94914","year":2023},"citing_paper":{"arxiv_id":"2605.06213","last_updated":"2026-05-26T15:14:12Z","snapshot_observed_at":"2026-07-06T23:18:41.400741Z","submitted_at":"2026-05-07T13:15:31Z","title":"Beyond Fixed Benchmarks and Worst-Case Attacks: Dynamic Boundary Evaluation for Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-08T10:13:35.777910Z"},"links":{"cited_paper":"/paper/2308.13387","citing_paper":"/paper/2605.06213"},"observation_digest":"sha256:391538631a9a282d4a9a1accaacaca8154a1bddeb30d9bbdf11c834c6eb277c6","observation_id":"b4835099-28c6-415c-8219-aaf1e81b83c2","resolution":{"observed_at":"2026-05-11T20:06:13.694609Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.13387","last_updated":"2023-09-04T01:47:30Z","snapshot_observed_at":"2026-07-06T16:10:23.328130Z","submitted_at":"2023-08-25T14:02:12Z","title":"Do-Not-Answer: A Dataset for Evaluating Safeguards in LLMs","version":2},"cited_work":{"arxiv_id":"2308.13387","doi":"10.48550/arxiv.2308.13387","metadata_source":"arxiv_reference","pith_arxiv_id":"2308.13387","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Towards veri- fying the geometric robustness of large-scale neural net- works","venue":"arXiv (Cornell University)","work_id":"7d461849-cc8d-4f7f-bf07-6c5e9ea94914","year":2023},"citing_paper":{"arxiv_id":"2605.10639","last_updated":"2026-05-11T14:27:39Z","snapshot_observed_at":"2026-08-02T13:54:55.570407Z","submitted_at":"2026-05-11T14:27:39Z","title":"Navigating the Sea of LLM Evaluation: Investigating Bias in Toxicity Benchmarks","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-12T05:28:45.453455Z"},"links":{"cited_paper":"/paper/2308.13387","citing_paper":"/paper/2605.10639"},"observation_digest":"sha256:587d283d954527a5c0b854d0bba66c2ed31b6caed82de8b466b7725711aa1645","observation_id":"8189446b-33c3-4263-aab8-515445b7585c","resolution":{"observed_at":"2026-05-12T05:31:23.900065Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.13387","last_updated":"2023-09-04T01:47:30Z","snapshot_observed_at":"2026-07-06T16:10:23.328130Z","submitted_at":"2023-08-25T14:02:12Z","title":"Do-Not-Answer: A Dataset for Evaluating Safeguards in LLMs","version":2},"cited_work":{"arxiv_id":"2308.13387","doi":"10.48550/arxiv.2308.13387","metadata_source":"arxiv_reference","pith_arxiv_id":"2308.13387","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Towards veri- fying the geometric robustness of large-scale neural net- works","venue":"arXiv (Cornell University)","work_id":"7d461849-cc8d-4f7f-bf07-6c5e9ea94914","year":2023},"citing_paper":{"arxiv_id":"2605.20654","last_updated":"2026-06-03T08:00:52Z","snapshot_observed_at":"2026-08-02T18:56:31.274465Z","submitted_at":"2026-05-20T03:16:15Z","title":"REFLECTOR: Internalizing Step-wise Reflection against Indirect Jailbreak","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-21T06:16:01.040236Z"},"links":{"cited_paper":"/paper/2308.13387","citing_paper":"/paper/2605.20654"},"observation_digest":"sha256:ce940fadce2aec8ce9805186a766d59d53d66012481f19d2984b40dc590195a6","observation_id":"1123835b-527d-428a-a568-12d987057cf5","resolution":{"observed_at":"2026-05-21T06:19:42.002339Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.13387","last_updated":"2023-09-04T01:47:30Z","snapshot_observed_at":"2026-07-06T16:10:23.328130Z","submitted_at":"2023-08-25T14:02:12Z","title":"Do-Not-Answer: A Dataset for Evaluating Safeguards in LLMs","version":2},"cited_work":{"arxiv_id":"2308.13387","doi":"10.48550/arxiv.2308.13387","metadata_source":"arxiv_reference","pith_arxiv_id":"2308.13387","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Towards veri- fying the geometric robustness of large-scale neural net- works","venue":"arXiv (Cornell University)","work_id":"7d461849-cc8d-4f7f-bf07-6c5e9ea94914","year":2023},"citing_paper":{"arxiv_id":"2605.24414","last_updated":"2026-05-23T05:57:30Z","snapshot_observed_at":"2026-08-08T12:13:53.897636Z","submitted_at":"2026-05-23T05:57:30Z","title":"JT-SAFE-V2: Safety-by-Design Foundation Model with World-Context Data","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-30T13:45:38.305767Z"},"links":{"cited_paper":"/paper/2308.13387","citing_paper":"/paper/2605.24414"},"observation_digest":"sha256:4caef0cadb77fa008578e4208456e3fd0dbfd33bdbfe5c26ab4ef3e86ae050ad","observation_id":"41351988-a409-43be-b92d-e6ba900d5688","resolution":{"observed_at":"2026-06-30T13:54:44.172152Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.13387","last_updated":"2023-09-04T01:47:30Z","snapshot_observed_at":"2026-07-06T16:10:23.328130Z","submitted_at":"2023-08-25T14:02:12Z","title":"Do-Not-Answer: A Dataset for Evaluating Safeguards in LLMs","version":2},"cited_work":{"arxiv_id":"2308.13387","doi":"10.48550/arxiv.2308.13387","metadata_source":"arxiv_reference","pith_arxiv_id":"2308.13387","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Towards veri- fying the geometric robustness of large-scale neural net- works","venue":"arXiv (Cornell University)","work_id":"7d461849-cc8d-4f7f-bf07-6c5e9ea94914","year":2023},"citing_paper":{"arxiv_id":"2605.24817","last_updated":"2026-05-24T02:06:44Z","snapshot_observed_at":"2026-07-06T23:34:52.129354Z","submitted_at":"2026-05-24T02:06:44Z","title":"RouteScan: A Non-Intrusive Approach to Auditing MoE LLMs Safety via Expert Routing Telemetry","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-30T00:33:35.235214Z"},"links":{"cited_paper":"/paper/2308.13387","citing_paper":"/paper/2605.24817"},"observation_digest":"sha256:742dca2fa00fb8c29df2dc1e0e0c6dafb59d995e3285dd5a8363ad249e389385","observation_id":"db495455-5492-4c3a-8908-647e36b023b8","resolution":{"observed_at":"2026-06-30T00:34:05.321167Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.13387","last_updated":"2023-09-04T01:47:30Z","snapshot_observed_at":"2026-07-06T16:10:23.328130Z","submitted_at":"2023-08-25T14:02:12Z","title":"Do-Not-Answer: A Dataset for Evaluating Safeguards in LLMs","version":2},"cited_work":{"arxiv_id":"2308.13387","doi":"10.48550/arxiv.2308.13387","metadata_source":"arxiv_reference","pith_arxiv_id":"2308.13387","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Towards veri- fying the geometric robustness of large-scale neural net- works","venue":"arXiv (Cornell University)","work_id":"7d461849-cc8d-4f7f-bf07-6c5e9ea94914","year":2023},"citing_paper":{"arxiv_id":"2606.00875","last_updated":"2026-05-30T20:15:01Z","snapshot_observed_at":"2026-08-07T18:59:52.851631Z","submitted_at":"2026-05-30T20:15:01Z","title":"IDEAFix: Evaluation Framework for Creative Defixation Prompting in LLMs","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-06-28T18:42:00.845492Z"},"links":{"cited_paper":"/paper/2308.13387","citing_paper":"/paper/2606.00875"},"observation_digest":"sha256:2edd09755300169930e7a51ccb33041855424c907c4d70c84f5127a218ef0bbf","observation_id":"7bafba10-78c1-43df-945c-79fc7fd30192","resolution":{"observed_at":"2026-06-28T18:42:28.917805Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.13387","last_updated":"2023-09-04T01:47:30Z","snapshot_observed_at":"2026-07-06T16:10:23.328130Z","submitted_at":"2023-08-25T14:02:12Z","title":"Do-Not-Answer: A Dataset for Evaluating Safeguards in LLMs","version":2},"cited_work":{"arxiv_id":"2308.13387","doi":"10.48550/arxiv.2308.13387","metadata_source":"arxiv_reference","pith_arxiv_id":"2308.13387","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Towards veri- fying the geometric robustness of large-scale neural net- works","venue":"arXiv (Cornell University)","work_id":"7d461849-cc8d-4f7f-bf07-6c5e9ea94914","year":2023},"citing_paper":{"arxiv_id":"2606.08044","last_updated":"2026-08-04T12:50:00Z","snapshot_observed_at":"2026-08-07T23:11:38.433528Z","submitted_at":"2026-06-06T08:10:56Z","title":"When Behavioral Safety Evaluation Fails: A Representation-Level Perspective","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-06-27T20:04:17.744876Z"},"links":{"cited_paper":"/paper/2308.13387","citing_paper":"/paper/2606.08044"},"observation_digest":"sha256:a3d24101c0d0adbeac822a86c9609e45d852d383a66eb8aa7fc52691f0567cfa","observation_id":"8a5fb43b-54f1-4e5c-a1d3-f03a2f75e43e","resolution":{"observed_at":"2026-07-02T20:57:23.020717Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.13387","last_updated":"2023-09-04T01:47:30Z","snapshot_observed_at":"2026-07-06T16:10:23.328130Z","submitted_at":"2023-08-25T14:02:12Z","title":"Do-Not-Answer: A Dataset for Evaluating Safeguards in LLMs","version":2},"cited_work":{"arxiv_id":"2308.13387","doi":"10.48550/arxiv.2308.13387","metadata_source":"arxiv_reference","pith_arxiv_id":"2308.13387","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Towards veri- fying the geometric robustness of large-scale neural net- works","venue":"arXiv (Cornell University)","work_id":"7d461849-cc8d-4f7f-bf07-6c5e9ea94914","year":2023},"citing_paper":{"arxiv_id":"2606.19594","last_updated":"2026-06-17T20:56:44Z","snapshot_observed_at":"2026-08-02T12:17:21.328593Z","submitted_at":"2026-06-17T20:56:44Z","title":"Unsupervised Causal Abstractions Discovery","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-06-26T20:45:15.226889Z"},"links":{"cited_paper":"/paper/2308.13387","citing_paper":"/paper/2606.19594"},"observation_digest":"sha256:5a8ded4da1fab557eb4db63dd342cf0635a67dc010604858fe3c28cd3fb2bc18","observation_id":"d8086c03-e6eb-4e6f-8c34-302b925b7b0b","resolution":{"observed_at":"2026-07-04T00:59:21.203220Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.13387","last_updated":"2023-09-04T01:47:30Z","snapshot_observed_at":"2026-07-06T16:10:23.328130Z","submitted_at":"2023-08-25T14:02:12Z","title":"Do-Not-Answer: A Dataset for Evaluating Safeguards in LLMs","version":2},"cited_work":{"arxiv_id":"2308.13387","doi":"10.48550/arxiv.2308.13387","metadata_source":"arxiv_reference","pith_arxiv_id":"2308.13387","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Towards veri- fying the geometric robustness of large-scale neural net- works","venue":"arXiv (Cornell University)","work_id":"7d461849-cc8d-4f7f-bf07-6c5e9ea94914","year":2023},"citing_paper":{"arxiv_id":"2606.19887","last_updated":"2026-06-24T07:42:32Z","snapshot_observed_at":"2026-07-06T23:55:05.932014Z","submitted_at":"2026-06-18T07:46:18Z","title":"FinRED: An Expert-Guided Benchmark Generation and Evaluation Framework for Financial LLM Red-Teaming","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-26T17:11:40.088809Z"},"links":{"cited_paper":"/paper/2308.13387","citing_paper":"/paper/2606.19887"},"observation_digest":"sha256:566b0c7b577561b8d6ab2f3120740f76229379dd06798c1660df4c103a9ce4de","observation_id":"96db16a7-6e3b-479b-81d1-551b69abd473","resolution":{"observed_at":"2026-07-04T04:09:34.773753Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.13387","last_updated":"2023-09-04T01:47:30Z","snapshot_observed_at":"2026-07-06T16:10:23.328130Z","submitted_at":"2023-08-25T14:02:12Z","title":"Do-Not-Answer: A Dataset for Evaluating Safeguards in LLMs","version":2},"cited_work":{"arxiv_id":"2308.13387","doi":"10.48550/arxiv.2308.13387","metadata_source":"arxiv_reference","pith_arxiv_id":"2308.13387","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Towards veri- fying the geometric robustness of large-scale neural net- works","venue":"arXiv (Cornell University)","work_id":"7d461849-cc8d-4f7f-bf07-6c5e9ea94914","year":2023},"citing_paper":{"arxiv_id":"2606.20626","last_updated":"2026-05-26T17:35:31Z","snapshot_observed_at":"2026-08-06T08:20:13.528819Z","submitted_at":"2026-05-26T17:35:31Z","title":"Efficient Safety Benchmarking via Item Response Theory","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-01T15:51:00.484343Z"},"links":{"cited_paper":"/paper/2308.13387","citing_paper":"/paper/2606.20626"},"observation_digest":"sha256:2e7c897ae0377826cb936c77b19ac3d0949845c6ce606b114b4acd63e49976d6","observation_id":"aaa08779-a722-40ec-ae7e-ba503da2235b","resolution":{"observed_at":"2026-07-01T15:55:48.971641Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.13387","last_updated":"2023-09-04T01:47:30Z","snapshot_observed_at":"2026-07-06T16:10:23.328130Z","submitted_at":"2023-08-25T14:02:12Z","title":"Do-Not-Answer: A Dataset for Evaluating Safeguards in LLMs","version":2},"cited_work":{"arxiv_id":"2308.13387","doi":"10.48550/arxiv.2308.13387","metadata_source":"arxiv_reference","pith_arxiv_id":"2308.13387","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Towards veri- fying the geometric robustness of large-scale neural net- works","venue":"arXiv (Cornell University)","work_id":"7d461849-cc8d-4f7f-bf07-6c5e9ea94914","year":2023},"citing_paper":{"arxiv_id":"2606.21296","last_updated":"2026-06-19T10:19:54Z","snapshot_observed_at":"2026-08-02T18:19:53.372016Z","submitted_at":"2026-06-19T10:19:54Z","title":"Discriminatory Compliance: How LLMs Answer Queries from Protected Groups","version":1},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-06-26T12:58:09.227648Z"},"links":{"cited_paper":"/paper/2308.13387","citing_paper":"/paper/2606.21296"},"observation_digest":"sha256:1864d4e88912b77c90e5c81e204abbe726944a5d570f0623aa6f63c4862ae66a","observation_id":"e7a258d6-01cd-4f4c-b84e-22a31e3655f6","resolution":{"observed_at":"2026-06-26T12:59:29.165546Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.13387","last_updated":"2023-09-04T01:47:30Z","snapshot_observed_at":"2026-07-06T16:10:23.328130Z","submitted_at":"2023-08-25T14:02:12Z","title":"Do-Not-Answer: A Dataset for Evaluating Safeguards in LLMs","version":2},"cited_work":{"arxiv_id":"2308.13387","doi":"10.48550/arxiv.2308.13387","metadata_source":"arxiv_reference","pith_arxiv_id":"2308.13387","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Towards veri- fying the geometric robustness of large-scale neural net- works","venue":"arXiv (Cornell University)","work_id":"7d461849-cc8d-4f7f-bf07-6c5e9ea94914","year":2023},"citing_paper":{"arxiv_id":"2606.25782","last_updated":"2026-06-24T13:00:25Z","snapshot_observed_at":"2026-08-02T05:56:42.277319Z","submitted_at":"2026-06-24T13:00:25Z","title":"Do Encoders Suffice? A Systematic Comparison of Encoder and Decoder Safety Judges for LLM Adversarial Evaluation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-25T20:55:44.549142Z"},"links":{"cited_paper":"/paper/2308.13387","citing_paper":"/paper/2606.25782"},"observation_digest":"sha256:7486bb79921bce7976552ae5ec02ce6e32f9e497f0a252044f59091565e0b8d2","observation_id":"ea5bf22f-5b06-4ed8-9db0-30d635e15b83","resolution":{"observed_at":"2026-07-04T20:00:07.965831Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.13387","last_updated":"2023-09-04T01:47:30Z","snapshot_observed_at":"2026-07-06T16:10:23.328130Z","submitted_at":"2023-08-25T14:02:12Z","title":"Do-Not-Answer: A Dataset for Evaluating Safeguards in LLMs","version":2},"cited_work":{"arxiv_id":"2308.13387","doi":"10.48550/arxiv.2308.13387","metadata_source":"arxiv_reference","pith_arxiv_id":"2308.13387","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Towards veri- fying the geometric robustness of large-scale neural net- works","venue":"arXiv (Cornell University)","work_id":"7d461849-cc8d-4f7f-bf07-6c5e9ea94914","year":2023},"citing_paper":{"arxiv_id":"2606.29171","last_updated":"2026-06-28T03:32:06Z","snapshot_observed_at":"2026-07-07T00:03:12.330608Z","submitted_at":"2026-06-28T03:32:06Z","title":"Symbolic Mechanistic Data Attribution: Tracing Training Influence to Learned Behavioral Policies","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-06-30T08:03:23.581020Z"},"links":{"cited_paper":"/paper/2308.13387","citing_paper":"/paper/2606.29171"},"observation_digest":"sha256:723fc345504994f29b2e3d39a81701ff0325d4653cdf8cd0c4dadc580bd22ebe","observation_id":"6f8ddaa2-f460-4ba9-9473-dbf00df5c8e5","resolution":{"observed_at":"2026-06-30T08:04:27.971832Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.13387","last_updated":"2023-09-04T01:47:30Z","snapshot_observed_at":"2026-07-06T16:10:23.328130Z","submitted_at":"2023-08-25T14:02:12Z","title":"Do-Not-Answer: A Dataset for Evaluating Safeguards in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.13387","snapshot_observed_at":"2026-08-02T02:00:44.726066Z","title":"Do-Not-Answer: A Dataset for Evaluating Safeguards in LLMs, August 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14479","last_updated":"2026-07-16T01:52:54Z","snapshot_observed_at":"2026-08-08T11:55:59.889010Z","submitted_at":"2026-07-16T01:52:54Z","title":"BioTIER: A Refusal Benchmark for Targeted Biological Risk Mitigation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T02:00:44.726066Z"},"links":{"cited_paper":"/paper/2308.13387","citing_paper":"/paper/2607.14479"},"observation_digest":"sha256:5cc298a489b4336554819b8e30810caa774a1ee7bdc480b71398b2ca8d03f9bc","observation_id":"166868af-f1aa-4a2d-bc06-e82283a56383","resolution":{"observed_at":"2026-08-02T02:00:44.726066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.13387","last_updated":"2023-09-04T01:47:30Z","snapshot_observed_at":"2026-07-06T16:10:23.328130Z","submitted_at":"2023-08-25T14:02:12Z","title":"Do-Not-Answer: A Dataset for Evaluating Safeguards in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.13387","snapshot_observed_at":"2026-08-02T10:20:56.053655Z","title":"arXiv preprint arXiv:2308.13387 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22643","last_updated":"2026-06-24T02:40:49Z","snapshot_observed_at":"2026-08-08T03:20:50.943223Z","submitted_at":"2026-06-24T02:40:49Z","title":"Reason Before You Retrieve: Agentic Planning for Multi-modal RAG","version":1},"reference_index":106,"source":"arxiv_source","source_observed_at":"2026-08-02T10:20:56.053655Z"},"links":{"cited_paper":"/paper/2308.13387","citing_paper":"/paper/2607.22643"},"observation_digest":"sha256:ced1e7d71527dd20456b5a4f0677d7e7391c67f4aa1b6a5815bff80e775902d8","observation_id":"fc180841-96ec-4227-8e0e-e3a769d177a1","resolution":{"observed_at":"2026-08-02T10:20:56.053655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.13387","last_updated":"2023-09-04T01:47:30Z","snapshot_observed_at":"2026-07-06T16:10:23.328130Z","submitted_at":"2023-08-25T14:02:12Z","title":"Do-Not-Answer: A Dataset for Evaluating Safeguards in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.13387","snapshot_observed_at":"2026-07-30T20:22:15.974831Z","title":"arXiv preprint arXiv:2308.13387","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24859","last_updated":"2026-07-26T07:46:28Z","snapshot_observed_at":"2026-08-09T20:46:17.449338Z","submitted_at":"2026-07-26T07:46:28Z","title":"The Mirage of LLM Guardrails: A Case Study in AI-Assisted Medical Note Manipulation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-30T20:22:15.974831Z"},"links":{"cited_paper":"/paper/2308.13387","citing_paper":"/paper/2607.24859"},"observation_digest":"sha256:a83c729547baeb307e8ed9e3b04d223b9b5d8be8d22f15468f23dd65ad326b89","observation_id":"f60688c9-3ec5-4555-84be-6cf231031183","resolution":{"observed_at":"2026-07-30T20:22:15.974831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.13387","last_updated":"2023-09-04T01:47:30Z","snapshot_observed_at":"2026-07-06T16:10:23.328130Z","submitted_at":"2023-08-25T14:02:12Z","title":"Do-Not-Answer: A Dataset for Evaluating Safeguards in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.13387","snapshot_observed_at":"2026-07-30T20:11:00.919374Z","title":"arXiv preprint arXiv:2308.13387 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26820","last_updated":"2026-07-29T12:14:23Z","snapshot_observed_at":"2026-08-07T10:24:58.276069Z","submitted_at":"2026-07-29T12:14:23Z","title":"Forecasting Trajectory-Level Safety Risks in Black-Box Multi-Turn Interactions","version":1},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-07-30T20:11:00.919374Z"},"links":{"cited_paper":"/paper/2308.13387","citing_paper":"/paper/2607.26820"},"observation_digest":"sha256:bd9c2de294b55880a01b12676a57dab3711c519c65dfc0befbbbfc5131111e6f","observation_id":"ebea8a40-8b99-4396-8cd8-b56c0929cae9","resolution":{"observed_at":"2026-07-30T20:11:00.919374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.13387","last_updated":"2023-09-04T01:47:30Z","snapshot_observed_at":"2026-07-06T16:10:23.328130Z","submitted_at":"2023-08-25T14:02:12Z","title":"Do-Not-Answer: A Dataset for Evaluating Safeguards in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.13387","snapshot_observed_at":"2026-08-03T00:55:21.768924Z","title":"arXiv preprint arXiv:2308.13387 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28636","last_updated":"2026-05-19T13:56:13Z","snapshot_observed_at":"2026-08-06T00:38:04.006327Z","submitted_at":"2026-05-19T13:56:13Z","title":"Chain-of-Models: Cross-Model Auditing for Bias-Robust LLM Judges","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-03T00:55:21.768924Z"},"links":{"cited_paper":"/paper/2308.13387","citing_paper":"/paper/2607.28636"},"observation_digest":"sha256:7dd575db29e0ef3050ea0394f8db9a52a4dbc29d91d09dae832715e1912ab832","observation_id":"67e98565-810a-4f74-8e17-bd34845b0412","resolution":{"observed_at":"2026-08-03T00:55:21.768924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.13387","last_updated":"2023-09-04T01:47:30Z","snapshot_observed_at":"2026-07-06T16:10:23.328130Z","submitted_at":"2023-08-25T14:02:12Z","title":"Do-Not-Answer: A Dataset for Evaluating Safeguards in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.13387","snapshot_observed_at":"2026-08-06T05:39:49.518229Z","title":"arXiv:2308.13387","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05086","last_updated":"2026-08-05T17:25:27Z","snapshot_observed_at":"2026-08-09T05:03:12.658355Z","submitted_at":"2026-08-05T17:25:27Z","title":"Item Response Theory for AI Safety","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T05:39:49.518229Z"},"links":{"cited_paper":"/paper/2308.13387","citing_paper":"/paper/2608.05086"},"observation_digest":"sha256:3fe22451c456b3766c3af33c36356aabe4d2dc943d8239fbbe4eb14c220a2c9b","observation_id":"52acaad3-523c-437f-b54c-ec44f120bc2a","resolution":{"observed_at":"2026-08-06T05:39:49.518229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2308.13387/citation-record","integrity":"/paper/2308.13387/integrity","json":"/paper/2308.13387/citation-record.json","paper":"/paper/2308.13387"},"outbound":[],"paper":{"arxiv_id":"2308.13387","last_updated":"2023-09-04T01:47:30Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T16:10:23.328130Z","submitted_at":"2023-08-25T14:02:12Z","title":"Do-Not-Answer: A Dataset for Evaluating Safeguards in LLMs"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 39 inbound Pith citation observations for arXiv:2308.13387."}