{"as_of":"2026-08-23T13:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:64112f6426f7f0c272c70711a5c0f13b3303701c425ea2d1b8a2c8aabfa04e20","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":11,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":11,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":11,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":11,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T12:10:30.898210Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-08T13:54:58.586248Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2409.00598","last_updated":"2025-06-11T03:14:28Z","snapshot_observed_at":"2026-08-19T19:23:21.576241Z","submitted_at":"2024-09-01T03:25:59Z","title":"Automatic Pseudo-Harmful Prompt Generation for Evaluating False Refusals in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00598","snapshot_observed_at":"2026-08-10T14:51:58.694027Z","title":"Automatic pseudo-harmful prompt generation for evaluating false refusals in large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.14940","last_updated":"2026-06-28T22:17:10Z","snapshot_observed_at":"2026-08-19T21:20:11.268001Z","submitted_at":"2025-01-24T21:55:14Z","title":"CASE-Bench: Context-Aware SafEty Benchmark for Large Language Models","version":4},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-10T14:51:58.694027Z"},"links":{"cited_paper":"/paper/2409.00598","citing_paper":"/paper/2501.14940"},"observation_digest":"sha256:1dc7e703c9af6912ea31b656cade41048d3264df8bfa8d18f3d9701987dc5142","observation_id":"cfb22ddd-294c-4bd9-a6ea-c1a035716acd","resolution":{"observed_at":"2026-08-10T14:51:58.694027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00598","last_updated":"2025-06-11T03:14:28Z","snapshot_observed_at":"2026-08-19T19:23:21.576241Z","submitted_at":"2024-09-01T03:25:59Z","title":"Automatic Pseudo-Harmful Prompt Generation for Evaluating False Refusals in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00598","snapshot_observed_at":"2026-08-08T19:21:19.146827Z","title":"A., Xu, Y., & Huang, F","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06867","last_updated":"2025-02-08T04:27:33Z","snapshot_observed_at":"2026-08-15T16:52:47.335780Z","submitted_at":"2025-02-08T04:27:33Z","title":"Forbidden Science: Dual-Use AI Challenge Benchmark and Scientific Refusal Tests","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T19:21:19.146827Z"},"links":{"cited_paper":"/paper/2409.00598","citing_paper":"/paper/2502.06867"},"observation_digest":"sha256:ec443547b611c82e16a76c309d98d4a28db88f9e0f807190ddc763a1c05ed95a","observation_id":"0503e350-69ab-4040-9474-d413bfc24ec8","resolution":{"observed_at":"2026-08-08T19:21:19.146827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00598","last_updated":"2025-06-11T03:14:28Z","snapshot_observed_at":"2026-08-19T19:23:21.576241Z","submitted_at":"2024-09-01T03:25:59Z","title":"Automatic Pseudo-Harmful Prompt Generation for Evaluating False Refusals in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00598","snapshot_observed_at":"2026-08-16T12:10:30.898210Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13562","last_updated":"2025-04-18T09:02:12Z","snapshot_observed_at":"2026-08-20T14:24:36.279935Z","submitted_at":"2025-04-18T09:02:12Z","title":"DETAM: Defending LLMs Against Jailbreak Attacks via Targeted Attention Modification","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-16T12:10:30.898210Z"},"links":{"cited_paper":"/paper/2409.00598","citing_paper":"/paper/2504.13562"},"observation_digest":"sha256:f53c70457901acf37fc23e4d752a880ceeabf2ecc68b9096a2170766a84fb492","observation_id":"62ae4d59-dd8c-457d-8afb-1fa5b705cfbc","resolution":{"observed_at":"2026-08-16T12:10:30.898210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00598","last_updated":"2025-06-11T03:14:28Z","snapshot_observed_at":"2026-08-19T19:23:21.576241Z","submitted_at":"2024-09-01T03:25:59Z","title":"Automatic Pseudo-Harmful Prompt Generation for Evaluating False Refusals in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00598","snapshot_observed_at":"2026-08-07T10:17:26.686789Z","title":"Automatic pseudo-harmful prompt generation for evaluating false refusals in large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-13T12:53:10.459412Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.686789Z"},"links":{"cited_paper":"/paper/2409.00598","citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:29f7f2691c0987c9ccb833f692638d09123d53720d0d655e88c634da7f13a3f4","observation_id":"4bf1d9f4-6e4d-43e9-ae6a-df2c055a56fc","resolution":{"observed_at":"2026-08-07T10:17:26.686789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00598","last_updated":"2025-06-11T03:14:28Z","snapshot_observed_at":"2026-08-19T19:23:21.576241Z","submitted_at":"2024-09-01T03:25:59Z","title":"Automatic Pseudo-Harmful Prompt Generation for Evaluating False Refusals in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00598","snapshot_observed_at":"2026-08-06T19:57:43.379859Z","title":"Automatic pseudo-harmful prompt generation for evaluating false refusals in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04250","last_updated":"2025-07-06T05:47:04Z","snapshot_observed_at":"2026-08-13T03:26:28.377277Z","submitted_at":"2025-07-06T05:47:04Z","title":"Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T19:57:43.379859Z"},"links":{"cited_paper":"/paper/2409.00598","citing_paper":"/paper/2507.04250"},"observation_digest":"sha256:bd130270845318fdc9379ffaa8b58bd91e46fc8e6de68479472e9a79597f48f6","observation_id":"8d3d4fb5-83c3-42de-a7a6-611ceb89fe6f","resolution":{"observed_at":"2026-08-06T19:57:43.379859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00598","last_updated":"2025-06-11T03:14:28Z","snapshot_observed_at":"2026-08-19T19:23:21.576241Z","submitted_at":"2024-09-01T03:25:59Z","title":"Automatic Pseudo-Harmful Prompt Generation for Evaluating False Refusals in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00598","snapshot_observed_at":"2026-08-05T22:24:23.458700Z","title":"Automatic pseudo-harmful prompt generation for evaluating false refusals in large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.07139","last_updated":"2025-08-10T01:59:07Z","snapshot_observed_at":"2026-08-10T21:58:51.152330Z","submitted_at":"2025-08-10T01:59:07Z","title":"A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T22:24:23.458700Z"},"links":{"cited_paper":"/paper/2409.00598","citing_paper":"/paper/2508.07139"},"observation_digest":"sha256:0497741cfbc3a59ee444d291410dd3d00fad44ef9666ff1af3016a89ba16fe0b","observation_id":"7acea42f-75e7-47b0-adfb-176c818a5870","resolution":{"observed_at":"2026-08-05T22:24:23.458700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00598","last_updated":"2025-06-11T03:14:28Z","snapshot_observed_at":"2026-08-19T19:23:21.576241Z","submitted_at":"2024-09-01T03:25:59Z","title":"Automatic Pseudo-Harmful Prompt Generation for Evaluating False Refusals in Large Language Models","version":2},"cited_work":{"arxiv_id":"2409.00598","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.00598","snapshot_observed_at":"2026-07-08T13:54:58.586248Z","title":"Automatic Pseudo-Harmful Prompt Generation for Evaluating False Refusals in Large Language Models","venue":"cs.CL","work_id":"c4b1c1f5-62a8-4ce0-91fc-48f2fae5f5aa","year":2024},"citing_paper":{"arxiv_id":"2606.21147","last_updated":"2026-06-19T06:37:32Z","snapshot_observed_at":"2026-08-20T22:25:44.248084Z","submitted_at":"2026-06-19T06:37:32Z","title":"AOR-Bench: Do Large Audio Language Models Over-Refuse Pseudo-Harmful Queries?","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-06-26T13:22:12.541923Z"},"links":{"cited_paper":"/paper/2409.00598","citing_paper":"/paper/2606.21147"},"observation_digest":"sha256:0aa64e4882cb5ae074c9fdaf44f15e3aa747742ee38ea8ed6b952e0a430baed5","observation_id":"98445783-ce10-4e6f-b0f2-4bd1377432d8","resolution":{"observed_at":"2026-07-04T07:29:39.426113Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00598","last_updated":"2025-06-11T03:14:28Z","snapshot_observed_at":"2026-08-19T19:23:21.576241Z","submitted_at":"2024-09-01T03:25:59Z","title":"Automatic Pseudo-Harmful Prompt Generation for Evaluating False Refusals in Large Language Models","version":2},"cited_work":{"arxiv_id":"2409.00598","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.00598","snapshot_observed_at":"2026-07-08T13:54:58.586248Z","title":"Automatic Pseudo-Harmful Prompt Generation for Evaluating False Refusals in Large Language Models","venue":"cs.CL","work_id":"c4b1c1f5-62a8-4ce0-91fc-48f2fae5f5aa","year":2024},"citing_paper":{"arxiv_id":"2607.06196","last_updated":"2026-07-07T12:21:52Z","snapshot_observed_at":"2026-08-14T22:21:31.721458Z","submitted_at":"2026-07-07T12:21:52Z","title":"Pluralis v0.1: Towards a Multicultural, Multimodal, Multilingual Benchmark for AI Risk and Reliability","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-07-08T13:50:54.083165Z"},"links":{"cited_paper":"/paper/2409.00598","citing_paper":"/paper/2607.06196"},"observation_digest":"sha256:0a76d093a0464b3f703d8a4f0aec34d19b361346aaa77e200d27b271d11cfa68","observation_id":"32161650-bd79-4f33-8b03-e244e9084edf","resolution":{"observed_at":"2026-07-08T13:54:58.587659Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00598","last_updated":"2025-06-11T03:14:28Z","snapshot_observed_at":"2026-08-19T19:23:21.576241Z","submitted_at":"2024-09-01T03:25:59Z","title":"Automatic Pseudo-Harmful Prompt Generation for Evaluating False Refusals in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00598","snapshot_observed_at":"2026-08-02T07:09:29.730590Z","title":"Anthropic","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13075","last_updated":"2026-07-12T20:37:19Z","snapshot_observed_at":"2026-08-17T19:58:42.196049Z","submitted_at":"2026-07-12T20:37:19Z","title":"The Entanglement Wall: Activation-Space Probes as Risk Detectors, Not Context Adjudicators","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-02T07:09:29.730590Z"},"links":{"cited_paper":"/paper/2409.00598","citing_paper":"/paper/2607.13075"},"observation_digest":"sha256:b9ae32c54de6efa5be03e0ce360a1472f15de4931d4c9633c2cf282ee0a6d15d","observation_id":"e7c07c8b-79d4-47b2-bad5-26de0370aa68","resolution":{"observed_at":"2026-08-02T07:09:29.730590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00598","last_updated":"2025-06-11T03:14:28Z","snapshot_observed_at":"2026-08-19T19:23:21.576241Z","submitted_at":"2024-09-01T03:25:59Z","title":"Automatic Pseudo-Harmful Prompt Generation for Evaluating False Refusals in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00598","snapshot_observed_at":"2026-08-05T00:48:47.691899Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02665","last_updated":"2026-08-01T22:28:31Z","snapshot_observed_at":"2026-08-14T18:08:52.787563Z","submitted_at":"2026-08-01T22:28:31Z","title":"Single Canonical Prompts Underestimate LLM Safety's Surface-Form Sensitivity","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-05T00:48:47.691899Z"},"links":{"cited_paper":"/paper/2409.00598","citing_paper":"/paper/2608.02665"},"observation_digest":"sha256:2613b7266cfeef7ebfb9d85a546b62dc7287996a36d986cb7a862dc49443525f","observation_id":"73d5e304-eaf1-4e55-adbf-64fc2f51e490","resolution":{"observed_at":"2026-08-05T00:48:47.691899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00598","last_updated":"2025-06-11T03:14:28Z","snapshot_observed_at":"2026-08-19T19:23:21.576241Z","submitted_at":"2024-09-01T03:25:59Z","title":"Automatic Pseudo-Harmful Prompt Generation for Evaluating False Refusals in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00598","snapshot_observed_at":"2026-08-14T14:12:28.323410Z","title":"arXiv preprint arXiv:2409.00598 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.13304","last_updated":"2026-08-13T14:33:15Z","snapshot_observed_at":"2026-08-21T12:05:49.901751Z","submitted_at":"2026-08-13T14:33:15Z","title":"Refusing Intent, Not Form: Wrapper-Based Intent-Group Supervision for LLM Safety","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-14T14:12:28.323410Z"},"links":{"cited_paper":"/paper/2409.00598","citing_paper":"/paper/2608.13304"},"observation_digest":"sha256:9bb547912ab38a01fb9ca0b4041cde60523e7015fa0e473ca7b80694b111b231","observation_id":"9b8a67bf-7cd3-45e2-bfe7-67bd7f040adc","resolution":{"observed_at":"2026-08-14T14:12:28.323410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2409.00598/citation-record","integrity":"/paper/2409.00598/integrity","json":"/paper/2409.00598/citation-record.json","paper":"/paper/2409.00598"},"outbound":[],"paper":{"arxiv_id":"2409.00598","last_updated":"2025-06-11T03:14:28Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-19T19:23:21.576241Z","submitted_at":"2024-09-01T03:25:59Z","title":"Automatic Pseudo-Harmful Prompt Generation for Evaluating False Refusals in Large Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 11 inbound Pith citation observations for arXiv:2409.00598."}