Pith. sign in

Paper Citation Record · LEDGER

On Prompt-Driven Safeguarding for Large Language Models

As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 21 inbound Pith citation observations for arXiv:2401.18018.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2401.18018 v4

Coverage vector

measured 0 of 0 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links

measured 21 of 21 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-09T06:31:02.800959+00:00

measured 21 of 21 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-08T11:01:28.960192Z

measured 1 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-08-05T02:28:24.338817Z

Reference resolution

0 of 0 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved0
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

5
arxiv_reference, observed 2026-08-05T02:28:24.338817Z

Outbound references

No outbound reference observations are available for this paper version.

Pith citing papers

Observation 0de766c3-c60f-451e-94c9-6ae8a1726782 · inbound

Refusal in Language Models Is Mediated by a Single Direction cites this paper.

Refusal in Language Models Is Mediated by a Single Direction On Prompt-Driven Safeguarding for Large Language Models

Reference 206

Resolution
metadata mismatch
arxiv_id, observed 2026-05-13T10:47:56.174132Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=arxiv_source observed=2026-05-13T10:47:55.934081Z digest=sha256:756b6eb7957d4e7c750dd023ad49a0b312bd877ca96f3b42891e4553ceeb2148

Observation 377af2ab-81c0-42a1-a840-06d03b8365ca · inbound

Jailbreak Attacks and Defenses Against Large Language Models: A Survey cites this paper.

Jailbreak Attacks and Defenses Against Large Language Models: A Survey On Prompt-Driven Safeguarding for Large Language Models

Reference 118

Resolution
metadata mismatch
arxiv_id, observed 2026-05-15T02:20:44.509404Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-05-15T02:20:44.368219Z digest=sha256:477572d9783bf71fd848bec551345f3646a568dbd536228c009b8993124083eb

Observation 0e74ee48-9eb7-4872-8849-0398cf4b24bf · inbound

On Mechanistic Circuits for Extractive Question-Answering cites this paper.

On Mechanistic Circuits for Extractive Question-Answering On Prompt-Driven Safeguarding for Large Language Models

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-08T11:01:28.960192Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T11:01:28.960192Z digest=sha256:762fbe6d5e24e25a2cd60c2a774ba4f51016f1518643718bab972ccea7a21ff2

Observation 77e6bcea-72a4-4f40-aedc-3c1047fb9f50 · inbound

COSMIC: Generalized Refusal Direction Identification in LLM Activations cites this paper.

COSMIC: Generalized Refusal Direction Identification in LLM Activations On Prompt-Driven Safeguarding for Large Language Models

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-07T12:35:39.020367Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:35:39.020367Z digest=sha256:0445902f11fac8665451ee0face0e6eb576a261903b955bb4ae8d983e413d557

Observation da8b92c4-2591-4935-b4ff-28cb1244cdb6 · inbound

ReGA: Model-Based Safeguard for LLMs via Representation-Guided Abstraction cites this paper.

ReGA: Model-Based Safeguard for LLMs via Representation-Guided Abstraction On Prompt-Driven Safeguarding for Large Language Models

Reference 35

Resolution
metadata mismatch
arxiv_id, observed 2026-05-19T11:37:16.008776Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-05-19T11:34:09.428653Z digest=sha256:c98d07d557327a1dc3ad9be49ef7905d5eaa678ae15ba2ce9ea680b8dceaa2c9

Observation 36cde0a9-52cb-47df-8885-9a0c480d83cd · inbound

Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning cites this paper.

Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning On Prompt-Driven Safeguarding for Large Language Models

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-06T19:57:44.717885Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T19:57:44.717885Z digest=sha256:ddb900b14d46702b5d2af63ac14bcc3c0a057ce38f92c867fc26dab43273b42b

Observation c46fd5ac-48fa-416e-9127-e34bc783e919 · inbound

Defending Against Prompt Injection With a Few DefensiveTokens cites this paper.

Defending Against Prompt Injection With a Few DefensiveTokens On Prompt-Driven Safeguarding for Large Language Models

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-06T18:32:44.096157Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:32:44.096157Z digest=sha256:7feca284d86c515f63b693bd74decea4914e93291b4989a48c70e826c7f1efe8

Observation 408b7a6e-c13e-4e9d-85a8-fd40974b14f4 · inbound

Beyond Surface-Level Detection: Towards Cognitive-Driven Defense Against Jailbreak Attacks via Meta-Operations Reasoning cites this paper.

Beyond Surface-Level Detection: Towards Cognitive-Driven Defense Against Jailbreak Attacks via Meta-Operations Reasoning On Prompt-Driven Safeguarding for Large Language Models

Reference 197

Resolution
unresolved
no resolver link, observed 2026-08-06T04:47:25.678524Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T04:47:25.678524Z digest=sha256:491b92959ab3bf683dcf13d99f38828184b7df9889988d330e69a338c3f45740

Observation c96e3b12-54fb-4287-967a-e210244f832d · inbound

Turning the Spell Around: Lightweight Alignment Amplification via Rank-One Safety Injection cites this paper.

Turning the Spell Around: Lightweight Alignment Amplification via Rank-One Safety Injection On Prompt-Driven Safeguarding for Large Language Models

Reference 60

Resolution
unresolved
no resolver link, observed 2026-08-05T14:57:12.969212Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T14:57:12.969212Z digest=sha256:537cf98c1db91be7c5ba269cbc6733764afde54bd2ee646c680507e4cf8d49cc

Observation af93b3cf-a963-466e-813d-761b4e2907a2 · inbound

Probing the Difficulty Perception Mechanism of Large Language Models cites this paper.

Probing the Difficulty Perception Mechanism of Large Language Models On Prompt-Driven Safeguarding for Large Language Models

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-04T11:17:49.954144Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T11:17:49.954144Z digest=sha256:636b4a645a92a36a03ff0c7707b26fe97c3466391bb8f3445bd96f7a96f5bf92

Observation 9629203d-6a04-42d9-ba97-2cbeaf89f271 · inbound

Echoes of Human Malice in Agents: Benchmarking LLMs for Multi-Turn Online Harassment Attacks cites this paper.

Echoes of Human Malice in Agents: Benchmarking LLMs for Multi-Turn Online Harassment Attacks On Prompt-Driven Safeguarding for Large Language Models

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-04T09:40:47.454032Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T09:40:47.454032Z digest=sha256:3acc9c87e276dd242971cecd3bb3e380aa49b726ce902f0654f416849485ea75

Observation b4569ed4-f15f-4ffc-8149-6e402c9d083f · inbound

SoK: Systematizing LLM Prompt Security: Taxonomies, Datasets, and Unified Evaluation of Attacks and Defenses cites this paper.

SoK: Systematizing LLM Prompt Security: Taxonomies, Datasets, and Unified Evaluation of Attacks and Defenses On Prompt-Driven Safeguarding for Large Language Models

Reference 245

Resolution
unresolved
no resolver link, observed 2026-08-04T09:25:58.615053Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T09:25:58.615053Z digest=sha256:d76c6f0314753b12ac1e0fc75ee89a9bc82e30b4f2bbe1ecc68e6e68b1f60b0d

Observation afa072e4-9ff1-4b24-850d-2432afd9bbf9 · inbound

RACC: Representation-Aware Coverage Criteria for LLM Safety Testing cites this paper.

RACC: Representation-Aware Coverage Criteria for LLM Safety Testing On Prompt-Driven Safeguarding for Large Language Models

Reference 67

Resolution
metadata mismatch
arxiv_id, observed 2026-05-16T08:17:36.688250Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-05-16T08:12:55.296932Z digest=sha256:ade79e86d31e07e404a2fcfb1353e7e835424ed0d77f351b589b3dc6d4d83370

Observation 9d5160d1-3eed-4b90-a28b-f1a98939264c · inbound

f-GRPO and Beyond: Divergence-Based Reinforcement Learning Algorithms for General LLM Alignment cites this paper.

f-GRPO and Beyond: Divergence-Based Reinforcement Learning Algorithms for General LLM Alignment On Prompt-Driven Safeguarding for Large Language Models

Reference 17

Resolution
metadata mismatch
arxiv_id, observed 2026-05-16T06:50:42.968338Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-05-16T06:48:35.723474Z digest=sha256:616e284f0690ef95dbc1fd364f6337c43bae44492b161f4f21882a51660d7548

Observation a8bc067e-a858-481a-a400-4b0f18743e42 · inbound

Dictionary-Aligned Concept Control for Safeguarding Multimodal LLMs cites this paper.

Dictionary-Aligned Concept Control for Safeguarding Multimodal LLMs On Prompt-Driven Safeguarding for Large Language Models

Reference 131

Resolution
metadata mismatch
arxiv_id, observed 2026-05-11T05:35:57.513789Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-05-10T18:04:05.157103Z digest=sha256:95682667c9b7c75e6020f3a9b8cd37c384351887452a5addf9204052c9ac5ec1

Observation c8a09e59-74ee-4937-83ad-b7ada4e165b4 · inbound

A Single Neuron Is Sufficient to Bypass Safety Alignment in Large Language Models cites this paper.

A Single Neuron Is Sufficient to Bypass Safety Alignment in Large Language Models On Prompt-Driven Safeguarding for Large Language Models

Reference 17

Resolution
metadata mismatch
arxiv_id, observed 2026-05-12T01:46:14.370017Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=arxiv_source observed=2026-05-12T01:41:44.898358Z digest=sha256:9bce5f85337537a4059f14d0b58f4db0b561404f318cc17a071c2e54afe6674a

Observation 155d4921-eef9-4a92-9c50-46cb5fab9cf2 · inbound

CLAP: Contrastive Latent-space Prompt Optimization for End-to-end Autonomous Driving cites this paper.

CLAP: Contrastive Latent-space Prompt Optimization for End-to-end Autonomous Driving On Prompt-Driven Safeguarding for Large Language Models

Reference 48

Resolution
verified exact
arxiv_id, observed 2026-05-20T14:58:24.670438Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-05-20T14:58:03.757712Z digest=sha256:49eafa73617d8a60689c3616e878a26dede93aacdc8da1bdd1bc8c55f20191ff

Observation a30150e8-b607-4b84-bdb7-75acaad5a53b · inbound

Safety Geometry Collapse in Multimodal LLMs and Adaptive Drift Correction cites this paper.

Safety Geometry Collapse in Multimodal LLMs and Adaptive Drift Correction On Prompt-Driven Safeguarding for Large Language Models

Reference 59

Resolution
metadata mismatch
arxiv_id, observed 2026-05-20T10:58:13.540944Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=arxiv_source observed=2026-05-20T10:57:40.997128Z digest=sha256:9f88a96e0721bcbfa894769fb637f3fbd963959c3c17eca6649a1f6824ab8451

Observation 16e62ae5-3a5f-4a29-94b2-79b8b61791a7 · inbound

Do Activation Monitors Survive Model Updates? Benchmarking, Predicting, and Repairing Activation-Monitor Staleness cites this paper.

Do Activation Monitors Survive Model Updates? Benchmarking, Predicting, and Repairing Activation-Monitor Staleness On Prompt-Driven Safeguarding for Large Language Models

Reference 40

Resolution
verified exact
arxiv_id, observed 2026-06-27T03:30:26.970938Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=arxiv_source observed=2026-06-27T03:24:24.714121Z digest=sha256:6298a741366f4d66d2d0bd8bf6b2bf0d7900eda36eee32f7a7e7d6bac50962ce

Observation e2fbc2da-a71e-4a66-933c-d61fc06f346f · inbound

Visual Token Compression Enhances Robustness of MLLMs cites this paper.

Visual Token Compression Enhances Robustness of MLLMs On Prompt-Driven Safeguarding for Large Language Models

Reference 92

Resolution
unresolved
no resolver link, observed 2026-08-01T13:10:37.718031Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T13:10:37.718031Z digest=sha256:fe02ddd7881bba4e668332a72370d970ea0f887b80dd47209062e2cd7290a970

Observation 7b1d80d9-b084-414a-9a8f-51ecc7ee23d1 · inbound

Efficient LLM Adversarial Training via Low-Rank Defense and Circuit-Guided Surrogates cites this paper.

Efficient LLM Adversarial Training via Low-Rank Defense and Circuit-Guided Surrogates On Prompt-Driven Safeguarding for Large Language Models

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-03T16:32:06.278220Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T16:32:06.278220Z digest=sha256:66a753136e67fcb4a49195ed38466947c5dad9823a1faa3655432674e9f18f02