Pith. sign in

Paper Citation Record · LEDGER

On Prompt-Driven Safeguarding for Large Language Models

As of 7 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 20 inbound Pith citation observations for arXiv:2401.18018.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2401.18018 v4

Coverage vector

measured 0 of 0 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links

measured 20 of 20 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-07T06:34:17.273281+00:00

measured 20 of 20 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-07T12:35:39.020367Z

measured 1 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-08-05T02:28:24.338817Z

Reference resolution

0 of 0 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved0
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

5
arxiv_reference, observed 2026-08-05T02:28:24.338817Z

Outbound references

No outbound reference observations are available for this paper version.

Pith citing papers

Observation 0de766c3-c60f-451e-94c9-6ae8a1726782 · inbound

Refusal in Language Models Is Mediated by a Single Direction cites this paper.

Refusal in Language Models Is Mediated by a Single Direction On Prompt-Driven Safeguarding for Large Language Models

Reference 206

Resolution
metadata mismatch
arxiv_id, observed 2026-05-13T10:47:56.174132Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-05-13T10:47:55.934081Z digest=sha256:70c0c8c9c7c82146eedd4bb8d28c7218d81873a505c10b6535045bdc7f452e57

Observation 377af2ab-81c0-42a1-a840-06d03b8365ca · inbound

Jailbreak Attacks and Defenses Against Large Language Models: A Survey cites this paper.

Jailbreak Attacks and Defenses Against Large Language Models: A Survey On Prompt-Driven Safeguarding for Large Language Models

Reference 118

Resolution
metadata mismatch
arxiv_id, observed 2026-05-15T02:20:44.509404Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-15T02:20:44.368219Z digest=sha256:e94c09d94367ff56053e982837829386c005051086568f29e76c225e5327238e

Observation 77e6bcea-72a4-4f40-aedc-3c1047fb9f50 · inbound

COSMIC: Generalized Refusal Direction Identification in LLM Activations cites this paper.

COSMIC: Generalized Refusal Direction Identification in LLM Activations On Prompt-Driven Safeguarding for Large Language Models

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-07T12:35:39.020367Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:35:39.020367Z digest=sha256:0fdb262e09ed300c6423e284c601777113f9c6115b2325d3fac45358e407cf20

Observation da8b92c4-2591-4935-b4ff-28cb1244cdb6 · inbound

ReGA: Model-Based Safeguard for LLMs via Representation-Guided Abstraction cites this paper.

ReGA: Model-Based Safeguard for LLMs via Representation-Guided Abstraction On Prompt-Driven Safeguarding for Large Language Models

Reference 35

Resolution
metadata mismatch
arxiv_id, observed 2026-05-19T11:37:16.008776Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-19T11:34:09.428653Z digest=sha256:9d2a2294f0312f051aa371b503b2c72885e5d2f1f13bd273438c5e33ea580da9

Observation 36cde0a9-52cb-47df-8885-9a0c480d83cd · inbound

Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning cites this paper.

Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning On Prompt-Driven Safeguarding for Large Language Models

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-06T19:57:44.717885Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T19:57:44.717885Z digest=sha256:396c320b18c6a8b5729729a53b3ce273301fecde2d230c0bc5dcafbd4c35a983

Observation c46fd5ac-48fa-416e-9127-e34bc783e919 · inbound

Defending Against Prompt Injection With a Few DefensiveTokens cites this paper.

Defending Against Prompt Injection With a Few DefensiveTokens On Prompt-Driven Safeguarding for Large Language Models

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-06T18:32:44.096157Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:32:44.096157Z digest=sha256:0360daae7b98d47a9fc63829abe3857a563fac9babfcd6ac1da92f748de166f8

Observation 408b7a6e-c13e-4e9d-85a8-fd40974b14f4 · inbound

Beyond Surface-Level Detection: Towards Cognitive-Driven Defense Against Jailbreak Attacks via Meta-Operations Reasoning cites this paper.

Beyond Surface-Level Detection: Towards Cognitive-Driven Defense Against Jailbreak Attacks via Meta-Operations Reasoning On Prompt-Driven Safeguarding for Large Language Models

Reference 197

Resolution
unresolved
no resolver link, observed 2026-08-06T04:47:25.678524Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T04:47:25.678524Z digest=sha256:e415b449379a7d5bbed8246fdcfc8000703397f4895937953b3f906ed629b247

Observation c96e3b12-54fb-4287-967a-e210244f832d · inbound

Turning the Spell Around: Lightweight Alignment Amplification via Rank-One Safety Injection cites this paper.

Turning the Spell Around: Lightweight Alignment Amplification via Rank-One Safety Injection On Prompt-Driven Safeguarding for Large Language Models

Reference 60

Resolution
unresolved
no resolver link, observed 2026-08-05T14:57:12.969212Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T14:57:12.969212Z digest=sha256:19b4e19ab66487e030409cded6064012f5cf1833bb57ac445c0c7c8ac94405be

Observation af93b3cf-a963-466e-813d-761b4e2907a2 · inbound

Probing the Difficulty Perception Mechanism of Large Language Models cites this paper.

Probing the Difficulty Perception Mechanism of Large Language Models On Prompt-Driven Safeguarding for Large Language Models

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-04T11:17:49.954144Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T11:17:49.954144Z digest=sha256:28a37ddf6cd068f6604fb13bfb43925d53d0a4a0e781f0b84232632153c8e477

Observation 9629203d-6a04-42d9-ba97-2cbeaf89f271 · inbound

Echoes of Human Malice in Agents: Benchmarking LLMs for Multi-Turn Online Harassment Attacks cites this paper.

Echoes of Human Malice in Agents: Benchmarking LLMs for Multi-Turn Online Harassment Attacks On Prompt-Driven Safeguarding for Large Language Models

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-04T09:40:47.454032Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T09:40:47.454032Z digest=sha256:e662299fba1aa5159c0f82039336f27d8a12a4a0bf24f1b7ff48c2011998dbf5

Observation b4569ed4-f15f-4ffc-8149-6e402c9d083f · inbound

SoK: Systematizing LLM Prompt Security: Taxonomies, Datasets, and Unified Evaluation of Attacks and Defenses cites this paper.

SoK: Systematizing LLM Prompt Security: Taxonomies, Datasets, and Unified Evaluation of Attacks and Defenses On Prompt-Driven Safeguarding for Large Language Models

Reference 245

Resolution
unresolved
no resolver link, observed 2026-08-04T09:25:58.615053Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T09:25:58.615053Z digest=sha256:8e4d2caa8bf9f6cc79d7dbac777206081297d7681c34432690b3a40e49e1a714

Observation afa072e4-9ff1-4b24-850d-2432afd9bbf9 · inbound

RACC: Representation-Aware Coverage Criteria for LLM Safety Testing cites this paper.

RACC: Representation-Aware Coverage Criteria for LLM Safety Testing On Prompt-Driven Safeguarding for Large Language Models

Reference 67

Resolution
metadata mismatch
arxiv_id, observed 2026-05-16T08:17:36.688250Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-16T08:12:55.296932Z digest=sha256:2b14852acb89902288195e4fe5f214f03bf1b1f985f2b11716245369a6b55960

Observation 9d5160d1-3eed-4b90-a28b-f1a98939264c · inbound

f-GRPO and Beyond: Divergence-Based Reinforcement Learning Algorithms for General LLM Alignment cites this paper.

f-GRPO and Beyond: Divergence-Based Reinforcement Learning Algorithms for General LLM Alignment On Prompt-Driven Safeguarding for Large Language Models

Reference 17

Resolution
metadata mismatch
arxiv_id, observed 2026-05-16T06:50:42.968338Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-16T06:48:35.723474Z digest=sha256:c156a3dc1389daccf313dda647cf995df4aca5e9af483773c8e8bed377f2394e

Observation a8bc067e-a858-481a-a400-4b0f18743e42 · inbound

Dictionary-Aligned Concept Control for Safeguarding Multimodal LLMs cites this paper.

Dictionary-Aligned Concept Control for Safeguarding Multimodal LLMs On Prompt-Driven Safeguarding for Large Language Models

Reference 131

Resolution
metadata mismatch
arxiv_id, observed 2026-05-11T05:35:57.513789Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-10T18:04:05.157103Z digest=sha256:f06ed31efc57766581d7538b32265385950af31305cfd2481319807df36ee1b9

Observation c8a09e59-74ee-4937-83ad-b7ada4e165b4 · inbound

A Single Neuron Is Sufficient to Bypass Safety Alignment in Large Language Models cites this paper.

A Single Neuron Is Sufficient to Bypass Safety Alignment in Large Language Models On Prompt-Driven Safeguarding for Large Language Models

Reference 17

Resolution
metadata mismatch
arxiv_id, observed 2026-05-12T01:46:14.370017Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-05-12T01:41:44.898358Z digest=sha256:6d20c4503beed30f7885adb79598d408133bc8221fe5ab07ea96027821c3365f

Observation 155d4921-eef9-4a92-9c50-46cb5fab9cf2 · inbound

CLAP: Contrastive Latent-space Prompt Optimization for End-to-end Autonomous Driving cites this paper.

CLAP: Contrastive Latent-space Prompt Optimization for End-to-end Autonomous Driving On Prompt-Driven Safeguarding for Large Language Models

Reference 48

Resolution
verified exact
arxiv_id, observed 2026-05-20T14:58:24.670438Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-20T14:58:03.757712Z digest=sha256:9dd1fed7cb7672f4be629071b3cffb98310d58c771d838a729d975ccd23418ef

Observation a30150e8-b607-4b84-bdb7-75acaad5a53b · inbound

Safety Geometry Collapse in Multimodal LLMs and Adaptive Drift Correction cites this paper.

Safety Geometry Collapse in Multimodal LLMs and Adaptive Drift Correction On Prompt-Driven Safeguarding for Large Language Models

Reference 59

Resolution
metadata mismatch
arxiv_id, observed 2026-05-20T10:58:13.540944Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-05-20T10:57:40.997128Z digest=sha256:ca93a8426700c2d4d0f286b29649e94ac06a1e2d143c1cd6278a4c13dd3da78b

Observation 16e62ae5-3a5f-4a29-94b2-79b8b61791a7 · inbound

Do Activation Monitors Survive Model Updates? Benchmarking, Predicting, and Repairing Activation-Monitor Staleness cites this paper.

Do Activation Monitors Survive Model Updates? Benchmarking, Predicting, and Repairing Activation-Monitor Staleness On Prompt-Driven Safeguarding for Large Language Models

Reference 40

Resolution
verified exact
arxiv_id, observed 2026-06-27T03:30:26.970938Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-06-27T03:24:24.714121Z digest=sha256:631dbf7f2c45ac223dfcb8ab11ba08fc03b61e5f46649d94a612524bea3b8d66

Observation e2fbc2da-a71e-4a66-933c-d61fc06f346f · inbound

Visual Token Compression Enhances Robustness of MLLMs cites this paper.

Visual Token Compression Enhances Robustness of MLLMs On Prompt-Driven Safeguarding for Large Language Models

Reference 92

Resolution
unresolved
no resolver link, observed 2026-08-01T13:10:37.718031Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T13:10:37.718031Z digest=sha256:b32217ee4025cb4e8753343775c5ab7bce94f1162796c2b640b912e8284bfc8e

Observation 7b1d80d9-b084-414a-9a8f-51ecc7ee23d1 · inbound

Efficient LLM Adversarial Training via Low-Rank Defense and Circuit-Guided Surrogates cites this paper.

Efficient LLM Adversarial Training via Low-Rank Defense and Circuit-Guided Surrogates On Prompt-Driven Safeguarding for Large Language Models

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-03T16:32:06.278220Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T16:32:06.278220Z digest=sha256:12f646e5e4d778cdceff678bc54abb81258e26d9fe0dc98271cba5a727da594d