Pith. sign in

Paper Citation Record · LEDGER

Improved Large Language Model Jailbreak Detection via Pretrained Embeddings

As of 21 August 2026, this Paper Citation Record lists 25 of 25 outbound references and 5 inbound Pith citation observations for arXiv:2412.01547.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2412.01547 v1

Coverage vector

measured 25 of 25 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-12T04:21:32.573063Z

measured 30 of 30 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-21T06:32:19.484+00:00

measured 5 of 5 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-15T16:21:58.775054Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-02T17:37:14.863127Z

Reference resolution

25 of 25 outbound references displayed

  • verified exact1
  • verified fuzzy3
  • unresolved21
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 3765612d-645f-482d-ac6d-150ff3c3944d · outbound

This paper cites , " * write output.state after.block = add.period write newline.

Improved Large Language Model Jailbreak Detection via Pretrained Embeddings , " * write output.state after.block = add.period write newline

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-12T04:21:32.432719Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-12T04:21:32.432719Z digest=sha256:412d9cee6e8121ce0cc45ec6861951445a2f78f5ac8fc192c7a82ced3961b0ad

Observation c929c69c-275c-4b73-9284-94cf08656a6d · outbound

This paper cites write newline.

Improved Large Language Model Jailbreak Detection via Pretrained Embeddings write newline

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-12T04:21:32.440050Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-12T04:21:32.440050Z digest=sha256:a2cb351846c91bc6ffcd0d30b474d0a5d103c62e06d26711c0848868374b2bf9

Observation 0fd5be9e-dc9c-4e5e-a105-751eb0567bc2 · outbound

This paper cites an unresolved cited work.

Improved Large Language Model Jailbreak Detection via Pretrained Embeddings Unresolved cited work

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-12T04:21:32.446222Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-12T04:21:32.446222Z digest=sha256:050e3fcd7c97b2595097a845437d7fe0c86113828ac8fbe8cb48c1b65de2a53c

Observation 9ac0c51d-fdcb-4a4d-8782-406bd3c7ccba · outbound

This paper cites an unresolved cited work.

Improved Large Language Model Jailbreak Detection via Pretrained Embeddings Unresolved cited work

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-12T04:21:32.453742Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-12T04:21:32.453742Z digest=sha256:74e0cc82afb22a9e7508dc71e5ee40174e26a58641cb42e2ed1b47e578b9e287

Observation 496307b9-a0a0-4448-a78a-6ca4684106fd · outbound

This paper cites garak: A Framework for Security Probing Large Language Models.

Improved Large Language Model Jailbreak Detection via Pretrained Embeddings garak: A Framework for Security Probing Large Language Models

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-12T04:21:32.458858Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-12T04:21:32.458858Z digest=sha256:eefc175470ea3ea82e5a7c3346763d5d4c90a326103302f40fd1d913fb434052

Observation 73fddb66-35c2-4e6a-9356-fcceaacb07f4 · outbound

This paper cites Summon a Demon and Bind it: A Grounded Theory of LLM Red Teaming.

Improved Large Language Model Jailbreak Detection via Pretrained Embeddings Summon a Demon and Bind it: A Grounded Theory of LLM Red Teaming

Reference 6

Resolution
verified exact
local_arxiv, observed 2026-08-12T04:21:32.816720Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-12T04:21:32.465156Z digest=sha256:41329b93dc55ce3ee44c43a3c86ba66843e7f22911108bee577617d0c7ce7877

Observation dcb307d9-1a74-4df4-83c4-2f2756da282f · outbound

This paper cites Mistral 7B.

Improved Large Language Model Jailbreak Detection via Pretrained Embeddings Mistral 7B

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-12T04:21:32.470368Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-12T04:21:32.470368Z digest=sha256:62f585a93c78a12cbe7ac66462207cbba2dc66f4de8a3690407559325a79c69d

Observation ceb867f2-0255-4f0a-83d8-0ec30fce59c2 · outbound

This paper cites Dense Passage Retrieval for Open-Domain Question Answering.

Improved Large Language Model Jailbreak Detection via Pretrained Embeddings Dense Passage Retrieval for Open-Domain Question Answering

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-12T04:21:32.475606Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-12T04:21:32.475606Z digest=sha256:7ae691c074e9fc0b9009f62efd353972ce7a1ead8c70b960873766224871febb

Observation 67e26904-825f-4c07-b216-501dc359a7df · outbound

This paper cites NV-Embed: Improved Techniques for Training LLMs as Generalist Embedding Models.

Improved Large Language Model Jailbreak Detection via Pretrained Embeddings NV-Embed: Improved Techniques for Training LLMs as Generalist Embedding Models

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-12T04:21:32.482163Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-12T04:21:32.482163Z digest=sha256:0efc4452036e50664650dcb3cf1adb2aec9b4ff1cba55afb6fc91447bcb62215

Observation 1272fbd4-66a2-4e77-b78a-bbad6b853592 · outbound

This paper cites ToxicChat: Unveiling Hidden Challenges of Toxicity Detection in Real-World User-AI Conversation.

Improved Large Language Model Jailbreak Detection via Pretrained Embeddings ToxicChat: Unveiling Hidden Challenges of Toxicity Detection in Real-World User-AI Conversation

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-12T04:21:32.488307Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-12T04:21:32.488307Z digest=sha256:fb314efa102a2a7ffbb7b5345c983c9f26878156de02d26fe544539bed0259c0

Observation 33abaff4-88bb-4a4c-b770-ae09b6674b99 · outbound

This paper cites an unresolved cited work.

Improved Large Language Model Jailbreak Detection via Pretrained Embeddings Unresolved cited work

Reference 11

Resolution
unresolved
raw_fallback, observed 2026-08-12T04:21:32.969220Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-12T04:21:32.493274Z digest=sha256:7454eb54e9c522eb3ce7300fd2a49aac3116175a1ecdce6c489ef2120eebd0bc

Observation be630a12-56d2-45a4-bcca-c44d509751eb · outbound

This paper cites Tree of Attacks: Jailbreaking Black-Box LLMs Automatically.

Improved Large Language Model Jailbreak Detection via Pretrained Embeddings Tree of Attacks: Jailbreaking Black-Box LLMs Automatically

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-12T04:21:32.498164Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-12T04:21:32.498164Z digest=sha256:d555c846ba70a02de1c1dfc6dd1d40924b69e54f2177e46727129340e27d9699

Observation 1223064d-ab71-4d52-bab6-456495eccd2c · outbound

This paper cites Embedding And Clustering Your Data Can Improve Contrastive Pretraining.

Improved Large Language Model Jailbreak Detection via Pretrained Embeddings Embedding And Clustering Your Data Can Improve Contrastive Pretraining

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-12T04:21:32.502801Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-12T04:21:32.502801Z digest=sha256:0e41548520cc3cdefda7b8987f945869b71e7ca524605d9a51d2a849a09e5556

Observation df596c98-26b9-49c5-9280-655a2abf603b · outbound

This paper cites S.; and Dean, J.

Improved Large Language Model Jailbreak Detection via Pretrained Embeddings S.; and Dean, J

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-12T04:21:32.507961Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-12T04:21:32.507961Z digest=sha256:e62e1847d1af799dcd227faecb6872467ca7337d1d694318400eebe3d3b7713d

Observation a27738ee-e9d9-4a69-a28f-1922a3aa1363 · outbound

This paper cites an unresolved cited work.

Improved Large Language Model Jailbreak Detection via Pretrained Embeddings Unresolved cited work

Reference 15

Resolution
unresolved
raw_fallback, observed 2026-08-12T04:21:32.939345Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-12T04:21:32.513585Z digest=sha256:5d417bb28b2b6db7cd41fa81caffc65b812ca6e06dbc7c3d161bddeaefd82c78

Observation 503cdfce-8364-4355-9654-d4fc75b6c598 · outbound

This paper cites NeMo Guardrails: A Toolkit for Controllable and Safe LLM Applications with Programmable Rails.

Improved Large Language Model Jailbreak Detection via Pretrained Embeddings NeMo Guardrails: A Toolkit for Controllable and Safe LLM Applications with Programmable Rails

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-12T04:21:32.527774Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-12T04:21:32.527774Z digest=sha256:9605f6027cd03d114dcea780b88ac1b5856007c5866a1ee6220464c631564a39

Observation b247fdaa-fb24-4e69-ac3b-36cf85a4472e · outbound

This paper cites an unresolved cited work.

Improved Large Language Model Jailbreak Detection via Pretrained Embeddings Unresolved cited work

Reference 17

Resolution
unresolved
raw_fallback, observed 2026-08-12T04:21:32.921408Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-12T04:21:32.533753Z digest=sha256:751c3fb71ba2e2609a11deb4fb0b1431e8bd780ba27bd3bd401fbd2ea396c888

Observation 0cce9b8b-fbd2-4f3b-a8a2-1809756295a8 · outbound

This paper cites J.; and Fergus, R.

Improved Large Language Model Jailbreak Detection via Pretrained Embeddings J.; and Fergus, R

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T04:21:32.905185Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-12T04:21:32.538200Z digest=sha256:74e9df1633580748c6d841c16f19657ccbc9da8e084fd84db7cd09ac4f8b0c07

Observation ca03a192-8675-4529-89da-0649a05c8a79 · outbound

This paper cites Text Embeddings by Weakly-Supervised Contrastive Pre-training.

Improved Large Language Model Jailbreak Detection via Pretrained Embeddings Text Embeddings by Weakly-Supervised Contrastive Pre-training

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-12T04:21:32.542711Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-12T04:21:32.542711Z digest=sha256:964dc2f9903a04e1282329a586bbd8ad354f538839d8906c14ce0bb49a901a12

Observation e249e374-5cc3-4801-9747-2528aaab56bd · outbound

This paper cites Defending LLMs against Jailbreaking Attacks via Backtranslation.

Improved Large Language Model Jailbreak Detection via Pretrained Embeddings Defending LLMs against Jailbreaking Attacks via Backtranslation

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-12T04:21:32.548337Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-12T04:21:32.548337Z digest=sha256:07c89ad7022113e0418a708684315ccc8f3fd880f82d0ed13ec566410201683c

Observation d1470620-6bd6-4a41-8776-1b5b2bbbe060 · outbound

This paper cites an unresolved cited work.

Improved Large Language Model Jailbreak Detection via Pretrained Embeddings Unresolved cited work

Reference 21

Resolution
unresolved
raw_fallback, observed 2026-08-12T04:21:32.887555Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-12T04:21:32.553195Z digest=sha256:192ffae29dd1296ee54119dbe999b13295dba8067a42277c3a0f16b4f3351dce

Observation a4db5e51-7d0b-4a58-9adc-e394975d13e5 · outbound

This paper cites Fundamental Limitations of Alignment in Large Language Models.

Improved Large Language Model Jailbreak Detection via Pretrained Embeddings Fundamental Limitations of Alignment in Large Language Models

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-12T04:21:32.557671Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-12T04:21:32.557671Z digest=sha256:a61997883b19bfd45e3359e7991c94a9a3e44269ec44c302b5256e8090ce661a

Observation fba57223-2d62-4e64-9008-175f9416fdb7 · outbound

This paper cites S.; Brendel, W.; Tramer, F.; and Carlini, N.

Improved Large Language Model Jailbreak Detection via Pretrained Embeddings S.; Brendel, W.; Tramer, F.; and Carlini, N

Reference 23

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T04:21:32.869645Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-12T04:21:32.563456Z digest=sha256:16838d7e5a89c5c5c58116e5624db32424e0bacea5c701d83008f8a247430e91

Observation 6d581b2c-0d43-4e02-adbd-4902bb1eb018 · outbound

This paper cites Z.; Fredrikson, M.; and Hendrycks, D.

Improved Large Language Model Jailbreak Detection via Pretrained Embeddings Z.; Fredrikson, M.; and Hendrycks, D

Reference 24

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T04:21:32.853119Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-12T04:21:32.568719Z digest=sha256:2acd9bb1c13199d2ae9a779d987e0e237cb35fc973a310e12fd9c2e3f2e83a8e

Observation 956c13dc-f97a-4a7f-990f-587be8770193 · outbound

This paper cites Universal and Transferable Adversarial Attacks on Aligned Language Models.

Improved Large Language Model Jailbreak Detection via Pretrained Embeddings Universal and Transferable Adversarial Attacks on Aligned Language Models

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-12T04:21:32.573063Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-12T04:21:32.573063Z digest=sha256:c344e8100073c1d7cce899216ec153c52d2bb89ba2795d3340b1ab2a61d18934

Pith citing papers

Observation 65c83966-1ce6-4228-bb4b-5cfabc2683bf · inbound

JavelinGuard: Low-Cost Transformer Architectures for LLM Security cites this paper.

JavelinGuard: Low-Cost Transformer Architectures for LLM Security Improved Large Language Model Jailbreak Detection via Pretrained Embeddings

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:25.376227Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:25.376227Z digest=sha256:d06f1dfbc73d144688e623774b18d7478e5ba15c6c287a105d70c8282c95751d

Observation f6b8fbfe-074b-4a14-bc40-02564e602db2 · inbound

Embedding Poisoning: Bypassing Safety Alignment via Embedding Semantic Shift cites this paper.

Embedding Poisoning: Bypassing Safety Alignment via Embedding Semantic Shift Improved Large Language Model Jailbreak Detection via Pretrained Embeddings

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-15T16:21:58.775054Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:21:58.775054Z digest=sha256:0f2c365867b24948a94e4241b97890edf1f02ed3f649e7e5e15099dd56ed7154

Observation 61f3a56b-d971-4121-bf3f-4d75a8a68d17 · inbound

LLM in the Middle: A Systematic Review of Threats and Mitigations to Real-World LLM-based Systems cites this paper.

LLM in the Middle: A Systematic Review of Threats and Mitigations to Real-World LLM-based Systems Improved Large Language Model Jailbreak Detection via Pretrained Embeddings

Reference 95

Resolution
unresolved
no resolver link, observed 2026-08-04T17:46:17.939109Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:46:17.939109Z digest=sha256:1b116e31de0c9cac2b6e60571697ab1cb2d8990494702492f704d6d26b566e5c

Observation 799fe302-a05b-414f-8f72-414431b54b6a · inbound

Cross-Lingual Jailbreak Detection via Semantic Codebooks cites this paper.

Cross-Lingual Jailbreak Detection via Semantic Codebooks Improved Large Language Model Jailbreak Detection via Pretrained Embeddings

Reference 5

Resolution
verified exact
arxiv_id, observed 2026-05-11T23:46:21.666210Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-05-07T16:22:33.567085Z digest=sha256:fc663001e11fa520ae3e1f9e85b8fc91ae0672bbcdc2f42537e82cdf6f4deb12

Observation 4922b0cb-cebc-423a-93bc-ba950cbcfb23 · inbound

Defending Jailbreak Attacks on Large Language Models via Manifold Trajectory Kinetics cites this paper.

Defending Jailbreak Attacks on Large Language Models via Manifold Trajectory Kinetics Improved Large Language Model Jailbreak Detection via Pretrained Embeddings

Reference 62

Resolution
verified exact
arxiv_id, observed 2026-07-02T17:37:14.864659Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-06-27T21:55:48.561400Z digest=sha256:cc0a8a0f081aefece7f5213ea93db5aa9fc3fe862a2bd3007532e7b8b04b0d6e