Pith. sign in

Paper Citation Record · LEDGER

Efficient Safety Alignment of Language Models via Latent Personality Traits

As of 14 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 0 inbound Pith citation observations for arXiv:2607.07918.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2607.07918 v1

Coverage vector

measured 57 of 57 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-07-10T15:26:23.290009Z

measured 57 of 57 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-14T06:32:32.682623+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

57 of 57 outbound references displayed

  • verified exact30
  • verified fuzzy6
  • unresolved3
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch18

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 821096e3-a873-4fe4-8478-c3123d7b18a2 · outbound

This paper cites Barrick and Michael K.

Efficient Safety Alignment of Language Models via Latent Personality Traits Barrick and Michael K

Reference 1

Resolution
verified fuzzy
raw_fallback, observed 2026-07-10T15:27:20.222371Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-07-10T15:26:23.290009Z digest=sha256:a024dd885335c1ea6711f8ed046509917f3d5252b24ee4d1f941de4f170dfef9

Observation a30391ca-3121-4b77-9a16-ddb254bec8d4 · outbound

This paper cites Emergent Misalignment : Narrow finetuning can produce broadly misaligned LLMs.

Efficient Safety Alignment of Language Models via Latent Personality Traits Emergent Misalignment : Narrow finetuning can produce broadly misaligned LLMs

Reference 2

Resolution
metadata mismatch
doi, observed 2026-07-10T15:27:19.829623Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-07-10T15:26:23.290009Z digest=sha256:71160d13f540f40acf3748d0eae4b2228c3b33f6bb19255b81f27993d7516a2c

Observation 749af3db-bdfd-403d-bc3d-8ffabca8fdd1 · outbound

This paper cites An Interpretable N-gram Perplexity Threat Model for Large Language Model Jailbreaks.

Efficient Safety Alignment of Language Models via Latent Personality Traits An Interpretable N-gram Perplexity Threat Model for Large Language Model Jailbreaks

Reference 3

Resolution
verified exact
local_arxiv, observed 2026-07-10T15:27:20.104514Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-07-10T15:26:23.290009Z digest=sha256:e5d03af2a8b1d56fdece55816bb582204d24a57690f085397aa96129ede2849d

Observation 20bea938-25bf-41aa-80d9-488db14c226a · outbound

This paper cites Defending Against Unforeseen Failure Modes with Latent Adversarial Training.

Efficient Safety Alignment of Language Models via Latent Personality Traits Defending Against Unforeseen Failure Modes with Latent Adversarial Training

Reference 4

Resolution
metadata mismatch
local_arxiv, observed 2026-07-10T15:27:20.040662Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-07-10T15:26:23.290009Z digest=sha256:70ec78d4d345f525b0869e0937abbff0063bbcda375f6e257e725de185e890d3

Observation 25068ab6-9db4-44a4-a01e-1714c56d97b2 · outbound

This paper cites Jailbreaking Black Box Large Language Models in Twenty Queries.

Efficient Safety Alignment of Language Models via Latent Personality Traits Jailbreaking Black Box Large Language Models in Twenty Queries

Reference 5

Resolution
metadata mismatch
local_arxiv, observed 2026-07-10T15:27:20.123049Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-07-10T15:26:23.290009Z digest=sha256:9bd08e4612174f88185ffff32af0dec577d51508aefa225f2c4fec8187e44cbd

Observation 06da8fcd-fc02-4741-b04e-e45733d52699 · outbound

This paper cites Persona Vectors: Monitoring and Controlling Character Traits in Language Models.

Efficient Safety Alignment of Language Models via Latent Personality Traits Persona Vectors: Monitoring and Controlling Character Traits in Language Models

Reference 6

Resolution
verified exact
local_arxiv, observed 2026-07-10T15:27:20.079398Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-07-10T15:26:23.290009Z digest=sha256:b7acc964bb190b425a849b677b3b394f7cd5a79caf1a6aa5554083fd146e5bf3

Observation 240ccd28-d064-4a20-8c33-dbedea12db84 · outbound

This paper cites Deep reinforcement learning from human preferences.

Efficient Safety Alignment of Language Models via Latent Personality Traits Deep reinforcement learning from human preferences

Reference 7

Resolution
metadata mismatch
local_arxiv, observed 2026-07-10T15:27:20.102093Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-07-10T15:26:23.290009Z digest=sha256:6dba0f9d25bef5fa27af59b13607f9f9d1d6c0ef556148290f1e6d26f074d676

Observation f8736ea1-80aa-42a2-b24a-850c7505c59c · outbound

This paper cites Training Verifiers to Solve Math Word Problems.

Efficient Safety Alignment of Language Models via Latent Personality Traits Training Verifiers to Solve Math Word Problems

Reference 8

Resolution
verified exact
local_arxiv, observed 2026-07-10T15:27:20.038037Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-07-10T15:26:23.290009Z digest=sha256:bbe459d08771f7b67501dbfa81e333c6dbfdc323df365f2dadb0c38956ab3040

Observation 7dfadebb-76e8-40ed-b95f-16bce40796b8 · outbound

This paper cites OR-Bench: An Over-Refusal Benchmark for Large Language Models.

Efficient Safety Alignment of Language Models via Latent Personality Traits OR-Bench: An Over-Refusal Benchmark for Large Language Models

Reference 9

Resolution
verified exact
local_arxiv, observed 2026-07-10T15:27:20.069606Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-07-10T15:26:23.290009Z digest=sha256:193fc901545df4605eed32411b4d8eb0e77040c342858513a0aca84bd519a7cc

Observation 49b741f9-7b42-4a6d-93d5-dd136354a5fa · outbound

This paper cites du Plessis and Gideon P.

Efficient Safety Alignment of Language Models via Latent Personality Traits du Plessis and Gideon P

Reference 10

Resolution
verified exact
arxiv_id, observed 2026-07-10T15:27:19.823397Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-07-10T15:26:23.290009Z digest=sha256:eea1286f7f81cea6a92c15ab13c31d63a39efac11f95e0e97dbf90287b17c372

Observation 80ae4665-bb36-466d-88e6-49e455d713df · outbound

This paper cites Psychometric personality shaping modulates capabilities and safety in language models, 2025.

Efficient Safety Alignment of Language Models via Latent Personality Traits Psychometric personality shaping modulates capabilities and safety in language models, 2025

Reference 11

Resolution
verified exact
arxiv_id, observed 2026-07-10T15:27:20.115469Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-07-10T15:26:23.290009Z digest=sha256:1ca70ec86ee85580a4afbc7f38afaa14a13affc31cf556622818c7c958c8a9db

Observation 4177629c-db75-4ca3-a86e-f165a8fabbe7 · outbound

This paper cites an unresolved cited work.

Efficient Safety Alignment of Language Models via Latent Personality Traits Unresolved cited work

Reference 12

Resolution
unresolved
raw_fallback, observed 2026-07-10T15:27:20.228177Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-07-10T15:26:23.290009Z digest=sha256:87b339c507b5d641a982fe0f5949976b409473de578489490c78d5e88503587d

Observation abe71d70-2a2f-4db4-8acd-caf8cca14887 · outbound

This paper cites Goldberg, John A.

Efficient Safety Alignment of Language Models via Latent Personality Traits Goldberg, John A

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-07-10T15:27:20.218494Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-07-10T15:26:23.290009Z digest=sha256:02004fca137c6a1153660cea18ba7554e559c82a51494a7cac592a73a8ca81f4

Observation 43dc32dc-55e5-489c-be48-115524d23508 · outbound

This paper cites Explaining and Harnessing Adversarial Examples.

Efficient Safety Alignment of Language Models via Latent Personality Traits Explaining and Harnessing Adversarial Examples

Reference 14

Resolution
metadata mismatch
local_arxiv, observed 2026-07-10T15:27:20.043042Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-07-10T15:26:23.290009Z digest=sha256:1a54d9606e164c9f3223159c3698c5cedea5a2c70d7dabcca9aa7ab1720dda9a

Observation 71ccc23e-eeee-43dc-b525-196efe517bf7 · outbound

This paper cites Self-Assessment Tests are Unreliable Measures of LLM Personality.

Efficient Safety Alignment of Language Models via Latent Personality Traits Self-Assessment Tests are Unreliable Measures of LLM Personality

Reference 15

Resolution
metadata mismatch
local_arxiv, observed 2026-07-10T15:27:20.053262Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-07-10T15:26:23.290009Z digest=sha256:afc00f9b397794b35a0c7643f393d5b7a575fa7ea2bff81be04b287c6bbd2069

Observation 060a4676-9620-4f43-913c-6f21d404f175 · outbound

This paper cites Measuring Massive Multitask Language Understanding.

Efficient Safety Alignment of Language Models via Latent Personality Traits Measuring Massive Multitask Language Understanding

Reference 16

Resolution
verified exact
local_arxiv, observed 2026-07-10T15:27:20.064480Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-07-10T15:26:23.290009Z digest=sha256:663d7ebf8d8d0fe5ee0fe987509f74094f0d2174218ad9697119f83f1de7e2b1

Observation b47e93bf-14c4-4c01-82d8-55f57aa76a87 · outbound

This paper cites International personality item pool: Alphabetical list of items.

Efficient Safety Alignment of Language Models via Latent Personality Traits International personality item pool: Alphabetical list of items

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-07-10T15:27:20.226400Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-07-10T15:26:23.290009Z digest=sha256:43f606cef5bbe2c0a14594cb1e1d5d2afd399f534faaa38bbe70c1535829f3f4

Observation 0310fc50-cfa6-42f9-8f08-c536caf3c83e · outbound

This paper cites What Makes and Breaks Safety Fine-tuning? A Mechanistic Study.

Efficient Safety Alignment of Language Models via Latent Personality Traits What Makes and Breaks Safety Fine-tuning? A Mechanistic Study

Reference 18

Resolution
verified exact
local_arxiv, observed 2026-07-10T15:27:20.138378Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-07-10T15:26:23.290009Z digest=sha256:ba2bc735bb7eba1111d40817f9d8077aab56cb669952e3491a3231c16a1243d2

Observation 2a34e8c7-3430-419e-b6c3-9ef39e4abb87 · outbound

This paper cites Evaluating and inducing personality in pre-trained language models, 2022.

Efficient Safety Alignment of Language Models via Latent Personality Traits Evaluating and inducing personality in pre-trained language models, 2022

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-07-10T15:27:20.220585Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-07-10T15:26:23.290009Z digest=sha256:20784da0d69065ca2824165fba9aa8d7c0e893a6f936857d4a8bec004385acbf

Observation 22a05933-eb2e-4f28-8965-ab42590079a0 · outbound

This paper cites an unresolved cited work.

Efficient Safety Alignment of Language Models via Latent Personality Traits Unresolved cited work

Reference 20

Resolution
unresolved
raw_fallback, observed 2026-07-10T15:27:20.224371Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-07-10T15:26:23.290009Z digest=sha256:c93a22c6772b53c640b1f784f26b07e918b93a9c1c2128d0a73aaf8fbc811e7f

Observation 3137c19b-a412-43d6-bdeb-21ae7688e461 · outbound

This paper cites Measuring and Controlling Instruction (In)Stability in Language Model Dialogs.

Efficient Safety Alignment of Language Models via Latent Personality Traits Measuring and Controlling Instruction (In)Stability in Language Model Dialogs

Reference 21

Resolution
verified exact
local_arxiv, observed 2026-07-10T15:27:20.061878Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-07-10T15:26:23.290009Z digest=sha256:caf1fd5f8c648ffed3f5a32446b62b481949df7015fcedc889a2475b3577c6b0

Observation c8a8c345-c191-44ab-beff-db1957af4265 · outbound

This paper cites TruthfulQA: Measuring How Models Mimic Human Falsehoods.

Efficient Safety Alignment of Language Models via Latent Personality Traits TruthfulQA: Measuring How Models Mimic Human Falsehoods

Reference 22

Resolution
verified exact
local_arxiv, observed 2026-07-10T15:27:20.072166Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-07-10T15:26:23.290009Z digest=sha256:18523e461561188d866bea8030631e653750f58b6d70e4c551236b0407dd765c

Observation c767a605-2786-4fbf-bc53-ae930fd91568 · outbound

This paper cites AutoDAN: Generating Stealthy Jailbreak Prompts on Aligned Large Language Models.

Efficient Safety Alignment of Language Models via Latent Personality Traits AutoDAN: Generating Stealthy Jailbreak Prompts on Aligned Large Language Models

Reference 23

Resolution
verified exact
local_arxiv, observed 2026-07-10T15:27:20.055777Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-07-10T15:26:23.290009Z digest=sha256:27c20ea964c57e2b44c27aec9edc159da7dbc9565d000de84baf9713a2d1ed01

Observation 98b70c22-b2b1-4f3e-bd68-3c973054c2f5 · outbound

This paper cites arXiv:2601.10387 [cs].

Efficient Safety Alignment of Language Models via Latent Personality Traits arXiv:2601.10387 [cs]

Reference 24

Resolution
metadata mismatch
arxiv_id, observed 2026-07-10T15:27:20.112632Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-07-10T15:26:23.290009Z digest=sha256:04ea2a76020bda269bd3c3a7aae1ce87c1f74d7f0ac4b3b12b8c32d77e1438bb

Observation 11766f72-aa03-40f3-a89b-79430d42efe4 · outbound

This paper cites Stable and explainable personality trait evaluation in large language models with internal activations, 2026.

Efficient Safety Alignment of Language Models via Latent Personality Traits Stable and explainable personality trait evaluation in large language models with internal activations, 2026

Reference 25

Resolution
verified exact
arxiv_id, observed 2026-07-10T15:27:20.024345Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-07-10T15:26:23.290009Z digest=sha256:b741ba9207c680e275100472ac3d2cd2265b271cf2846790791c451edccb45c6

Observation fe6c7a1a-57e5-4e9b-b146-7ec5e82f72fa · outbound

This paper cites HarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Robust Refusal.

Efficient Safety Alignment of Language Models via Latent Personality Traits HarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Robust Refusal

Reference 26

Resolution
verified exact
local_arxiv, observed 2026-07-10T15:27:20.029931Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-07-10T15:26:23.290009Z digest=sha256:25a5fdba883f8748c92dd1911a42dca8368fd694d812e59eea35af37a1ab40f0

Observation 90b7e137-a4eb-4bad-978e-f8fd6343c4da · outbound

This paper cites Tree of Attacks: Jailbreaking Black-Box LLMs Automatically.

Efficient Safety Alignment of Language Models via Latent Personality Traits Tree of Attacks: Jailbreaking Black-Box LLMs Automatically

Reference 27

Resolution
verified exact
local_arxiv, observed 2026-07-10T15:27:20.048423Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-07-10T15:26:23.290009Z digest=sha256:00600986bfdb54e2a0ee6f2642951be59cea4759fde27cfc518d38240bce849c

Observation 31fd26ec-c5a2-4b85-86c8-ce625b437b9a · outbound

This paper cites Training language models to follow instructions with human feedback.

Efficient Safety Alignment of Language Models via Latent Personality Traits Training language models to follow instructions with human feedback

Reference 28

Resolution
verified exact
local_arxiv, observed 2026-07-10T15:27:20.077046Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-07-10T15:26:23.290009Z digest=sha256:6457c02a833af5ff88037af0909c94e59103edc6ff70238641b3faa77877bc01

Observation 73398e14-ad66-402f-8385-039860e29775 · outbound

This paper cites an unresolved cited work.

Efficient Safety Alignment of Language Models via Latent Personality Traits Unresolved cited work

Reference 29

Resolution
unresolved
raw_fallback, observed 2026-07-10T15:27:20.229885Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-07-10T15:26:23.290009Z digest=sha256:8a40c5c45d3fa7c57ce75cafd150f1b2b434efff23c8b75bd1c4b4e65d805c18

Observation 4c5dd018-3fd8-4e9f-a1d1-6e7658c60902 · outbound

This paper cites The LAMBADA dataset: Word prediction requiring a broad discourse context.

Efficient Safety Alignment of Language Models via Latent Personality Traits The LAMBADA dataset: Word prediction requiring a broad discourse context

Reference 30

Resolution
verified exact
local_arxiv, observed 2026-07-10T15:27:20.135943Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-07-10T15:26:23.290009Z digest=sha256:69566959baabfd3fa71d0731fd1b6fbcc8a4b5dadcfd2e84100e4eb428e6828e

Observation 1954f2f3-4241-4142-a245-fcda157ab2f7 · outbound

This paper cites AdvPrompter: Fast Adaptive Adversarial Prompting for LLMs.

Efficient Safety Alignment of Language Models via Latent Personality Traits AdvPrompter: Fast Adaptive Adversarial Prompting for LLMs

Reference 31

Resolution
metadata mismatch
local_arxiv, observed 2026-07-10T15:27:20.109933Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-07-10T15:26:23.290009Z digest=sha256:c67c8a1d69184b826ac149d21c8515999e187f6898e4c73debb160caff166703

Observation 57f8316b-b701-45a6-8c74-ddc6f9191298 · outbound

This paper cites Lechner, Claudia Wagner, Beatrice Rammstedt, and Markus Strohmaier.

Efficient Safety Alignment of Language Models via Latent Personality Traits Lechner, Claudia Wagner, Beatrice Rammstedt, and Markus Strohmaier

Reference 32

Resolution
verified fuzzy
raw_fallback, observed 2026-07-10T15:27:20.216683Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-07-10T15:26:23.290009Z digest=sha256:28951c5484aafbffd4578d514b9b6f6de219884b7c76f8c43f6a2ccff5b017b3

Observation 6487dcc1-2ac4-4d81-8c13-60b2dc6d995a · outbound

This paper cites Red Teaming Language Models with Language Models.

Efficient Safety Alignment of Language Models via Latent Personality Traits Red Teaming Language Models with Language Models

Reference 33

Resolution
verified exact
local_arxiv, observed 2026-07-10T15:27:20.117846Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-07-10T15:26:23.290009Z digest=sha256:a73e514f989b40642c605c9effdd01944ea07918b231b0c510301aef146a0614

Observation 4503ec75-b14e-4b7c-b05f-561353a21df0 · outbound

This paper cites tinyBenchmarks: evaluating LLMs with fewer examples.

Efficient Safety Alignment of Language Models via Latent Personality Traits tinyBenchmarks: evaluating LLMs with fewer examples

Reference 34

Resolution
metadata mismatch
local_arxiv, observed 2026-07-10T15:27:20.086993Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-07-10T15:26:23.290009Z digest=sha256:04e205310f1cc2ecca20f89121fd20b396c0033ede604cf3896b1686f2ab8a17

Observation 23b57278-cdf1-4e03-8c8a-03309603984e · outbound

This paper cites InProceed- ings of the 32nd International Conference on Neu- ral Information Processing Systems, NIPS’18, page 5732–5741, Red Hook, NY , USA.

Efficient Safety Alignment of Language Models via Latent Personality Traits InProceed- ings of the 32nd International Conference on Neu- ral Information Processing Systems, NIPS’18, page 5732–5741, Red Hook, NY , USA

Reference 35

Resolution
metadata mismatch
arxiv_id, observed 2026-07-10T15:27:20.082057Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-07-10T15:26:23.290009Z digest=sha256:486de2764807629b68a9822fa9bda388b95b9d491bb9fdf245dbc028fd97ae0c

Observation a07e89c1-7bdf-487e-92ba-ee7b96d14961 · outbound

This paper cites Position: Adversarial ML for LLMs Is Not Making Any Progress.

Efficient Safety Alignment of Language Models via Latent Personality Traits Position: Adversarial ML for LLMs Is Not Making Any Progress

Reference 36

Resolution
verified exact
local_arxiv, observed 2026-07-10T15:27:20.074506Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-07-10T15:26:23.290009Z digest=sha256:b579b62fde8b6ab8c9ef1ce3696e9acb36306fca084f001ad40e48325760dc8f

Observation 022ce466-ebc4-422d-833a-d5511697f8f2 · outbound

This paper cites The Butterfly Effect of Altering Prompts: How Small Changes and Jailbreaks Affect Large Language Model Performance.

Efficient Safety Alignment of Language Models via Latent Personality Traits The Butterfly Effect of Altering Prompts: How Small Changes and Jailbreaks Affect Large Language Model Performance

Reference 37

Resolution
verified exact
local_arxiv, observed 2026-07-10T15:27:20.050919Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-07-10T15:26:23.290009Z digest=sha256:7c78369d86f07ed6166b65f43b6dedf976cdabaaba97ac529ff780b990777da0

Observation 0a34a515-b193-45e0-8450-b95ee5182d2e · outbound

This paper cites Rainbow Teaming: Open-Ended Generation of Diverse Adversarial Prompts.

Efficient Safety Alignment of Language Models via Latent Personality Traits Rainbow Teaming: Open-Ended Generation of Diverse Adversarial Prompts

Reference 38

Resolution
metadata mismatch
local_arxiv, observed 2026-07-10T15:27:20.032546Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-07-10T15:26:23.290009Z digest=sha256:f8d122960aa67f62e9ad804dbe30c5f7c096665a94b92e068ba3ec29d4857327

Observation e23e69b8-bef5-44b2-a51a-8e2cd5902916 · outbound

This paper cites A coin flip for safety: Llm judges fail to reliably measure adversarial robustness.

Efficient Safety Alignment of Language Models via Latent Personality Traits A coin flip for safety: Llm judges fail to reliably measure adversarial robustness

Reference 39

Resolution
verified exact
arxiv_id, observed 2026-07-10T15:27:20.059212Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-07-10T15:26:23.290009Z digest=sha256:0dc794b8a01c04b45cb449738d5705973e929344394463e49d277b3d9d14cf1f

Observation e8aa52b9-50b7-4857-ba42-2e5c7aaf4568 · outbound

This paper cites Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting.

Efficient Safety Alignment of Language Models via Latent Personality Traits Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting

Reference 40

Resolution
verified exact
local_arxiv, observed 2026-07-10T15:27:20.131028Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-07-10T15:26:23.290009Z digest=sha256:165c2e703bb6cbedae49f473681f97287bbf5b878a0c26a4ed9113a1703697c5

Observation 9bf7fdef-e646-46e4-a844-e99d675fb663 · outbound

This paper cites A psychometric framework for evaluating and shaping personality traits in large language models.

Efficient Safety Alignment of Language Models via Latent Personality Traits A psychometric framework for evaluating and shaping personality traits in large language models

Reference 41

Resolution
verified fuzzy
raw_fallback, observed 2026-07-10T15:27:20.231740Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-07-10T15:26:23.290009Z digest=sha256:623dc202209b6292fd9a8479ce5b742a6a645debfd06ad84198d940bad139bee

Observation e055885f-daed-490f-bbe7-51d7258e870d · outbound

This paper cites Latent Adversarial Training Improves Robustness to Persistent Harmful Behaviors in LLMs.

Efficient Safety Alignment of Language Models via Latent Personality Traits Latent Adversarial Training Improves Robustness to Persistent Harmful Behaviors in LLMs

Reference 42

Resolution
metadata mismatch
local_arxiv, observed 2026-07-10T15:27:20.035408Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-07-10T15:26:23.290009Z digest=sha256:613d1b3d5c267bef19118ee8d9270968fa514e1c8617f161bebae1ad5236cab6

Observation e68132a7-490c-4fc8-a276-fd4a3bb91eb2 · outbound

This paper cites AutoPrompt: Eliciting Knowledge from Language Models with Automatically Generated Prompts.

Efficient Safety Alignment of Language Models via Latent Personality Traits AutoPrompt: Eliciting Knowledge from Language Models with Automatically Generated Prompts

Reference 43

Resolution
verified exact
local_arxiv, observed 2026-07-10T15:27:20.067044Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-07-10T15:26:23.290009Z digest=sha256:62c2a50089b8892491ce0dd9af6ee2db4d9509a20bfca412c6e22b48dd67612f

Observation c85018f4-f52f-471a-92eb-af959a224b44 · outbound

This paper cites Simms, Lewis R.

Efficient Safety Alignment of Language Models via Latent Personality Traits Simms, Lewis R

Reference 44

Resolution
verified exact
arxiv_id, observed 2026-07-10T15:27:19.833517Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-07-10T15:26:23.290009Z digest=sha256:efd06adf420b0a945bb6febd3e6236b418a6b2013751e971658a84c38acf862a

Observation b356fd59-70a3-45cb-b68a-317b411eb8a3 · outbound

This paper cites Evaluating alignment of behavioral dispositions in llms.

Efficient Safety Alignment of Language Models via Latent Personality Traits Evaluating alignment of behavioral dispositions in llms

Reference 45

Resolution
verified exact
arxiv_id, observed 2026-07-10T15:27:20.092107Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-07-10T15:26:23.290009Z digest=sha256:4b33c3cda596b27197d11360fa5ddc635ebc362ad408d2e5b4ae4ffaa56b3b7c

Observation c35de6d0-c28d-49a9-a122-40e5fe3aeb44 · outbound

This paper cites Yuxia Wang, Haonan Li, Xudong Han, Preslav Nakov, and Timothy Baldwin.

Efficient Safety Alignment of Language Models via Latent Personality Traits Yuxia Wang, Haonan Li, Xudong Han, Preslav Nakov, and Timothy Baldwin

Reference 46

Resolution
metadata mismatch
arxiv_id, observed 2026-07-10T15:27:20.094856Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-07-10T15:26:23.290009Z digest=sha256:aaf5b5f53d360bd1eee4eea0082a6f2acf2271def2f74c98c2df8ac22339e43d

Observation 38d1709e-1c21-400a-8043-5f78fb9bbfdb · outbound

This paper cites arXiv preprint arXiv:2506.19823 , year =.

Efficient Safety Alignment of Language Models via Latent Personality Traits arXiv preprint arXiv:2506.19823 , year =

Reference 47

Resolution
metadata mismatch
arxiv_id, observed 2026-07-10T15:27:20.045712Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-07-10T15:26:23.290009Z digest=sha256:45f7ec4e828dce81f6202cf9b98a32177cb8794d783e8aba1779de240b4f1aef

Observation 6a0614ed-c35e-4664-8a47-c51f60777f18 · outbound

This paper cites OpenCharacter: Training Customizable Role-Playing LLMs with Large-Scale Synthetic Personas.

Efficient Safety Alignment of Language Models via Latent Personality Traits OpenCharacter: Training Customizable Role-Playing LLMs with Large-Scale Synthetic Personas

Reference 48

Resolution
metadata mismatch
local_arxiv, observed 2026-07-10T15:27:20.133534Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-07-10T15:26:23.290009Z digest=sha256:962970a104efb913544988329a90c6a4d2cb581bdc8d5810807b4352bab0838e

Observation 6cb77377-5147-4dc2-8859-5a74d98068fb · outbound

This paper cites Efficient Adversarial Training in LLMs with Continuous Attacks.

Efficient Safety Alignment of Language Models via Latent Personality Traits Efficient Adversarial Training in LLMs with Continuous Attacks

Reference 49

Resolution
verified exact
local_arxiv, observed 2026-07-10T15:27:20.099694Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-07-10T15:26:23.290009Z digest=sha256:bae0db6339cf62da07a0705cbddcae559ff0ddc6d60a0c48603c56feb599a7e7

Observation 4fcc0c92-4f51-4d48-8286-1232dd0c9bf7 · outbound

This paper cites Bullying the Machine: How Personas Increase LLM Vulnerability.

Efficient Safety Alignment of Language Models via Latent Personality Traits Bullying the Machine: How Personas Increase LLM Vulnerability

Reference 50

Resolution
metadata mismatch
local_arxiv, observed 2026-07-10T15:27:20.026952Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-07-10T15:26:23.290009Z digest=sha256:a48b0bca4664d0f9aff664858117f24cd95e0f5db49f3b30135cabd6c82c55ac

Observation 5082985f-e678-4227-bf83-8b5b129af0f0 · outbound

This paper cites Qwen3 Technical Report.

Efficient Safety Alignment of Language Models via Latent Personality Traits Qwen3 Technical Report

Reference 51

Resolution
verified exact
local_arxiv, observed 2026-07-10T15:27:20.120641Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-07-10T15:26:23.290009Z digest=sha256:39dda7db0febf63aff6d5ace04675e33c273cb313243f9d4c08d6c146b253401

Observation ee1a0b98-dd8a-45a9-b9d0-7bf12bcd306d · outbound

This paper cites Latent-space adversarial training with post-aware calibration for defending large language models against jailbreak attacks.

Efficient Safety Alignment of Language Models via Latent Personality Traits Latent-space adversarial training with post-aware calibration for defending large language models against jailbreak attacks

Reference 52

Resolution
verified exact
local_arxiv, observed 2026-07-10T15:27:20.107446Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-07-10T15:26:23.290009Z digest=sha256:bbeddd0fd6eeab4ba0b5c8760c17238795844a330aa1ffb40e0a7833463c89d8

Observation 497d297c-1db3-4b2c-9383-ca0925800bd5 · outbound

This paper cites Robust LLM safeguarding via refusal feature adversarial training.

Efficient Safety Alignment of Language Models via Latent Personality Traits Robust LLM safeguarding via refusal feature adversarial training

Reference 53

Resolution
verified exact
local_arxiv, observed 2026-07-10T15:27:20.097245Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-07-10T15:26:23.290009Z digest=sha256:306ca74c6c25532a3a09cc117a690509434ec9f088607e71584f7a8ee00f047b

Observation 1b237e65-4076-4ba5-8819-f8306f54ed21 · outbound

This paper cites Coifman, and Ruoming Jin.

Efficient Safety Alignment of Language Models via Latent Personality Traits Coifman, and Ruoming Jin

Reference 54

Resolution
verified exact
arxiv_id, observed 2026-07-10T15:27:20.125753Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-07-10T15:26:23.290009Z digest=sha256:1786a1915eed3a7fba572ae98396530333fa4a1958b3b4b74f875f388fee3a47

Observation 0e0a87bf-c2cc-485f-97a2-956954b61dcd · outbound

This paper cites Personality Alignment of Large Language Models.

Efficient Safety Alignment of Language Models via Latent Personality Traits Personality Alignment of Large Language Models

Reference 55

Resolution
verified exact
local_arxiv, observed 2026-07-10T15:27:20.128335Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-07-10T15:26:23.290009Z digest=sha256:0c9fcae32d0a8e58d2ab984bc539c9385ee05c1cbf58a2fb43a0c721eb1b4527

Observation b64926a1-9fdf-47c1-a36b-38a2ef3998b2 · outbound

This paper cites Universal and Transferable Adversarial Attacks on Aligned Language Models.

Efficient Safety Alignment of Language Models via Latent Personality Traits Universal and Transferable Adversarial Attacks on Aligned Language Models

Reference 56

Resolution
metadata mismatch
local_arxiv, observed 2026-07-10T15:27:20.084547Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-07-10T15:26:23.290009Z digest=sha256:d19a064a0b73308dba7ac697cf416d3830eb8a4180905e97dc36955d733db13d

Observation 3edfe9bd-0143-4ded-bd56-737dec0ccc61 · outbound

This paper cites Representation Engineering: A Top-Down Approach to AI Transparency.

Efficient Safety Alignment of Language Models via Latent Personality Traits Representation Engineering: A Top-Down Approach to AI Transparency

Reference 57

Resolution
metadata mismatch
local_arxiv, observed 2026-07-10T15:27:20.089446Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-07-10T15:26:23.290009Z digest=sha256:8ff1bd57b597802d4a2b1d2ba41f70e154507c9cf740ce0af9cf7d7ff5ccfe58

Pith citing papers

No inbound Pith citation observations are available.