{"as_of":"2026-08-14T15:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1de1c5b991a627c78d51f41d43c480b3faaaaffe03c66620b1279063564b7160","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-10T15:26:23.290009Z","state":"measured"},{"denominator":57,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":57,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.07918/citation-record","integrity":"/paper/2607.07918/integrity","json":"/paper/2607.07918/citation-record.json","paper":"/paper/2607.07918"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T15:27:20.221171Z","title":"Barrick and Michael K","venue":null,"work_id":"7ef63af1-1e59-4c2b-a9e5-5500a46f6db8","year":1991},"citing_paper":{"arxiv_id":"2607.07918","last_updated":"2026-07-08T21:03:27Z","snapshot_observed_at":"2026-08-12T12:28:45.728193Z","submitted_at":"2026-07-08T21:03:27Z","title":"Efficient Safety Alignment of Language Models via Latent Personality Traits","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-07-10T15:26:23.290009Z"},"links":{"citing_paper":"/paper/2607.07918"},"observation_digest":"sha256:a024dd885335c1ea6711f8ed046509917f3d5252b24ee4d1f941de4f170dfef9","observation_id":"821096e3-a873-4fe4-8478-c3123d7b18a2","resolution":{"observed_at":"2026-07-10T15:27:20.222371Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1038/s41586-025-09937-5","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emergent Misalignment : Narrow finetuning can produce broadly misaligned LLMs","venue":"Nature","work_id":"4c08e462-6101-4261-b7dc-0c965156a549","year":2026},"citing_paper":{"arxiv_id":"2607.07918","last_updated":"2026-07-08T21:03:27Z","snapshot_observed_at":"2026-08-12T12:28:45.728193Z","submitted_at":"2026-07-08T21:03:27Z","title":"Efficient Safety Alignment of Language Models via Latent Personality Traits","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-07-10T15:26:23.290009Z"},"links":{"citing_paper":"/paper/2607.07918"},"observation_digest":"sha256:71160d13f540f40acf3748d0eae4b2228c3b33f6bb19255b81f27993d7516a2c","observation_id":"a30391ca-3121-4b77-9a16-ddb254bec8d4","resolution":{"observed_at":"2026-07-10T15:27:19.829623Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-12T01:20:08.812337+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T01:20:08.812337+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16222","last_updated":"2025-05-30T11:02:54Z","snapshot_observed_at":"2026-08-12T22:18:19.821562Z","submitted_at":"2024-10-21T17:27:01Z","title":"An Interpretable N-gram Perplexity Threat Model for Large Language Model Jailbreaks","version":2},"cited_work":{"arxiv_id":"2410.16222","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.16222","snapshot_observed_at":"2026-07-10T15:27:20.103276Z","title":"A realistic threat model for large language model jailbreaks","venue":"cs.LG","work_id":"f818dce6-9d80-4578-ba3f-2b109db8af97","year":2024},"citing_paper":{"arxiv_id":"2607.07918","last_updated":"2026-07-08T21:03:27Z","snapshot_observed_at":"2026-08-12T12:28:45.728193Z","submitted_at":"2026-07-08T21:03:27Z","title":"Efficient Safety Alignment of Language Models via Latent Personality Traits","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-07-10T15:26:23.290009Z"},"links":{"cited_paper":"/paper/2410.16222","citing_paper":"/paper/2607.07918"},"observation_digest":"sha256:e5d03af2a8b1d56fdece55816bb582204d24a57690f085397aa96129ede2849d","observation_id":"749af3db-bdfd-403d-bc3d-8ffabca8fdd1","resolution":{"observed_at":"2026-07-10T15:27:20.104514Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05030","last_updated":"2025-07-29T09:44:14Z","snapshot_observed_at":"2026-08-14T03:13:05.686604Z","submitted_at":"2024-03-08T04:22:48Z","title":"Defending Against Unforeseen Failure Modes with Latent Adversarial Training","version":6},"cited_work":{"arxiv_id":"2403.05030","doi":"10.48550/arxiv.2403.05030","metadata_source":"pith","pith_arxiv_id":"2403.05030","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ArXiv:2403.05030 [cs]","venue":"cs.CR","work_id":"3e4211ab-52f4-4fea-b65a-b27c3c092134","year":2024},"citing_paper":{"arxiv_id":"2607.07918","last_updated":"2026-07-08T21:03:27Z","snapshot_observed_at":"2026-08-12T12:28:45.728193Z","submitted_at":"2026-07-08T21:03:27Z","title":"Efficient Safety Alignment of Language Models via Latent Personality Traits","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-07-10T15:26:23.290009Z"},"links":{"cited_paper":"/paper/2403.05030","citing_paper":"/paper/2607.07918"},"observation_digest":"sha256:70ec78d4d345f525b0869e0937abbff0063bbcda375f6e257e725de185e890d3","observation_id":"20bea938-25bf-41aa-80d9-488db14c226a","resolution":{"observed_at":"2026-07-10T15:27:20.040662Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08419","last_updated":"2024-07-18T18:24:57Z","snapshot_observed_at":"2026-08-12T12:29:45.113982Z","submitted_at":"2023-10-12T15:38:28Z","title":"Jailbreaking Black Box Large Language Models in Twenty Queries","version":4},"cited_work":{"arxiv_id":"2310.08419","doi":"10.48550/arxiv.2310.08419","metadata_source":"pith","pith_arxiv_id":"2310.08419","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Jailbreaking Black Box Large Language Models in Twenty Queries","venue":"cs.LG","work_id":"38678cda-6595-4ca3-916b-066c00cce063","year":2023},"citing_paper":{"arxiv_id":"2607.07918","last_updated":"2026-07-08T21:03:27Z","snapshot_observed_at":"2026-08-12T12:28:45.728193Z","submitted_at":"2026-07-08T21:03:27Z","title":"Efficient Safety Alignment of Language Models via Latent Personality Traits","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-07-10T15:26:23.290009Z"},"links":{"cited_paper":"/paper/2310.08419","citing_paper":"/paper/2607.07918"},"observation_digest":"sha256:9bd08e4612174f88185ffff32af0dec577d51508aefa225f2c4fec8187e44cbd","observation_id":"25068ab6-9db4-44a4-a01e-1714c56d97b2","resolution":{"observed_at":"2026-07-10T15:27:20.123049Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-05-24T00:53:06.618013+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T00:53:06.618013+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21509","last_updated":"2025-09-05T07:44:31Z","snapshot_observed_at":"2026-08-09T05:08:13.935849Z","submitted_at":"2025-07-29T05:20:14Z","title":"Persona Vectors: Monitoring and Controlling Character Traits in Language Models","version":3},"cited_work":{"arxiv_id":"2507.21509","doi":"10.48550/arxiv.2507.21509","metadata_source":"pith","pith_arxiv_id":"2507.21509","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Persona Vectors: Monitoring and Controlling Character Traits in Language Models","venue":"cs.CL","work_id":"cf32dbef-9132-4648-abcb-0ebf3ac3af80","year":2025},"citing_paper":{"arxiv_id":"2607.07918","last_updated":"2026-07-08T21:03:27Z","snapshot_observed_at":"2026-08-12T12:28:45.728193Z","submitted_at":"2026-07-08T21:03:27Z","title":"Efficient Safety Alignment of Language Models via Latent Personality Traits","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-07-10T15:26:23.290009Z"},"links":{"cited_paper":"/paper/2507.21509","citing_paper":"/paper/2607.07918"},"observation_digest":"sha256:b7acc964bb190b425a849b677b3b394f7cd5a79caf1a6aa5554083fd146e5bf3","observation_id":"06da8fcd-fc02-4741-b04e-e45733d52699","resolution":{"observed_at":"2026-07-10T15:27:20.079398Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-13T23:49:54.586724+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T23:49:54.586724+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.03741","last_updated":"2023-02-17T17:00:34Z","snapshot_observed_at":"2026-08-12T12:29:44.507445Z","submitted_at":"2017-06-12T17:23:59Z","title":"Deep reinforcement learning from human preferences","version":4},"cited_work":{"arxiv_id":"1706.03741","doi":"10.48550/arxiv.1706.03741","metadata_source":"pith","pith_arxiv_id":"1706.03741","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Deep reinforcement learning from human preferences","venue":"stat.ML","work_id":"95b596b9-4880-42ad-ac79-570a3a8a9dee","year":2017},"citing_paper":{"arxiv_id":"2607.07918","last_updated":"2026-07-08T21:03:27Z","snapshot_observed_at":"2026-08-12T12:28:45.728193Z","submitted_at":"2026-07-08T21:03:27Z","title":"Efficient Safety Alignment of Language Models via Latent Personality Traits","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-07-10T15:26:23.290009Z"},"links":{"cited_paper":"/paper/1706.03741","citing_paper":"/paper/2607.07918"},"observation_digest":"sha256:6dba0f9d25bef5fa27af59b13607f9f9d1d6c0ef556148290f1e6d26f074d676","observation_id":"240ccd28-d064-4a20-8c33-dbedea12db84","resolution":{"observed_at":"2026-07-10T15:27:20.102093Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":"2110.14168","doi":"10.1002/j.1545-","metadata_source":"pith","pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Training Verifiers to Solve Math Word Problems","venue":"cs.LG","work_id":"acab1aa8-b4d6-40e0-a3ee-25341701dca2","year":2021},"citing_paper":{"arxiv_id":"2607.07918","last_updated":"2026-07-08T21:03:27Z","snapshot_observed_at":"2026-08-12T12:28:45.728193Z","submitted_at":"2026-07-08T21:03:27Z","title":"Efficient Safety Alignment of Language Models via Latent Personality Traits","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-07-10T15:26:23.290009Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2607.07918"},"observation_digest":"sha256:bbe459d08771f7b67501dbfa81e333c6dbfdc323df365f2dadb0c38956ab3040","observation_id":"f8736ea1-80aa-42a2-b24a-850c7505c59c","resolution":{"observed_at":"2026-07-10T15:27:20.038037Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20947","last_updated":"2025-06-15T21:44:25Z","snapshot_observed_at":"2026-08-12T23:53:16.785416Z","submitted_at":"2024-05-31T15:44:33Z","title":"OR-Bench: An Over-Refusal Benchmark for Large Language Models","version":5},"cited_work":{"arxiv_id":"2405.20947","doi":"10.48550/arxiv.2405.20947","metadata_source":"pith","pith_arxiv_id":"2405.20947","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OR- Bench: An over-refusal benchmark for large language models","venue":"cs.CL","work_id":"5dc76f29-8555-4005-954c-6e085345fc2f","year":2024},"citing_paper":{"arxiv_id":"2607.07918","last_updated":"2026-07-08T21:03:27Z","snapshot_observed_at":"2026-08-12T12:28:45.728193Z","submitted_at":"2026-07-08T21:03:27Z","title":"Efficient Safety Alignment of Language Models via Latent Personality Traits","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-07-10T15:26:23.290009Z"},"links":{"cited_paper":"/paper/2405.20947","citing_paper":"/paper/2607.07918"},"observation_digest":"sha256:193fc901545df4605eed32411b4d8eb0e77040c342858513a0aca84bd519a7cc","observation_id":"7dfadebb-76e8-40ed-b95f-16bce40796b8","resolution":{"observed_at":"2026-07-10T15:27:20.069606Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"0237.2015","doi":"10.1080/14330237.2015.1124603","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"du Plessis and Gideon P","venue":"Journal of Psychology in Africa","work_id":"092a0b98-d23c-48da-a9ec-d4b4acdbce1d","year":2015},"citing_paper":{"arxiv_id":"2607.07918","last_updated":"2026-07-08T21:03:27Z","snapshot_observed_at":"2026-08-12T12:28:45.728193Z","submitted_at":"2026-07-08T21:03:27Z","title":"Efficient Safety Alignment of Language Models via Latent Personality Traits","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-07-10T15:26:23.290009Z"},"links":{"citing_paper":"/paper/2607.07918"},"observation_digest":"sha256:eea1286f7f81cea6a92c15ab13c31d63a39efac11f95e0e97dbf90287b17c372","observation_id":"49b741f9-7b42-4a6d-93d5-dd136354a5fa","resolution":{"observed_at":"2026-07-10T15:27:19.823397Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.16332","doi":"10.48550/arxiv.2509.16332","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Psychometric personality shaping modulates capabilities and safety in language models, 2025","venue":"ArXiv.org","work_id":"91bf3e80-7e6e-479c-843f-d184c499e146","year":2025},"citing_paper":{"arxiv_id":"2607.07918","last_updated":"2026-07-08T21:03:27Z","snapshot_observed_at":"2026-08-12T12:28:45.728193Z","submitted_at":"2026-07-08T21:03:27Z","title":"Efficient Safety Alignment of Language Models via Latent Personality Traits","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-07-10T15:26:23.290009Z"},"links":{"citing_paper":"/paper/2607.07918"},"observation_digest":"sha256:1ca70ec86ee85580a4afbc7f38afaa14a13affc31cf556622818c7c958c8a9db","observation_id":"80ae4665-bb36-466d-88e6-49e455d713df","resolution":{"observed_at":"2026-07-10T15:27:20.115469Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T15:27:20.226986Z","title":null,"venue":null,"work_id":"0bf8b967-d009-4ca1-bdb9-8f5e66ff9c04","year":1999},"citing_paper":{"arxiv_id":"2607.07918","last_updated":"2026-07-08T21:03:27Z","snapshot_observed_at":"2026-08-12T12:28:45.728193Z","submitted_at":"2026-07-08T21:03:27Z","title":"Efficient Safety Alignment of Language Models via Latent Personality Traits","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-07-10T15:26:23.290009Z"},"links":{"citing_paper":"/paper/2607.07918"},"observation_digest":"sha256:87b339c507b5d641a982fe0f5949976b409473de578489490c78d5e88503587d","observation_id":"4177629c-db75-4ca3-a86e-f165a8fabbe7","resolution":{"observed_at":"2026-07-10T15:27:20.228177Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T15:27:20.217261Z","title":"Goldberg, John A","venue":null,"work_id":"7a2254d7-ba2c-415f-9836-d1c0a5ce8800","year":2006},"citing_paper":{"arxiv_id":"2607.07918","last_updated":"2026-07-08T21:03:27Z","snapshot_observed_at":"2026-08-12T12:28:45.728193Z","submitted_at":"2026-07-08T21:03:27Z","title":"Efficient Safety Alignment of Language Models via Latent Personality Traits","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-07-10T15:26:23.290009Z"},"links":{"citing_paper":"/paper/2607.07918"},"observation_digest":"sha256:02004fca137c6a1153660cea18ba7554e559c82a51494a7cac592a73a8ca81f4","observation_id":"abe71d70-2a2f-4db4-8acd-caf8cca14887","resolution":{"observed_at":"2026-07-10T15:27:20.218494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6572","last_updated":"2015-03-20T20:19:16Z","snapshot_observed_at":"2026-08-12T17:13:46.394331Z","submitted_at":"2014-12-20T01:17:12Z","title":"Explaining and Harnessing Adversarial Examples","version":3},"cited_work":{"arxiv_id":"1412.6572","doi":"10.48550/arxiv.1412.6572","metadata_source":"pith","pith_arxiv_id":"1412.6572","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Explaining and Harnessing Adversarial Examples","venue":"stat.ML","work_id":"2cedf8f6-7539-4c49-8136-f42a20487146","year":2014},"citing_paper":{"arxiv_id":"2607.07918","last_updated":"2026-07-08T21:03:27Z","snapshot_observed_at":"2026-08-12T12:28:45.728193Z","submitted_at":"2026-07-08T21:03:27Z","title":"Efficient Safety Alignment of Language Models via Latent Personality Traits","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-07-10T15:26:23.290009Z"},"links":{"cited_paper":"/paper/1412.6572","citing_paper":"/paper/2607.07918"},"observation_digest":"sha256:1a54d9606e164c9f3223159c3698c5cedea5a2c70d7dabcca9aa7ab1720dda9a","observation_id":"43dc32dc-55e5-489c-be48-115524d23508","resolution":{"observed_at":"2026-07-10T15:27:20.043042Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.08163","last_updated":"2024-01-02T23:00:41Z","snapshot_observed_at":"2026-08-13T10:13:12.306339Z","submitted_at":"2023-09-15T05:19:39Z","title":"Self-Assessment Tests are Unreliable Measures of LLM Personality","version":2},"cited_work":{"arxiv_id":"2309.08163","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.08163","snapshot_observed_at":"2026-07-10T15:27:20.052072Z","title":"Song, X","venue":"cs.CL","work_id":"d18d86fc-b1e3-4506-b122-f324ffb95bcf","year":2023},"citing_paper":{"arxiv_id":"2607.07918","last_updated":"2026-07-08T21:03:27Z","snapshot_observed_at":"2026-08-12T12:28:45.728193Z","submitted_at":"2026-07-08T21:03:27Z","title":"Efficient Safety Alignment of Language Models via Latent Personality Traits","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-07-10T15:26:23.290009Z"},"links":{"cited_paper":"/paper/2309.08163","citing_paper":"/paper/2607.07918"},"observation_digest":"sha256:afc00f9b397794b35a0c7643f393d5b7a575fa7ea2bff81be04b287c6bbd2069","observation_id":"71ccc23e-eeee-43dc-b525-196efe517bf7","resolution":{"observed_at":"2026-07-10T15:27:20.053262Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-13T20:44:28.824685Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":"2009.03300","doi":"10.48550/arxiv.2009.03300","metadata_source":"pith","pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring Massive Multitask Language Understanding","venue":"cs.CY","work_id":"e87ec49a-544b-4ec8-8991-75298c64ff5e","year":2020},"citing_paper":{"arxiv_id":"2607.07918","last_updated":"2026-07-08T21:03:27Z","snapshot_observed_at":"2026-08-12T12:28:45.728193Z","submitted_at":"2026-07-08T21:03:27Z","title":"Efficient Safety Alignment of Language Models via Latent Personality Traits","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-07-10T15:26:23.290009Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2607.07918"},"observation_digest":"sha256:663d7ebf8d8d0fe5ee0fe987509f74094f0d2174218ad9697119f83f1de7e2b1","observation_id":"060a4676-9620-4f43-913c-6f21d404f175","resolution":{"observed_at":"2026-07-10T15:27:20.064480Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-04T01:08:06.256034+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-04T01:08:06.256034+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T15:27:20.224961Z","title":"International personality item pool: Alphabetical list of items","venue":null,"work_id":"e143d448-66bf-45ef-be5c-ced077cc7fc2","year":2023},"citing_paper":{"arxiv_id":"2607.07918","last_updated":"2026-07-08T21:03:27Z","snapshot_observed_at":"2026-08-12T12:28:45.728193Z","submitted_at":"2026-07-08T21:03:27Z","title":"Efficient Safety Alignment of Language Models via Latent Personality Traits","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-07-10T15:26:23.290009Z"},"links":{"citing_paper":"/paper/2607.07918"},"observation_digest":"sha256:43f606cef5bbe2c0a14594cb1e1d5d2afd399f534faaa38bbe70c1535829f3f4","observation_id":"b47e93bf-14c4-4c01-82d8-55f57aa76a87","resolution":{"observed_at":"2026-07-10T15:27:20.226400Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10264","last_updated":"2024-08-21T15:12:37Z","snapshot_observed_at":"2026-08-14T14:28:33.560676Z","submitted_at":"2024-07-14T16:12:57Z","title":"What Makes and Breaks Safety Fine-tuning? A Mechanistic Study","version":3},"cited_work":{"arxiv_id":"2407.10264","doi":"10.48550/arxiv.2407.10264","metadata_source":"pith","pith_arxiv_id":"2407.10264","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"S., Oksuz, K., Joy, T., Torr, P","venue":"cs.LG","work_id":"1ffe48ac-067a-4dd4-9b52-3cda69baf0d7","year":2024},"citing_paper":{"arxiv_id":"2607.07918","last_updated":"2026-07-08T21:03:27Z","snapshot_observed_at":"2026-08-12T12:28:45.728193Z","submitted_at":"2026-07-08T21:03:27Z","title":"Efficient Safety Alignment of Language Models via Latent Personality Traits","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-07-10T15:26:23.290009Z"},"links":{"cited_paper":"/paper/2407.10264","citing_paper":"/paper/2607.07918"},"observation_digest":"sha256:ba2bc735bb7eba1111d40817f9d8077aab56cb669952e3491a3231c16a1243d2","observation_id":"0310fc50-cfa6-42f9-8f08-c536caf3c83e","resolution":{"observed_at":"2026-07-10T15:27:20.138378Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T15:27:20.219192Z","title":"Evaluating and inducing personality in pre-trained language models, 2022","venue":null,"work_id":"3ae98dc7-7586-4cd1-8d98-66a13ce70834","year":2022},"citing_paper":{"arxiv_id":"2607.07918","last_updated":"2026-07-08T21:03:27Z","snapshot_observed_at":"2026-08-12T12:28:45.728193Z","submitted_at":"2026-07-08T21:03:27Z","title":"Efficient Safety Alignment of Language Models via Latent Personality Traits","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-07-10T15:26:23.290009Z"},"links":{"citing_paper":"/paper/2607.07918"},"observation_digest":"sha256:20784da0d69065ca2824165fba9aa8d7c0e893a6f936857d4a8bec004385acbf","observation_id":"2a34e8c7-3430-419e-b6c3-9ef39e4abb87","resolution":{"observed_at":"2026-07-10T15:27:20.220585Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T15:27:20.223132Z","title":null,"venue":null,"work_id":"a68ff80c-509a-458f-89fe-2e1476243886","year":2017},"citing_paper":{"arxiv_id":"2607.07918","last_updated":"2026-07-08T21:03:27Z","snapshot_observed_at":"2026-08-12T12:28:45.728193Z","submitted_at":"2026-07-08T21:03:27Z","title":"Efficient Safety Alignment of Language Models via Latent Personality Traits","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-07-10T15:26:23.290009Z"},"links":{"citing_paper":"/paper/2607.07918"},"observation_digest":"sha256:c93a22c6772b53c640b1f784f26b07e918b93a9c1c2128d0a73aaf8fbc811e7f","observation_id":"22a05933-eb2e-4f28-8965-ab42590079a0","resolution":{"observed_at":"2026-07-10T15:27:20.224371Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10962","last_updated":"2024-07-25T18:58:51Z","snapshot_observed_at":"2026-08-13T04:19:31.675434Z","submitted_at":"2024-02-13T20:10:29Z","title":"Measuring and Controlling Instruction (In)Stability in Language Model Dialogs","version":4},"cited_work":{"arxiv_id":"2402.10962","doi":"10.48550/arxiv.2402.10962","metadata_source":"pith","pith_arxiv_id":"2402.10962","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring and controlling instruction (in) stability in language model dialogs","venue":"cs.CL","work_id":"6b9b65e1-c1e7-4156-a312-a8c6efdb0ae0","year":2024},"citing_paper":{"arxiv_id":"2607.07918","last_updated":"2026-07-08T21:03:27Z","snapshot_observed_at":"2026-08-12T12:28:45.728193Z","submitted_at":"2026-07-08T21:03:27Z","title":"Efficient Safety Alignment of Language Models via Latent Personality Traits","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-07-10T15:26:23.290009Z"},"links":{"cited_paper":"/paper/2402.10962","citing_paper":"/paper/2607.07918"},"observation_digest":"sha256:caf1fd5f8c648ffed3f5a32446b62b481949df7015fcedc889a2475b3577c6b0","observation_id":"3137c19b-a412-43d6-bdeb-21ae7688e461","resolution":{"observed_at":"2026-07-10T15:27:20.061878Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.07958","last_updated":"2022-05-08T02:43:02Z","snapshot_observed_at":"2026-08-03T16:26:48.747700Z","submitted_at":"2021-09-08T17:15:27Z","title":"TruthfulQA: Measuring How Models Mimic Human Falsehoods","version":2},"cited_work":{"arxiv_id":"2109.07958","doi":"10.48550/arxiv.2109.07958","metadata_source":"pith","pith_arxiv_id":"2109.07958","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"TruthfulQA: Measuring How Models Mimic Human Falsehoods","venue":"cs.CL","work_id":"22e3b047-a6e8-4c4c-b62e-173b545a1a45","year":2021},"citing_paper":{"arxiv_id":"2607.07918","last_updated":"2026-07-08T21:03:27Z","snapshot_observed_at":"2026-08-12T12:28:45.728193Z","submitted_at":"2026-07-08T21:03:27Z","title":"Efficient Safety Alignment of Language Models via Latent Personality Traits","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-07-10T15:26:23.290009Z"},"links":{"cited_paper":"/paper/2109.07958","citing_paper":"/paper/2607.07918"},"observation_digest":"sha256:18523e461561188d866bea8030631e653750f58b6d70e4c551236b0407dd765c","observation_id":"c8a8c345-c191-44ab-beff-db1957af4265","resolution":{"observed_at":"2026-07-10T15:27:20.072166Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-07T00:09:06.068721+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-07T00:09:06.068721+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04451","last_updated":"2024-03-20T21:34:56Z","snapshot_observed_at":"2026-08-06T02:57:30.438059Z","submitted_at":"2023-10-03T19:44:37Z","title":"AutoDAN: Generating Stealthy Jailbreak Prompts on Aligned Large Language Models","version":2},"cited_work":{"arxiv_id":"2310.04451","doi":"10.48550/arxiv.2310.04451","metadata_source":"pith","pith_arxiv_id":"2310.04451","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AutoDAN: Generating Stealthy Jailbreak Prompts on Aligned Large Language Models","venue":"cs.CL","work_id":"3b676de6-edef-4976-a8b5-082d4ff50867","year":2023},"citing_paper":{"arxiv_id":"2607.07918","last_updated":"2026-07-08T21:03:27Z","snapshot_observed_at":"2026-08-12T12:28:45.728193Z","submitted_at":"2026-07-08T21:03:27Z","title":"Efficient Safety Alignment of Language Models via Latent Personality Traits","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-07-10T15:26:23.290009Z"},"links":{"cited_paper":"/paper/2310.04451","citing_paper":"/paper/2607.07918"},"observation_digest":"sha256:27c20ea964c57e2b44c27aec9edc159da7dbc9565d000de84baf9713a2d1ed01","observation_id":"c767a605-2786-4fbf-bc53-ae930fd91568","resolution":{"observed_at":"2026-07-10T15:27:20.055777Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-05-23T04:52:41.614605+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T04:52:41.614605+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.10387","doi":"10.48550/arxiv.2601.10387","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv:2601.10387 [cs]","venue":"arXiv (Cornell University)","work_id":"cb9226dd-27b3-4ea2-a247-438bc657c018","year":2024},"citing_paper":{"arxiv_id":"2607.07918","last_updated":"2026-07-08T21:03:27Z","snapshot_observed_at":"2026-08-12T12:28:45.728193Z","submitted_at":"2026-07-08T21:03:27Z","title":"Efficient Safety Alignment of Language Models via Latent Personality Traits","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-07-10T15:26:23.290009Z"},"links":{"citing_paper":"/paper/2607.07918"},"observation_digest":"sha256:04ea2a76020bda269bd3c3a7aae1ce87c1f74d7f0ac4b3b12b8c32d77e1438bb","observation_id":"98b70c22-b2b1-4f3e-bd68-3c973054c2f5","resolution":{"observed_at":"2026-07-10T15:27:20.112632Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-11T02:19:01.270108+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T02:19:01.270108+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.09833","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T15:27:20.022748Z","title":"Stable and explainable personality trait evaluation in large language models with internal activations, 2026","venue":null,"work_id":"4c6a7184-34ab-4728-b7ed-3913fab324a4","year":2026},"citing_paper":{"arxiv_id":"2607.07918","last_updated":"2026-07-08T21:03:27Z","snapshot_observed_at":"2026-08-12T12:28:45.728193Z","submitted_at":"2026-07-08T21:03:27Z","title":"Efficient Safety Alignment of Language Models via Latent Personality Traits","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-07-10T15:26:23.290009Z"},"links":{"citing_paper":"/paper/2607.07918"},"observation_digest":"sha256:b741ba9207c680e275100472ac3d2cd2265b271cf2846790791c451edccb45c6","observation_id":"11766f72-aa03-40f3-a89b-79430d42efe4","resolution":{"observed_at":"2026-07-10T15:27:20.024345Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04249","last_updated":"2024-02-27T04:43:08Z","snapshot_observed_at":"2026-07-06T17:26:23.067923Z","submitted_at":"2024-02-06T18:59:08Z","title":"HarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Robust Refusal","version":2},"cited_work":{"arxiv_id":"2402.04249","doi":"10.48550/arxiv.2402.04249","metadata_source":"pith","pith_arxiv_id":"2402.04249","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Robust Refusal","venue":"cs.LG","work_id":"b0b0303f-2444-4789-a979-8153624312ff","year":2024},"citing_paper":{"arxiv_id":"2607.07918","last_updated":"2026-07-08T21:03:27Z","snapshot_observed_at":"2026-08-12T12:28:45.728193Z","submitted_at":"2026-07-08T21:03:27Z","title":"Efficient Safety Alignment of Language Models via Latent Personality Traits","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-07-10T15:26:23.290009Z"},"links":{"cited_paper":"/paper/2402.04249","citing_paper":"/paper/2607.07918"},"observation_digest":"sha256:25a5fdba883f8748c92dd1911a42dca8368fd694d812e59eea35af37a1ab40f0","observation_id":"fe6c7a1a-57e5-4e9b-b146-7ec5e82f72fa","resolution":{"observed_at":"2026-07-10T15:27:20.029931Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02119","last_updated":"2024-10-31T15:57:42Z","snapshot_observed_at":"2026-08-14T06:54:18.196537Z","submitted_at":"2023-12-04T18:49:23Z","title":"Tree of Attacks: Jailbreaking Black-Box LLMs Automatically","version":3},"cited_work":{"arxiv_id":"2312.02119","doi":"10.48550/arxiv.2312.02119","metadata_source":"pith","pith_arxiv_id":"2312.02119","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tree of attacks: Jailbreaking black-box llms automatically","venue":"cs.LG","work_id":"21743458-a817-448a-b77b-559e707b5030","year":2023},"citing_paper":{"arxiv_id":"2607.07918","last_updated":"2026-07-08T21:03:27Z","snapshot_observed_at":"2026-08-12T12:28:45.728193Z","submitted_at":"2026-07-08T21:03:27Z","title":"Efficient Safety Alignment of Language Models via Latent Personality Traits","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-07-10T15:26:23.290009Z"},"links":{"cited_paper":"/paper/2312.02119","citing_paper":"/paper/2607.07918"},"observation_digest":"sha256:00600986bfdb54e2a0ee6f2642951be59cea4759fde27cfc518d38240bce849c","observation_id":"90b7e137-a4eb-4bad-978e-f8fd6343c4da","resolution":{"observed_at":"2026-07-10T15:27:20.048423Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-05-24T00:53:06.257775+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T00:53:06.257775+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02155","last_updated":"2022-03-04T07:04:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-04T07:04:42Z","title":"Training language models to follow instructions with human feedback","version":1},"cited_work":{"arxiv_id":"2203.02155","doi":"10.1007/s00354-022-00198-8","metadata_source":"pith","pith_arxiv_id":"2203.02155","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Training language models to follow instructions with human feedback","venue":"cs.CL","work_id":"52aff42f-4fa9-4fcf-bdb3-1459b9bebf65","year":2022},"citing_paper":{"arxiv_id":"2607.07918","last_updated":"2026-07-08T21:03:27Z","snapshot_observed_at":"2026-08-12T12:28:45.728193Z","submitted_at":"2026-07-08T21:03:27Z","title":"Efficient Safety Alignment of Language Models via Latent Personality Traits","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-07-10T15:26:23.290009Z"},"links":{"cited_paper":"/paper/2203.02155","citing_paper":"/paper/2607.07918"},"observation_digest":"sha256:6457c02a833af5ff88037af0909c94e59103edc6ff70238641b3faa77877bc01","observation_id":"31fd26ec-c5a2-4b85-86c8-ce625b437b9a","resolution":{"observed_at":"2026-07-10T15:27:20.077046Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T15:27:20.228755Z","title":null,"venue":null,"work_id":"8bbd63ec-805d-4d40-b87f-3db7f01cbe79","year":2024},"citing_paper":{"arxiv_id":"2607.07918","last_updated":"2026-07-08T21:03:27Z","snapshot_observed_at":"2026-08-12T12:28:45.728193Z","submitted_at":"2026-07-08T21:03:27Z","title":"Efficient Safety Alignment of Language Models via Latent Personality Traits","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-07-10T15:26:23.290009Z"},"links":{"citing_paper":"/paper/2607.07918"},"observation_digest":"sha256:8a40c5c45d3fa7c57ce75cafd150f1b2b434efff23c8b75bd1c4b4e65d805c18","observation_id":"73398e14-ad66-402f-8385-039860e29775","resolution":{"observed_at":"2026-07-10T15:27:20.229885Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.06031","last_updated":"2016-06-20T09:37:17Z","snapshot_observed_at":"2026-08-10T23:14:34.195361Z","submitted_at":"2016-06-20T09:37:17Z","title":"The LAMBADA dataset: Word prediction requiring a broad discourse context","version":1},"cited_work":{"arxiv_id":"1606.06031","doi":null,"metadata_source":"pith","pith_arxiv_id":"1606.06031","snapshot_observed_at":"2026-07-10T15:27:20.134743Z","title":"The LAMBADA dataset: Word prediction requiring a broad discourse context","venue":"cs.CL","work_id":"3775e6d1-2f28-4791-82a9-538c0507512c","year":2016},"citing_paper":{"arxiv_id":"2607.07918","last_updated":"2026-07-08T21:03:27Z","snapshot_observed_at":"2026-08-12T12:28:45.728193Z","submitted_at":"2026-07-08T21:03:27Z","title":"Efficient Safety Alignment of Language Models via Latent Personality Traits","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-07-10T15:26:23.290009Z"},"links":{"cited_paper":"/paper/1606.06031","citing_paper":"/paper/2607.07918"},"observation_digest":"sha256:69566959baabfd3fa71d0731fd1b6fbcc8a4b5dadcfd2e84100e4eb428e6828e","observation_id":"4c5dd018-3fd8-4e9f-a1d1-6e7658c60902","resolution":{"observed_at":"2026-07-10T15:27:20.135943Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16873","last_updated":"2025-06-02T18:59:01Z","snapshot_observed_at":"2026-08-13T00:25:07.154522Z","submitted_at":"2024-04-21T22:18:13Z","title":"AdvPrompter: Fast Adaptive Adversarial Prompting for LLMs","version":2},"cited_work":{"arxiv_id":"2404.16873","doi":"10.48550/arxiv.2404.16873","metadata_source":"pith","pith_arxiv_id":"2404.16873","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2404.16873 (2024)","venue":"cs.CR","work_id":"162cd8d7-72c1-4741-804d-acd0126638ee","year":2024},"citing_paper":{"arxiv_id":"2607.07918","last_updated":"2026-07-08T21:03:27Z","snapshot_observed_at":"2026-08-12T12:28:45.728193Z","submitted_at":"2026-07-08T21:03:27Z","title":"Efficient Safety Alignment of Language Models via Latent Personality Traits","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-07-10T15:26:23.290009Z"},"links":{"cited_paper":"/paper/2404.16873","citing_paper":"/paper/2607.07918"},"observation_digest":"sha256:c67c8a1d69184b826ac149d21c8515999e187f6898e4c73debb160caff166703","observation_id":"1954f2f3-4241-4142-a245-fcda157ab2f7","resolution":{"observed_at":"2026-07-10T15:27:20.109933Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T15:27:20.215139Z","title":"Lechner, Claudia Wagner, Beatrice Rammstedt, and Markus Strohmaier","venue":null,"work_id":"6ad1b5f0-21f6-4bfd-9b68-b26a32c1a674","year":2023},"citing_paper":{"arxiv_id":"2607.07918","last_updated":"2026-07-08T21:03:27Z","snapshot_observed_at":"2026-08-12T12:28:45.728193Z","submitted_at":"2026-07-08T21:03:27Z","title":"Efficient Safety Alignment of Language Models via Latent Personality Traits","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-07-10T15:26:23.290009Z"},"links":{"citing_paper":"/paper/2607.07918"},"observation_digest":"sha256:28951c5484aafbffd4578d514b9b6f6de219884b7c76f8c43f6a2ccff5b017b3","observation_id":"57f8316b-b701-45a6-8c74-ddc6f9191298","resolution":{"observed_at":"2026-07-10T15:27:20.216683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.03286","last_updated":"2022-02-07T15:22:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-07T15:22:17Z","title":"Red Teaming Language Models with Language Models","version":1},"cited_work":{"arxiv_id":"2202.03286","doi":"10.48550/arxiv.2202.03286","metadata_source":"pith","pith_arxiv_id":"2202.03286","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Red Teaming Language Models with Language Models","venue":"cs.CL","work_id":"d1274c54-508f-42f9-aeb3-91db13f3a622","year":2022},"citing_paper":{"arxiv_id":"2607.07918","last_updated":"2026-07-08T21:03:27Z","snapshot_observed_at":"2026-08-12T12:28:45.728193Z","submitted_at":"2026-07-08T21:03:27Z","title":"Efficient Safety Alignment of Language Models via Latent Personality Traits","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-07-10T15:26:23.290009Z"},"links":{"cited_paper":"/paper/2202.03286","citing_paper":"/paper/2607.07918"},"observation_digest":"sha256:a73e514f989b40642c605c9effdd01944ea07918b231b0c510301aef146a0614","observation_id":"6487dcc1-2ac4-4d81-8c13-60b2dc6d995a","resolution":{"observed_at":"2026-07-10T15:27:20.117846Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14992","last_updated":"2024-05-26T22:27:23Z","snapshot_observed_at":"2026-08-14T07:50:45.743715Z","submitted_at":"2024-02-22T22:05:23Z","title":"tinyBenchmarks: evaluating LLMs with fewer examples","version":2},"cited_work":{"arxiv_id":"2402.14992","doi":"10.48550/arxiv.2402.14992","metadata_source":"pith","pith_arxiv_id":"2402.14992","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"David Rein, Betty Li Hou, Asa Cooper Stickland, Jack- son Petty, Richard Yuanzhe Pang, Julien Dirani, Ju- lian Michael, and Samuel R Bowman","venue":"cs.CL","work_id":"1aaa40b4-1321-4f79-85a8-e296eaa2b732","year":2024},"citing_paper":{"arxiv_id":"2607.07918","last_updated":"2026-07-08T21:03:27Z","snapshot_observed_at":"2026-08-12T12:28:45.728193Z","submitted_at":"2026-07-08T21:03:27Z","title":"Efficient Safety Alignment of Language Models via Latent Personality Traits","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-07-10T15:26:23.290009Z"},"links":{"cited_paper":"/paper/2402.14992","citing_paper":"/paper/2607.07918"},"observation_digest":"sha256:04e205310f1cc2ecca20f89121fd20b396c0033ede604cf3896b1686f2ab8a17","observation_id":"4503ec75-b14e-4b7c-b05f-561353a21df0","resolution":{"observed_at":"2026-07-10T15:27:20.086993Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2408.10943","doi":"10.48550/arxiv.2408.10943","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InProceed- ings of the 32nd International Conference on Neu- ral Information Processing Systems, NIPS’18, page 5732–5741, Red Hook, NY , USA","venue":"arXiv (Cornell University)","work_id":"965fd473-f85f-4918-8044-967ac67f8a3a","year":2024},"citing_paper":{"arxiv_id":"2607.07918","last_updated":"2026-07-08T21:03:27Z","snapshot_observed_at":"2026-08-12T12:28:45.728193Z","submitted_at":"2026-07-08T21:03:27Z","title":"Efficient Safety Alignment of Language Models via Latent Personality Traits","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-07-10T15:26:23.290009Z"},"links":{"citing_paper":"/paper/2607.07918"},"observation_digest":"sha256:486de2764807629b68a9822fa9bda388b95b9d491bb9fdf245dbc028fd97ae0c","observation_id":"23b57278-cdf1-4e03-8c8a-03309603984e","resolution":{"observed_at":"2026-07-10T15:27:20.082057Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02260","last_updated":"2026-06-02T17:48:48Z","snapshot_observed_at":"2026-08-12T14:47:41.023865Z","submitted_at":"2025-02-04T12:17:08Z","title":"Position: Adversarial ML for LLMs Is Not Making Any Progress","version":2},"cited_work":{"arxiv_id":"2502.02260","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.02260","snapshot_observed_at":"2026-07-10T15:27:20.073365Z","title":"Adversarial ml problems are getting harder to solve and to evaluate","venue":"cs.LG","work_id":"dabf0840-1c9f-4836-8696-965c288bf6f9","year":2025},"citing_paper":{"arxiv_id":"2607.07918","last_updated":"2026-07-08T21:03:27Z","snapshot_observed_at":"2026-08-12T12:28:45.728193Z","submitted_at":"2026-07-08T21:03:27Z","title":"Efficient Safety Alignment of Language Models via Latent Personality Traits","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-07-10T15:26:23.290009Z"},"links":{"cited_paper":"/paper/2502.02260","citing_paper":"/paper/2607.07918"},"observation_digest":"sha256:b579b62fde8b6ab8c9ef1ce3696e9acb36306fca084f001ad40e48325760dc8f","observation_id":"a07e89c1-7bdf-487e-92ba-ee7b96d14961","resolution":{"observed_at":"2026-07-10T15:27:20.074506Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.03729","last_updated":"2024-04-01T20:56:11Z","snapshot_observed_at":"2026-08-13T04:47:30.687425Z","submitted_at":"2024-01-08T08:28:08Z","title":"The Butterfly Effect of Altering Prompts: How Small Changes and Jailbreaks Affect Large Language Model Performance","version":3},"cited_work":{"arxiv_id":"2401.03729","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.03729","snapshot_observed_at":"2026-07-10T15:27:20.049648Z","title":"The butterfly effect of altering prompts: How small changes and jailbreaks affect large language model performance.arXiv preprint arXiv:2401.03729","venue":"cs.CL","work_id":"150a45e5-3469-496b-b2f3-50ce7822e435","year":2024},"citing_paper":{"arxiv_id":"2607.07918","last_updated":"2026-07-08T21:03:27Z","snapshot_observed_at":"2026-08-12T12:28:45.728193Z","submitted_at":"2026-07-08T21:03:27Z","title":"Efficient Safety Alignment of Language Models via Latent Personality Traits","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-07-10T15:26:23.290009Z"},"links":{"cited_paper":"/paper/2401.03729","citing_paper":"/paper/2607.07918"},"observation_digest":"sha256:7c78369d86f07ed6166b65f43b6dedf976cdabaaba97ac529ff780b990777da0","observation_id":"022ce466-ebc4-422d-833a-d5511697f8f2","resolution":{"observed_at":"2026-07-10T15:27:20.050919Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16822","last_updated":"2024-12-11T18:07:25Z","snapshot_observed_at":"2026-08-13T04:09:48.076759Z","submitted_at":"2024-02-26T18:47:27Z","title":"Rainbow Teaming: Open-Ended Generation of Diverse Adversarial Prompts","version":3},"cited_work":{"arxiv_id":"2402.16822","doi":"10.48550/arxiv.2402.16822","metadata_source":"pith","pith_arxiv_id":"2402.16822","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Raparthy, Andrei Lupu, Eric Hambro, Aram H","venue":"cs.CL","work_id":"d6939128-25f0-4e03-8c04-3dd198db6a8e","year":2024},"citing_paper":{"arxiv_id":"2607.07918","last_updated":"2026-07-08T21:03:27Z","snapshot_observed_at":"2026-08-12T12:28:45.728193Z","submitted_at":"2026-07-08T21:03:27Z","title":"Efficient Safety Alignment of Language Models via Latent Personality Traits","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-07-10T15:26:23.290009Z"},"links":{"cited_paper":"/paper/2402.16822","citing_paper":"/paper/2607.07918"},"observation_digest":"sha256:f8d122960aa67f62e9ad804dbe30c5f7c096665a94b92e068ba3ec29d4857327","observation_id":"0a34a515-b193-45e0-8450-b95ee5182d2e","resolution":{"observed_at":"2026-07-10T15:27:20.032546Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.06594","doi":"10.48550/arxiv.2603.06594","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A coin flip for safety: Llm judges fail to reliably measure adversarial robustness","venue":"Open MIND","work_id":"0da42eee-de62-4206-92c6-5f011c471ead","year":2026},"citing_paper":{"arxiv_id":"2607.07918","last_updated":"2026-07-08T21:03:27Z","snapshot_observed_at":"2026-08-12T12:28:45.728193Z","submitted_at":"2026-07-08T21:03:27Z","title":"Efficient Safety Alignment of Language Models via Latent Personality Traits","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-07-10T15:26:23.290009Z"},"links":{"citing_paper":"/paper/2607.07918"},"observation_digest":"sha256:0dc794b8a01c04b45cb449738d5705973e929344394463e49d277b3d9d14cf1f","observation_id":"e23e69b8-bef5-44b2-a51a-8e2cd5902916","resolution":{"observed_at":"2026-07-10T15:27:20.059212Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"cited_work":{"arxiv_id":"2310.11324","doi":"10.1109/cdc57313.2025.11312997","metadata_source":"pith","pith_arxiv_id":"2310.11324","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","venue":"cs.CL","work_id":"c3e484df-e654-4146-8c4e-a16ca850afc7","year":2023},"citing_paper":{"arxiv_id":"2607.07918","last_updated":"2026-07-08T21:03:27Z","snapshot_observed_at":"2026-08-12T12:28:45.728193Z","submitted_at":"2026-07-08T21:03:27Z","title":"Efficient Safety Alignment of Language Models via Latent Personality Traits","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-07-10T15:26:23.290009Z"},"links":{"cited_paper":"/paper/2310.11324","citing_paper":"/paper/2607.07918"},"observation_digest":"sha256:165c2e703bb6cbedae49f473681f97287bbf5b878a0c26a4ed9113a1703697c5","observation_id":"e8aa52b9-50b7-4857-ba42-2e5c7aaf4568","resolution":{"observed_at":"2026-07-10T15:27:20.131028Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T15:27:20.230444Z","title":"A psychometric framework for evaluating and shaping personality traits in large language models","venue":null,"work_id":"6e6cd359-d136-4a3f-9c3b-387cdf47628a","year":2025},"citing_paper":{"arxiv_id":"2607.07918","last_updated":"2026-07-08T21:03:27Z","snapshot_observed_at":"2026-08-12T12:28:45.728193Z","submitted_at":"2026-07-08T21:03:27Z","title":"Efficient Safety Alignment of Language Models via Latent Personality Traits","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-07-10T15:26:23.290009Z"},"links":{"citing_paper":"/paper/2607.07918"},"observation_digest":"sha256:623dc202209b6292fd9a8479ce5b742a6a645debfd06ad84198d940bad139bee","observation_id":"9bf7fdef-e646-46e4-a844-e99d675fb663","resolution":{"observed_at":"2026-07-10T15:27:20.231740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15549","last_updated":"2025-07-29T09:37:22Z","snapshot_observed_at":"2026-08-13T08:22:02.023626Z","submitted_at":"2024-07-22T11:19:14Z","title":"Latent Adversarial Training Improves Robustness to Persistent Harmful Behaviors in LLMs","version":3},"cited_work":{"arxiv_id":"2407.15549","doi":"10.48550/arxiv.2407.15549","metadata_source":"pith","pith_arxiv_id":"2407.15549","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"C., Perez, E., Hadfield-Menell, D., et al","venue":"cs.LG","work_id":"46e8b17f-8d32-4a99-ba53-ebc3b351426a","year":2024},"citing_paper":{"arxiv_id":"2607.07918","last_updated":"2026-07-08T21:03:27Z","snapshot_observed_at":"2026-08-12T12:28:45.728193Z","submitted_at":"2026-07-08T21:03:27Z","title":"Efficient Safety Alignment of Language Models via Latent Personality Traits","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-07-10T15:26:23.290009Z"},"links":{"cited_paper":"/paper/2407.15549","citing_paper":"/paper/2607.07918"},"observation_digest":"sha256:613d1b3d5c267bef19118ee8d9270968fa514e1c8617f161bebae1ad5236cab6","observation_id":"e055885f-daed-490f-bbe7-51d7258e870d","resolution":{"observed_at":"2026-07-10T15:27:20.035408Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.15980","last_updated":"2020-11-07T05:33:35Z","snapshot_observed_at":"2026-08-13T21:10:43.984813Z","submitted_at":"2020-10-29T22:54:00Z","title":"AutoPrompt: Eliciting Knowledge from Language Models with Automatically Generated Prompts","version":2},"cited_work":{"arxiv_id":"2010.15980","doi":null,"metadata_source":"pith","pith_arxiv_id":"2010.15980","snapshot_observed_at":"2026-07-10T15:27:20.065753Z","title":"L., Wallace, E., and Singh, S","venue":"cs.CL","work_id":"1b968c9c-9b73-409a-aa88-57e02917679c","year":2020},"citing_paper":{"arxiv_id":"2607.07918","last_updated":"2026-07-08T21:03:27Z","snapshot_observed_at":"2026-08-12T12:28:45.728193Z","submitted_at":"2026-07-08T21:03:27Z","title":"Efficient Safety Alignment of Language Models via Latent Personality Traits","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-07-10T15:26:23.290009Z"},"links":{"cited_paper":"/paper/2010.15980","citing_paper":"/paper/2607.07918"},"observation_digest":"sha256:62c2a50089b8892491ce0dd9af6ee2db4d9509a20bfca412c6e22b48dd67612f","observation_id":"e68132a7-490c-4fc8-a276-fd4a3bb91eb2","resolution":{"observed_at":"2026-07-10T15:27:20.067044Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"3891.2011","doi":"10.1080/00223891.2011.577475","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Simms, Lewis R","venue":"Journal of Personality Assessment","work_id":"66b1d1cf-85eb-4c30-8d48-f89343cefef0","year":2011},"citing_paper":{"arxiv_id":"2607.07918","last_updated":"2026-07-08T21:03:27Z","snapshot_observed_at":"2026-08-12T12:28:45.728193Z","submitted_at":"2026-07-08T21:03:27Z","title":"Efficient Safety Alignment of Language Models via Latent Personality Traits","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-07-10T15:26:23.290009Z"},"links":{"citing_paper":"/paper/2607.07918"},"observation_digest":"sha256:efd06adf420b0a945bb6febd3e6236b418a6b2013751e971658a84c38acf862a","observation_id":"c85018f4-f52f-471a-92eb-af959a224b44","resolution":{"observed_at":"2026-07-10T15:27:19.833517Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.11328","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T15:27:20.090627Z","title":"Evaluating alignment of behavioral dispositions in llms","venue":null,"work_id":"f322e4a9-05a5-49e6-a9a6-7e1036c75562","year":2026},"citing_paper":{"arxiv_id":"2607.07918","last_updated":"2026-07-08T21:03:27Z","snapshot_observed_at":"2026-08-12T12:28:45.728193Z","submitted_at":"2026-07-08T21:03:27Z","title":"Efficient Safety Alignment of Language Models via Latent Personality Traits","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-07-10T15:26:23.290009Z"},"links":{"citing_paper":"/paper/2607.07918"},"observation_digest":"sha256:4b33c3cda596b27197d11360fa5ddc635ebc362ad408d2e5b4ae4ffaa56b3b7c","observation_id":"b356fd59-70a3-45cb-b68a-317b411eb8a3","resolution":{"observed_at":"2026-07-10T15:27:20.092107Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2508.04826","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T15:27:20.093249Z","title":"Yuxia Wang, Haonan Li, Xudong Han, Preslav Nakov, and Timothy Baldwin","venue":null,"work_id":"c90e902d-794a-4bf0-ac02-ffda0b00d142","year":2025},"citing_paper":{"arxiv_id":"2607.07918","last_updated":"2026-07-08T21:03:27Z","snapshot_observed_at":"2026-08-12T12:28:45.728193Z","submitted_at":"2026-07-08T21:03:27Z","title":"Efficient Safety Alignment of Language Models via Latent Personality Traits","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-07-10T15:26:23.290009Z"},"links":{"citing_paper":"/paper/2607.07918"},"observation_digest":"sha256:aaf5b5f53d360bd1eee4eea0082a6f2acf2271def2f74c98c2df8ac22339e43d","observation_id":"c35de6d0-c28d-49a9-a122-40e5fe3aeb44","resolution":{"observed_at":"2026-07-10T15:27:20.094856Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.19823","doi":"10.48550/arxiv.2506.19823","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2506.19823 , year =","venue":"ArXiv.org","work_id":"03393b01-f9ea-4e48-9800-272c1c99848e","year":2025},"citing_paper":{"arxiv_id":"2607.07918","last_updated":"2026-07-08T21:03:27Z","snapshot_observed_at":"2026-08-12T12:28:45.728193Z","submitted_at":"2026-07-08T21:03:27Z","title":"Efficient Safety Alignment of Language Models via Latent Personality Traits","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-07-10T15:26:23.290009Z"},"links":{"citing_paper":"/paper/2607.07918"},"observation_digest":"sha256:45f7ec4e828dce81f6202cf9b98a32177cb8794d783e8aba1779de240b4f1aef","observation_id":"38d1709e-1c21-400a-8043-5f78fb9bbfdb","resolution":{"observed_at":"2026-07-10T15:27:20.045712Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15427","last_updated":"2025-02-18T04:04:05Z","snapshot_observed_at":"2026-08-14T00:54:25.878678Z","submitted_at":"2025-01-26T07:07:01Z","title":"OpenCharacter: Training Customizable Role-Playing LLMs with Large-Scale Synthetic Personas","version":2},"cited_work":{"arxiv_id":"2501.15427","doi":"10.48550/arxiv.2501.15427","metadata_source":"pith","pith_arxiv_id":"2501.15427","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2501.15427 , year=","venue":"cs.CL","work_id":"a7c0e3a7-acfc-4019-8c10-f4d4b1272c47","year":2025},"citing_paper":{"arxiv_id":"2607.07918","last_updated":"2026-07-08T21:03:27Z","snapshot_observed_at":"2026-08-12T12:28:45.728193Z","submitted_at":"2026-07-08T21:03:27Z","title":"Efficient Safety Alignment of Language Models via Latent Personality Traits","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-07-10T15:26:23.290009Z"},"links":{"cited_paper":"/paper/2501.15427","citing_paper":"/paper/2607.07918"},"observation_digest":"sha256:962970a104efb913544988329a90c6a4d2cb581bdc8d5810807b4352bab0838e","observation_id":"6a0614ed-c35e-4664-8a47-c51f60777f18","resolution":{"observed_at":"2026-07-10T15:27:20.133534Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15589","last_updated":"2024-11-01T16:39:36Z","snapshot_observed_at":"2026-08-12T23:58:44.382152Z","submitted_at":"2024-05-24T14:20:09Z","title":"Efficient Adversarial Training in LLMs with Continuous Attacks","version":3},"cited_work":{"arxiv_id":"2405.15589","doi":"10.48550/arxiv.2405.15589","metadata_source":"pith","pith_arxiv_id":"2405.15589","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient adversarial training in llms with continuous attacks","venue":"cs.LG","work_id":"949aece2-73cd-4fc5-956d-beddde6f6fa7","year":2024},"citing_paper":{"arxiv_id":"2607.07918","last_updated":"2026-07-08T21:03:27Z","snapshot_observed_at":"2026-08-12T12:28:45.728193Z","submitted_at":"2026-07-08T21:03:27Z","title":"Efficient Safety Alignment of Language Models via Latent Personality Traits","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-07-10T15:26:23.290009Z"},"links":{"cited_paper":"/paper/2405.15589","citing_paper":"/paper/2607.07918"},"observation_digest":"sha256:bae0db6339cf62da07a0705cbddcae559ff0ddc6d60a0c48603c56feb599a7e7","observation_id":"6cb77377-5147-4dc2-8859-5a74d98068fb","resolution":{"observed_at":"2026-07-10T15:27:20.099694Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12692","last_updated":"2025-05-19T04:32:02Z","snapshot_observed_at":"2026-08-07T15:43:30.805066Z","submitted_at":"2025-05-19T04:32:02Z","title":"Bullying the Machine: How Personas Increase LLM Vulnerability","version":1},"cited_work":{"arxiv_id":"2505.12692","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.12692","snapshot_observed_at":"2026-07-10T15:27:20.025550Z","title":"Zheng-Xin Yong, Cristina Menghini, and Stephen H Bach","venue":"cs.AI","work_id":"a548ffb1-0af4-424b-b06e-abeb7f3c9517","year":2025},"citing_paper":{"arxiv_id":"2607.07918","last_updated":"2026-07-08T21:03:27Z","snapshot_observed_at":"2026-08-12T12:28:45.728193Z","submitted_at":"2026-07-08T21:03:27Z","title":"Efficient Safety Alignment of Language Models via Latent Personality Traits","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-07-10T15:26:23.290009Z"},"links":{"cited_paper":"/paper/2505.12692","citing_paper":"/paper/2607.07918"},"observation_digest":"sha256:a48b0bca4664d0f9aff664858117f24cd95e0f5db49f3b30135cabd6c82c55ac","observation_id":"4fcc0c92-4f51-4d48-8286-1232dd0c9bf7","resolution":{"observed_at":"2026-07-10T15:27:20.026952Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2607.07918","last_updated":"2026-07-08T21:03:27Z","snapshot_observed_at":"2026-08-12T12:28:45.728193Z","submitted_at":"2026-07-08T21:03:27Z","title":"Efficient Safety Alignment of Language Models via Latent Personality Traits","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-07-10T15:26:23.290009Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2607.07918"},"observation_digest":"sha256:39dda7db0febf63aff6d5ace04675e33c273cb313243f9d4c08d6c146b253401","observation_id":"5082985f-e678-4227-bf83-8b5b129af0f0","resolution":{"observed_at":"2026-07-10T15:27:20.120641Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.10639","last_updated":"2025-05-30T03:31:24Z","snapshot_observed_at":"2026-08-10T18:59:36.542278Z","submitted_at":"2025-01-18T02:57:12Z","title":"Latent-space adversarial training with post-aware calibration for defending large language models against jailbreak attacks","version":3},"cited_work":{"arxiv_id":"2501.10639","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.10639","snapshot_observed_at":"2026-07-10T15:27:20.106151Z","title":"Latent-space adversarial training with post-aware calibration for defending large language models against jailbreak attacks","venue":"cs.CR","work_id":"0275f023-400a-401e-8131-5f8d0cbc597a","year":2025},"citing_paper":{"arxiv_id":"2607.07918","last_updated":"2026-07-08T21:03:27Z","snapshot_observed_at":"2026-08-12T12:28:45.728193Z","submitted_at":"2026-07-08T21:03:27Z","title":"Efficient Safety Alignment of Language Models via Latent Personality Traits","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-07-10T15:26:23.290009Z"},"links":{"cited_paper":"/paper/2501.10639","citing_paper":"/paper/2607.07918"},"observation_digest":"sha256:bbeddd0fd6eeab4ba0b5c8760c17238795844a330aa1ffb40e0a7833463c89d8","observation_id":"ee1a0b98-dd8a-45a9-b9d0-7bf12bcd306d","resolution":{"observed_at":"2026-07-10T15:27:20.107446Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.20089","last_updated":"2025-03-20T15:28:18Z","snapshot_observed_at":"2026-08-12T22:34:42.895652Z","submitted_at":"2024-09-30T08:41:39Z","title":"Robust LLM safeguarding via refusal feature adversarial training","version":2},"cited_work":{"arxiv_id":"2409.20089","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.20089","snapshot_observed_at":"2026-07-10T15:27:20.096034Z","title":"Robust LLM safeguarding via refusal feature adversarial training","venue":"cs.LG","work_id":"b7695987-d041-45a0-bc77-6648f1479c43","year":2024},"citing_paper":{"arxiv_id":"2607.07918","last_updated":"2026-07-08T21:03:27Z","snapshot_observed_at":"2026-08-12T12:28:45.728193Z","submitted_at":"2026-07-08T21:03:27Z","title":"Efficient Safety Alignment of Language Models via Latent Personality Traits","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-07-10T15:26:23.290009Z"},"links":{"cited_paper":"/paper/2409.20089","citing_paper":"/paper/2607.07918"},"observation_digest":"sha256:306ca74c6c25532a3a09cc117a690509434ec9f088607e71584f7a8ee00f047b","observation_id":"497d297c-1db3-4b2c-9383-ca0925800bd5","resolution":{"observed_at":"2026-07-10T15:27:20.097245Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.13244","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T15:27:20.124266Z","title":"Coifman, and Ruoming Jin","venue":null,"work_id":"a27b5e8f-2777-4400-aa4c-d96a38f66938","year":2025},"citing_paper":{"arxiv_id":"2607.07918","last_updated":"2026-07-08T21:03:27Z","snapshot_observed_at":"2026-08-12T12:28:45.728193Z","submitted_at":"2026-07-08T21:03:27Z","title":"Efficient Safety Alignment of Language Models via Latent Personality Traits","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-07-10T15:26:23.290009Z"},"links":{"citing_paper":"/paper/2607.07918"},"observation_digest":"sha256:1786a1915eed3a7fba572ae98396530333fa4a1958b3b4b74f875f388fee3a47","observation_id":"1b237e65-4076-4ba5-8819-f8306f54ed21","resolution":{"observed_at":"2026-07-10T15:27:20.125753Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11779","last_updated":"2025-03-08T14:01:37Z","snapshot_observed_at":"2026-08-12T22:59:49.453208Z","submitted_at":"2024-08-21T17:09:00Z","title":"Personality Alignment of Large Language Models","version":2},"cited_work":{"arxiv_id":"2408.11779","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.11779","snapshot_observed_at":"2026-07-10T15:27:20.126892Z","title":"Personality alignment of large language models","venue":"cs.CL","work_id":"95437c77-129d-427d-9052-837615e90e20","year":2024},"citing_paper":{"arxiv_id":"2607.07918","last_updated":"2026-07-08T21:03:27Z","snapshot_observed_at":"2026-08-12T12:28:45.728193Z","submitted_at":"2026-07-08T21:03:27Z","title":"Efficient Safety Alignment of Language Models via Latent Personality Traits","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-07-10T15:26:23.290009Z"},"links":{"cited_paper":"/paper/2408.11779","citing_paper":"/paper/2607.07918"},"observation_digest":"sha256:0c9fcae32d0a8e58d2ab984bc539c9385ee05c1cbf58a2fb43a0c721eb1b4527","observation_id":"0e0a87bf-c2cc-485f-97a2-956954b61dcd","resolution":{"observed_at":"2026-07-10T15:27:20.128335Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-08-12T09:06:50.363435Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":"2307.15043","doi":"10.48550/arxiv.2307.15043","metadata_source":"pith","pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","venue":"cs.CL","work_id":"3322fa86-1768-4677-8425-dd326b45e078","year":2023},"citing_paper":{"arxiv_id":"2607.07918","last_updated":"2026-07-08T21:03:27Z","snapshot_observed_at":"2026-08-12T12:28:45.728193Z","submitted_at":"2026-07-08T21:03:27Z","title":"Efficient Safety Alignment of Language Models via Latent Personality Traits","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-07-10T15:26:23.290009Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2607.07918"},"observation_digest":"sha256:d19a064a0b73308dba7ac697cf416d3830eb8a4180905e97dc36955d733db13d","observation_id":"b64926a1-9fdf-47c1-a36b-38a2ef3998b2","resolution":{"observed_at":"2026-07-10T15:27:20.084547Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01405","last_updated":"2025-03-03T06:14:14Z","snapshot_observed_at":"2026-07-06T16:26:38.284922Z","submitted_at":"2023-10-02T17:59:07Z","title":"Representation Engineering: A Top-Down Approach to AI Transparency","version":4},"cited_work":{"arxiv_id":"2310.01405","doi":"10.1609/aaai.v36i9.21196","metadata_source":"pith","pith_arxiv_id":"2310.01405","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Representation Engineering: A Top-Down Approach to AI Transparency","venue":"cs.LG","work_id":"45b326e2-e962-41a5-a542-2559e103a19b","year":2023},"citing_paper":{"arxiv_id":"2607.07918","last_updated":"2026-07-08T21:03:27Z","snapshot_observed_at":"2026-08-12T12:28:45.728193Z","submitted_at":"2026-07-08T21:03:27Z","title":"Efficient Safety Alignment of Language Models via Latent Personality Traits","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-07-10T15:26:23.290009Z"},"links":{"cited_paper":"/paper/2310.01405","citing_paper":"/paper/2607.07918"},"observation_digest":"sha256:8ff1bd57b597802d4a2b1d2ba41f70e154507c9cf740ce0af9cf7d7ff5ccfe58","observation_id":"3edfe9bd-0143-4ded-bd56-737dec0ccc61","resolution":{"observed_at":"2026-07-10T15:27:20.089446Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2607.07918","last_updated":"2026-07-08T21:03:27Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-12T12:28:45.728193Z","submitted_at":"2026-07-08T21:03:27Z","title":"Efficient Safety Alignment of Language Models via Latent Personality Traits"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":0,"metadata_mismatch":18,"parse_uncertain":0,"unresolved":3,"verified_exact":30,"verified_fuzzy":6},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 0 inbound Pith citation observations for arXiv:2607.07918."}