{"as_of":"2026-08-13T03:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ebb7025908d6e87fbfa2c97f48cf2afdf94751b275251e480749f1c8fbcc1772","coverage":[{"denominator":48,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":48,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T17:43:47.849960Z","state":"measured"},{"denominator":48,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":48,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.26409/citation-record","integrity":"/paper/2605.26409/integrity","json":"/paper/2605.26409/citation-record.json","paper":"/paper/2605.26409"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2409.17308","last_updated":"2025-01-17T04:30:17Z","snapshot_observed_at":"2026-08-12T22:37:27.778507Z","submitted_at":"2024-09-25T19:35:58Z","title":"Consistent estimation of generative model representations in the data kernel perspective space","version":2},"cited_work":{"arxiv_id":"2409.17308","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.17308","snapshot_observed_at":"2026-06-30T23:35:07.712376Z","title":"Acharyya, M","venue":null,"work_id":"ec55a071-82fa-4b2a-8f23-777e636cd4c3","year":2025},"citing_paper":{"arxiv_id":"2605.26409","last_updated":"2026-05-26T00:36:42Z","snapshot_observed_at":"2026-08-02T10:55:21.817292Z","submitted_at":"2026-05-26T00:36:42Z","title":"Jailbreak susceptibility prediction and mitigation via the behavioral geometry of models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-29T17:43:47.849960Z"},"links":{"cited_paper":"/paper/2409.17308","citing_paper":"/paper/2605.26409"},"observation_digest":"sha256:489c3622dc42ac80efdc03c6d16337fc3594707f4a4e17377ab9877c1549ece5","observation_id":"2ffcdaba-a0a7-4214-bd80-a1a0ef177f9c","resolution":{"observed_at":"2026-06-29T17:53:47.727955Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T17:43:47.849960Z","title":"Intrinsic dimensionality explains the effectiveness of language model fine-tuning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2605.26409","last_updated":"2026-05-26T00:36:42Z","snapshot_observed_at":"2026-08-02T10:55:21.817292Z","submitted_at":"2026-05-26T00:36:42Z","title":"Jailbreak susceptibility prediction and mitigation via the behavioral geometry of models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-29T17:43:47.849960Z"},"links":{"citing_paper":"/paper/2605.26409"},"observation_digest":"sha256:1ca10f487eed311779c2f5e94ffb040375fae6490d393c1210ceae051e96cb32","observation_id":"27ea9924-5daa-4116-b675-c6604d761999","resolution":{"observed_at":"2026-06-29T17:43:47.849960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T17:43:47.849960Z","title":"The Claude 3 model family: Opus, Sonnet, Haiku.Anthropic Technical Report, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.26409","last_updated":"2026-05-26T00:36:42Z","snapshot_observed_at":"2026-08-02T10:55:21.817292Z","submitted_at":"2026-05-26T00:36:42Z","title":"Jailbreak susceptibility prediction and mitigation via the behavioral geometry of models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-29T17:43:47.849960Z"},"links":{"citing_paper":"/paper/2605.26409"},"observation_digest":"sha256:0244cc8e490e3dc546c0b45d05af9646f811ee6133cd032bbc7f19f94f927a79","observation_id":"28be538f-c115-42da-b83e-aea023549109","resolution":{"observed_at":"2026-06-29T17:43:47.849960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T17:43:47.849960Z","title":"Threat intelligence report: August 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.26409","last_updated":"2026-05-26T00:36:42Z","snapshot_observed_at":"2026-08-02T10:55:21.817292Z","submitted_at":"2026-05-26T00:36:42Z","title":"Jailbreak susceptibility prediction and mitigation via the behavioral geometry of models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-29T17:43:47.849960Z"},"links":{"citing_paper":"/paper/2605.26409"},"observation_digest":"sha256:c0e6095e4c8856d45a633ce36b655c3dcd997bb152ab517955c87d74b5ae3528","observation_id":"ad4c49f3-83f8-4f21-8a70-bc83a643d115","resolution":{"observed_at":"2026-06-29T17:43:47.849960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.05013","last_updated":"2026-06-04T16:38:06Z","snapshot_observed_at":"2026-08-07T06:08:27.794444Z","submitted_at":"2025-12-04T17:24:56Z","title":"Detecting Perspective Shifts in Multi-agent Systems","version":2},"cited_work":{"arxiv_id":"2512.05013","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.05013","snapshot_observed_at":"2026-06-29T17:53:47.729126Z","title":"Bridgeford and H","venue":"cs.AI","work_id":"c9ee03a0-8121-4485-8639-95b776f74b63","year":2025},"citing_paper":{"arxiv_id":"2605.26409","last_updated":"2026-05-26T00:36:42Z","snapshot_observed_at":"2026-08-02T10:55:21.817292Z","submitted_at":"2026-05-26T00:36:42Z","title":"Jailbreak susceptibility prediction and mitigation via the behavioral geometry of models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-29T17:43:47.849960Z"},"links":{"cited_paper":"/paper/2512.05013","citing_paper":"/paper/2605.26409"},"observation_digest":"sha256:a16a58239e6c98ff208da9f74b450b241b2e54ed65a11b1dab5da7a8f09c9e92","observation_id":"e75c313b-091e-41f4-ac8f-0e6610f4ab70","resolution":{"observed_at":"2026-06-29T17:53:47.730462Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T17:43:47.849960Z","title":"Defending against alignment-breaking attacks via robustly aligned LLM","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.26409","last_updated":"2026-05-26T00:36:42Z","snapshot_observed_at":"2026-08-02T10:55:21.817292Z","submitted_at":"2026-05-26T00:36:42Z","title":"Jailbreak susceptibility prediction and mitigation via the behavioral geometry of models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-29T17:43:47.849960Z"},"links":{"citing_paper":"/paper/2605.26409"},"observation_digest":"sha256:d8ee234194677aa9afa0e8017e1c6f3a4b2be13d4501e5a9c5cb1812edddfb94","observation_id":"9670a7ff-3b64-40e3-9bc2-59c4932aa31b","resolution":{"observed_at":"2026-06-29T17:43:47.849960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08419","last_updated":"2024-07-18T18:24:57Z","snapshot_observed_at":"2026-08-12T12:29:45.113982Z","submitted_at":"2023-10-12T15:38:28Z","title":"Jailbreaking Black Box Large Language Models in Twenty Queries","version":4},"cited_work":{"arxiv_id":"2310.08419","doi":"10.48550/arxiv.2310.08419","metadata_source":"pith","pith_arxiv_id":"2310.08419","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Jailbreaking Black Box Large Language Models in Twenty Queries","venue":"cs.LG","work_id":"38678cda-6595-4ca3-916b-066c00cce063","year":2023},"citing_paper":{"arxiv_id":"2605.26409","last_updated":"2026-05-26T00:36:42Z","snapshot_observed_at":"2026-08-02T10:55:21.817292Z","submitted_at":"2026-05-26T00:36:42Z","title":"Jailbreak susceptibility prediction and mitigation via the behavioral geometry of models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-29T17:43:47.849960Z"},"links":{"cited_paper":"/paper/2310.08419","citing_paper":"/paper/2605.26409"},"observation_digest":"sha256:e8848064b129396bfde05dd210a4148f2e1129e6d53b19e279e4d3b7bb074a08","observation_id":"ea7e22b8-ebd1-456a-94e7-cbb80d486ec3","resolution":{"observed_at":"2026-06-29T17:53:47.733021Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-05-24T00:53:06.618013+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T00:53:06.618013+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T17:43:47.849960Z","title":"JailbreakBench: An open robustness benchmark for jailbreaking large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.26409","last_updated":"2026-05-26T00:36:42Z","snapshot_observed_at":"2026-08-02T10:55:21.817292Z","submitted_at":"2026-05-26T00:36:42Z","title":"Jailbreak susceptibility prediction and mitigation via the behavioral geometry of models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-29T17:43:47.849960Z"},"links":{"citing_paper":"/paper/2605.26409"},"observation_digest":"sha256:11df202e0fdcdf2063ad9bb3debc27386a463a3108577eb71bdbf143443b498e","observation_id":"ea93c1f4-2f95-4cd8-bf16-e9c51938bb39","resolution":{"observed_at":"2026-06-29T17:43:47.849960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":"2407.21783","doi":"10.1016/s0749-0720(15","metadata_source":"pith","pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"The Llama 3 Herd of Models","venue":"cs.AI","work_id":"1549a635-88af-4ac1-acfe-51ae7bb53345","year":2024},"citing_paper":{"arxiv_id":"2605.26409","last_updated":"2026-05-26T00:36:42Z","snapshot_observed_at":"2026-08-02T10:55:21.817292Z","submitted_at":"2026-05-26T00:36:42Z","title":"Jailbreak susceptibility prediction and mitigation via the behavioral geometry of models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-29T17:43:47.849960Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2605.26409"},"observation_digest":"sha256:e2c6e480c614d086b9ed22973bc5a871c3147317a055413548dbe750a2f7ea8f","observation_id":"e75bb7aa-f125-41e9-9a1f-c2cf8b4d5f1d","resolution":{"observed_at":"2026-06-29T17:53:47.719896Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.05126","last_updated":"2024-01-07T15:28:56Z","snapshot_observed_at":"2026-08-07T06:07:37.443076Z","submitted_at":"2023-05-09T02:01:07Z","title":"Comparing Foundation Models using Data Kernels","version":3},"cited_work":{"arxiv_id":"2305.05126","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.05126","snapshot_observed_at":"2026-06-30T23:35:07.696616Z","title":"Helm, and Carey E","venue":null,"work_id":"6331bcb0-571c-41be-aac8-1dd46942ea1f","year":2023},"citing_paper":{"arxiv_id":"2605.26409","last_updated":"2026-05-26T00:36:42Z","snapshot_observed_at":"2026-08-02T10:55:21.817292Z","submitted_at":"2026-05-26T00:36:42Z","title":"Jailbreak susceptibility prediction and mitigation via the behavioral geometry of models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-29T17:43:47.849960Z"},"links":{"cited_paper":"/paper/2305.05126","citing_paper":"/paper/2605.26409"},"observation_digest":"sha256:127e1602585a5af9d6a12ce7d6e22f4da9f43d2f81e572b12cf0a7e64968ccfd","observation_id":"5e16d746-d3c5-4275-9810-4cc619c92cc0","resolution":{"observed_at":"2026-06-29T17:53:47.717515Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":"2403.05530","doi":"10.48550/arxiv.2403.05530","metadata_source":"pith","pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","venue":"cs.CL","work_id":"80e3e977-f1bb-4c83-8d0c-1ab0a0c5c3f1","year":2024},"citing_paper":{"arxiv_id":"2605.26409","last_updated":"2026-05-26T00:36:42Z","snapshot_observed_at":"2026-08-02T10:55:21.817292Z","submitted_at":"2026-05-26T00:36:42Z","title":"Jailbreak susceptibility prediction and mitigation via the behavioral geometry of models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-29T17:43:47.849960Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2605.26409"},"observation_digest":"sha256:48b145941df915bbbf86c74106cd46d9ef7af23fc18b49ee9e827d15770ab169","observation_id":"ccafdda1-119c-418a-92f7-aed052898ef7","resolution":{"observed_at":"2026-06-29T17:53:47.712029Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-02T03:08:14.426583+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-02T03:08:14.426583+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00118","last_updated":"2024-10-02T15:22:49Z","snapshot_observed_at":"2026-08-02T16:20:09.773989Z","submitted_at":"2024-07-31T19:13:07Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","version":3},"cited_work":{"arxiv_id":"2408.00118","doi":"10.48550/arxiv.2408.00118","metadata_source":"pith","pith_arxiv_id":"2408.00118","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","venue":"cs.CL","work_id":"4dd94e2f-2b27-4cbf-88a0-4910f0772a57","year":2024},"citing_paper":{"arxiv_id":"2605.26409","last_updated":"2026-05-26T00:36:42Z","snapshot_observed_at":"2026-08-02T10:55:21.817292Z","submitted_at":"2026-05-26T00:36:42Z","title":"Jailbreak susceptibility prediction and mitigation via the behavioral geometry of models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-29T17:43:47.849960Z"},"links":{"cited_paper":"/paper/2408.00118","citing_paper":"/paper/2605.26409"},"observation_digest":"sha256:f4cdb10d7c81097133164e9e1cb8196e3d06a628c600846138c3542b33640fa7","observation_id":"1326ebda-29dc-45c1-87f0-83ebc5467c31","resolution":{"observed_at":"2026-06-29T17:53:47.714752Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-01T04:38:46.183082+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T04:38:46.183082+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T17:43:47.849960Z","title":"Text embeddings API","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.26409","last_updated":"2026-05-26T00:36:42Z","snapshot_observed_at":"2026-08-02T10:55:21.817292Z","submitted_at":"2026-05-26T00:36:42Z","title":"Jailbreak susceptibility prediction and mitigation via the behavioral geometry of models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-29T17:43:47.849960Z"},"links":{"citing_paper":"/paper/2605.26409"},"observation_digest":"sha256:bdbf2a462dafd22c3255067498b4691debf262ef9bac7ad2038ea07aaa813503","observation_id":"e6d7840a-6c3a-470e-bb97-64e24ca66567","resolution":{"observed_at":"2026-06-29T17:43:47.849960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T17:43:47.849960Z","title":"Statistical inference on black-box generative models in the data kernel perspective space","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.26409","last_updated":"2026-05-26T00:36:42Z","snapshot_observed_at":"2026-08-02T10:55:21.817292Z","submitted_at":"2026-05-26T00:36:42Z","title":"Jailbreak susceptibility prediction and mitigation via the behavioral geometry of models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-29T17:43:47.849960Z"},"links":{"citing_paper":"/paper/2605.26409"},"observation_digest":"sha256:b2abffaa5eec552166d705ecbe4a5523f97f0cb3939dc14c4385adc9b2e51786","observation_id":"7e354918-7ef9-4929-a68e-abb6dc2eb98a","resolution":{"observed_at":"2026-06-29T17:43:47.849960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.07096","last_updated":"2026-06-04T16:41:18Z","snapshot_observed_at":"2026-08-11T14:16:50.544261Z","submitted_at":"2026-05-08T01:24:06Z","title":"Query-efficient model evaluation using cached responses","version":2},"cited_work":{"arxiv_id":"2605.07096","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.07096","snapshot_observed_at":"2026-06-29T17:53:47.721084Z","title":"Query-efficient model evaluation using cached responses","venue":"cs.LG","work_id":"30ce3df8-a97c-42ba-aa70-9d35a44c9b6e","year":2026},"citing_paper":{"arxiv_id":"2605.26409","last_updated":"2026-05-26T00:36:42Z","snapshot_observed_at":"2026-08-02T10:55:21.817292Z","submitted_at":"2026-05-26T00:36:42Z","title":"Jailbreak susceptibility prediction and mitigation via the behavioral geometry of models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-29T17:43:47.849960Z"},"links":{"cited_paper":"/paper/2605.07096","citing_paper":"/paper/2605.26409"},"observation_digest":"sha256:22e0bc39f5f221a886fef4fa244bc3e4db216041d4fe784082a16f79dc428f94","observation_id":"e58ace2a-1043-4c92-b65c-c9d1370bd8fe","resolution":{"observed_at":"2026-06-29T17:53:47.722345Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11938","last_updated":"2024-06-17T17:20:16Z","snapshot_observed_at":"2026-08-12T23:40:52.238409Z","submitted_at":"2024-06-17T17:20:16Z","title":"Tracking the perspectives of interacting language models","version":1},"cited_work":{"arxiv_id":"2406.11938","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.11938","snapshot_observed_at":"2026-06-29T17:53:47.723687Z","title":"Tracking the perspectives of interacting language models.arXiv preprint arXiv:2406.11938, 2024","venue":null,"work_id":"207cda6e-9d92-4cdc-9471-a541c3067c00","year":2024},"citing_paper":{"arxiv_id":"2605.26409","last_updated":"2026-05-26T00:36:42Z","snapshot_observed_at":"2026-08-02T10:55:21.817292Z","submitted_at":"2026-05-26T00:36:42Z","title":"Jailbreak susceptibility prediction and mitigation via the behavioral geometry of models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-29T17:43:47.849960Z"},"links":{"cited_paper":"/paper/2406.11938","citing_paper":"/paper/2605.26409"},"observation_digest":"sha256:69e40ce427f92a0551710e2f216c0c8943773be268e1e02245dd5186275f10f5","observation_id":"e9a7939c-67aa-41ee-8e88-f141f6edbe38","resolution":{"observed_at":"2026-06-29T17:53:47.725100Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03556","last_updated":"2024-12-19T22:37:45Z","snapshot_observed_at":"2026-08-11T22:13:31.714802Z","submitted_at":"2024-12-04T18:51:32Z","title":"Best-of-N Jailbreaking","version":2},"cited_work":{"arxiv_id":"2412.03556","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.03556","snapshot_observed_at":"2026-07-04T17:30:00.621770Z","title":"Best-of-n jailbreaking","venue":null,"work_id":"510304b6-9054-406f-bd07-365258693153","year":2024},"citing_paper":{"arxiv_id":"2605.26409","last_updated":"2026-05-26T00:36:42Z","snapshot_observed_at":"2026-08-02T10:55:21.817292Z","submitted_at":"2026-05-26T00:36:42Z","title":"Jailbreak susceptibility prediction and mitigation via the behavioral geometry of models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-29T17:43:47.849960Z"},"links":{"cited_paper":"/paper/2412.03556","citing_paper":"/paper/2605.26409"},"observation_digest":"sha256:b2867712271497c6903fce1fc27a2f1641c0ac4c1aed2c1976c892602e26d989","observation_id":"22e9386b-000a-4dc3-929e-7761e40ff97c","resolution":{"observed_at":"2026-06-29T17:53:47.735743Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.07987","last_updated":"2024-07-25T09:33:50Z","snapshot_observed_at":"2026-08-06T11:02:06.607024Z","submitted_at":"2024-05-13T17:58:30Z","title":"The Platonic Representation Hypothesis","version":5},"cited_work":{"arxiv_id":"2405.07987","doi":"10.48550/arxiv.2405.07987","metadata_source":"pith","pith_arxiv_id":"2405.07987","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The Platonic Representation Hypothesis","venue":"cs.LG","work_id":"950baa06-36a7-4010-a959-7304fb1ce08b","year":2024},"citing_paper":{"arxiv_id":"2605.26409","last_updated":"2026-05-26T00:36:42Z","snapshot_observed_at":"2026-08-02T10:55:21.817292Z","submitted_at":"2026-05-26T00:36:42Z","title":"Jailbreak susceptibility prediction and mitigation via the behavioral geometry of models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-29T17:43:47.849960Z"},"links":{"cited_paper":"/paper/2405.07987","citing_paper":"/paper/2605.26409"},"observation_digest":"sha256:726c0c80c5ae0798866f6030c4183cf64c506610b5ae9c067fb2d24f27e9afbe","observation_id":"eaea15f2-b109-4522-afd8-5fb7cb52460e","resolution":{"observed_at":"2026-06-29T17:53:47.676815Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":"2410.21276","doi":"10.1177/15248380231178756","metadata_source":"pith","pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4o System Card","venue":"cs.CL","work_id":"f37bf1c7-4964-4e56-9762-d20da8d9009f","year":2024},"citing_paper":{"arxiv_id":"2605.26409","last_updated":"2026-05-26T00:36:42Z","snapshot_observed_at":"2026-08-02T10:55:21.817292Z","submitted_at":"2026-05-26T00:36:42Z","title":"Jailbreak susceptibility prediction and mitigation via the behavioral geometry of models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-29T17:43:47.849960Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2605.26409"},"observation_digest":"sha256:5c4100ff5bd3fd873c39da1d5f8cb44f543751897d48d3cc4056fb8b85d786cf","observation_id":"8e58ce07-45c0-4ce9-a507-8f4bc8020ab6","resolution":{"observed_at":"2026-06-29T17:53:47.707201Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06674","last_updated":"2023-12-07T19:40:50Z","snapshot_observed_at":"2026-08-13T00:51:41.824778Z","submitted_at":"2023-12-07T19:40:50Z","title":"Llama Guard: LLM-based Input-Output Safeguard for Human-AI Conversations","version":1},"cited_work":{"arxiv_id":"2312.06674","doi":"10.3390/info16050365","metadata_source":"pith","pith_arxiv_id":"2312.06674","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Llama Guard: LLM-based Input-Output Safeguard for Human-AI Conversations","venue":"cs.CL","work_id":"93844332-869b-448c-a1be-35466150b1b2","year":2023},"citing_paper":{"arxiv_id":"2605.26409","last_updated":"2026-05-26T00:36:42Z","snapshot_observed_at":"2026-08-02T10:55:21.817292Z","submitted_at":"2026-05-26T00:36:42Z","title":"Jailbreak susceptibility prediction and mitigation via the behavioral geometry of models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-29T17:43:47.849960Z"},"links":{"cited_paper":"/paper/2312.06674","citing_paper":"/paper/2605.26409"},"observation_digest":"sha256:a6ae5cd9afaec7f15b1a8a14b18f631b69cecfc8fd9d7cf4dc109a164a5032f8","observation_id":"a2971b19-968a-4803-98d1-a12910032e9b","resolution":{"observed_at":"2026-06-29T17:53:47.671947Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T17:43:47.849960Z","title":"Wiley, 1990","venue":null,"work_id":null,"year":1990},"citing_paper":{"arxiv_id":"2605.26409","last_updated":"2026-05-26T00:36:42Z","snapshot_observed_at":"2026-08-02T10:55:21.817292Z","submitted_at":"2026-05-26T00:36:42Z","title":"Jailbreak susceptibility prediction and mitigation via the behavioral geometry of models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-29T17:43:47.849960Z"},"links":{"citing_paper":"/paper/2605.26409"},"observation_digest":"sha256:0eb533b3859be1f6073f675afe59c6b2919f36d5a76fc79f7d7574e29017192a","observation_id":"c2b2a110-758f-4fd3-8878-733bfb742f25","resolution":{"observed_at":"2026-06-29T17:43:47.849960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T17:43:47.849960Z","title":"Similarity of neural network representations revisited","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2605.26409","last_updated":"2026-05-26T00:36:42Z","snapshot_observed_at":"2026-08-02T10:55:21.817292Z","submitted_at":"2026-05-26T00:36:42Z","title":"Jailbreak susceptibility prediction and mitigation via the behavioral geometry of models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-29T17:43:47.849960Z"},"links":{"citing_paper":"/paper/2605.26409"},"observation_digest":"sha256:c93a696e0bedc258f16b36e7a42a5e312ab29aa9500380635ac55c3fa5b5374f","observation_id":"211596d7-49e6-495a-b8e2-a082b966ce39","resolution":{"observed_at":"2026-06-29T17:43:47.849960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":"2211.09110","doi":"10.1007/bf01194075","metadata_source":"pith","pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Holistic Evaluation of Language Models","venue":"cs.CL","work_id":"cc02a01e-7218-47dc-8e66-3333e7e4adec","year":2022},"citing_paper":{"arxiv_id":"2605.26409","last_updated":"2026-05-26T00:36:42Z","snapshot_observed_at":"2026-08-02T10:55:21.817292Z","submitted_at":"2026-05-26T00:36:42Z","title":"Jailbreak susceptibility prediction and mitigation via the behavioral geometry of models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-29T17:43:47.849960Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2605.26409"},"observation_digest":"sha256:c05b81c5b3b779cffe1727a1712386a211233b75e01208429a50479b6c27e51c","observation_id":"e8700dbc-e229-40d5-a54f-3675741e0069","resolution":{"observed_at":"2026-06-29T17:53:47.673611Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T17:43:47.849960Z","title":"The detection of disease clustering and a generalized regression approach","venue":null,"work_id":null,"year":1967},"citing_paper":{"arxiv_id":"2605.26409","last_updated":"2026-05-26T00:36:42Z","snapshot_observed_at":"2026-08-02T10:55:21.817292Z","submitted_at":"2026-05-26T00:36:42Z","title":"Jailbreak susceptibility prediction and mitigation via the behavioral geometry of models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-29T17:43:47.849960Z"},"links":{"citing_paper":"/paper/2605.26409"},"observation_digest":"sha256:0fad02926b477046333ffac6022e602453ec4727be3ffc0d96796fb7547dc2d5","observation_id":"2c8b9c67-fa27-44c9-a4a6-6b8b708f1a28","resolution":{"observed_at":"2026-06-29T17:43:47.849960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04249","last_updated":"2024-02-27T04:43:08Z","snapshot_observed_at":"2026-07-06T17:26:23.067923Z","submitted_at":"2024-02-06T18:59:08Z","title":"HarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Robust Refusal","version":2},"cited_work":{"arxiv_id":"2402.04249","doi":"10.48550/arxiv.2402.04249","metadata_source":"pith","pith_arxiv_id":"2402.04249","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Robust Refusal","venue":"cs.LG","work_id":"b0b0303f-2444-4789-a979-8153624312ff","year":2024},"citing_paper":{"arxiv_id":"2605.26409","last_updated":"2026-05-26T00:36:42Z","snapshot_observed_at":"2026-08-02T10:55:21.817292Z","submitted_at":"2026-05-26T00:36:42Z","title":"Jailbreak susceptibility prediction and mitigation via the behavioral geometry of models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-29T17:43:47.849960Z"},"links":{"cited_paper":"/paper/2402.04249","citing_paper":"/paper/2605.26409"},"observation_digest":"sha256:c46a6d8f0b548a4a451b9016d874da9c78d2170e92db550bbd2ac72758f1d0bf","observation_id":"2eb1afa9-4ffa-4c4a-b624-8181bdf162ab","resolution":{"observed_at":"2026-06-29T17:53:47.679296Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02119","last_updated":"2024-10-31T15:57:42Z","snapshot_observed_at":"2026-07-06T16:56:46.051958Z","submitted_at":"2023-12-04T18:49:23Z","title":"Tree of Attacks: Jailbreaking Black-Box LLMs Automatically","version":3},"cited_work":{"arxiv_id":"2312.02119","doi":"10.48550/arxiv.2312.02119","metadata_source":"pith","pith_arxiv_id":"2312.02119","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tree of attacks: Jailbreaking black-box llms automatically","venue":"cs.LG","work_id":"21743458-a817-448a-b77b-559e707b5030","year":2023},"citing_paper":{"arxiv_id":"2605.26409","last_updated":"2026-05-26T00:36:42Z","snapshot_observed_at":"2026-08-02T10:55:21.817292Z","submitted_at":"2026-05-26T00:36:42Z","title":"Jailbreak susceptibility prediction and mitigation via the behavioral geometry of models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-29T17:43:47.849960Z"},"links":{"cited_paper":"/paper/2312.02119","citing_paper":"/paper/2605.26409"},"observation_digest":"sha256:ae09676a7fc46a62d4bd8a2c252f5dd7c3d00d14a0030c81d48b69c731153d16","observation_id":"1ec4a496-26fb-4f6c-8f40-4f4edf2fd2c0","resolution":{"observed_at":"2026-06-29T17:53:47.704818Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-05-24T00:53:06.257775+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T00:53:06.257775+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01613","last_updated":"2025-02-03T22:26:56Z","snapshot_observed_at":"2026-08-08T18:16:47.501613Z","submitted_at":"2024-02-02T18:23:18Z","title":"Nomic Embed: Training a Reproducible Long Context Text Embedder","version":2},"cited_work":{"arxiv_id":"2402.01613","doi":"10.48550/arxiv.2402.01613","metadata_source":"pith","pith_arxiv_id":"2402.01613","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Nomic Embed: Training a Reproducible Long Context Text Embedder","venue":"cs.CL","work_id":"7344ef1a-710c-4656-bae0-234752f16b85","year":2024},"citing_paper":{"arxiv_id":"2605.26409","last_updated":"2026-05-26T00:36:42Z","snapshot_observed_at":"2026-08-02T10:55:21.817292Z","submitted_at":"2026-05-26T00:36:42Z","title":"Jailbreak susceptibility prediction and mitigation via the behavioral geometry of models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-29T17:43:47.849960Z"},"links":{"cited_paper":"/paper/2402.01613","citing_paper":"/paper/2605.26409"},"observation_digest":"sha256:f4f0d047d772aaf4b1a2e95653c59d6299d44c2cce60f806108663b6a9732fdd","observation_id":"06fc51e2-8089-4760-91c0-f4199eea8fd7","resolution":{"observed_at":"2026-06-29T17:53:47.699732Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T17:43:47.849960Z","title":"New embedding models and API updates","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.26409","last_updated":"2026-05-26T00:36:42Z","snapshot_observed_at":"2026-08-02T10:55:21.817292Z","submitted_at":"2026-05-26T00:36:42Z","title":"Jailbreak susceptibility prediction and mitigation via the behavioral geometry of models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-29T17:43:47.849960Z"},"links":{"citing_paper":"/paper/2605.26409"},"observation_digest":"sha256:1b4804a190480a51177b3f58091a3e1e501e9e0a5d953531ffeb603efebd79d8","observation_id":"025e4852-7ad9-475a-9783-70c7319d16f4","resolution":{"observed_at":"2026-06-29T17:43:47.849960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2605.26409","last_updated":"2026-05-26T00:36:42Z","snapshot_observed_at":"2026-08-02T10:55:21.817292Z","submitted_at":"2026-05-26T00:36:42Z","title":"Jailbreak susceptibility prediction and mitigation via the behavioral geometry of models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-29T17:43:47.849960Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2605.26409"},"observation_digest":"sha256:a72c87b48043a1400d4a4cd4d1053958c73f4a4fb1733cc49a9f7f204861ca94","observation_id":"ce9fd866-2e9c-4eea-85d1-fc364e488b15","resolution":{"observed_at":"2026-06-29T17:53:47.709554Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T17:43:47.849960Z","title":"Ignore previous prompt: Attack techniques for language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.26409","last_updated":"2026-05-26T00:36:42Z","snapshot_observed_at":"2026-08-02T10:55:21.817292Z","submitted_at":"2026-05-26T00:36:42Z","title":"Jailbreak susceptibility prediction and mitigation via the behavioral geometry of models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-29T17:43:47.849960Z"},"links":{"citing_paper":"/paper/2605.26409"},"observation_digest":"sha256:79cecdc4c1b5bb44124ebf8808d9e72e5bf44bfb4670aa3543ee3e09401c54d0","observation_id":"6a7eff41-0214-4883-be25-505085d2153c","resolution":{"observed_at":"2026-06-29T17:43:47.849960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T17:43:47.849960Z","title":"LLM self defense: By self examination, LLMs know they are being tricked","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.26409","last_updated":"2026-05-26T00:36:42Z","snapshot_observed_at":"2026-08-02T10:55:21.817292Z","submitted_at":"2026-05-26T00:36:42Z","title":"Jailbreak susceptibility prediction and mitigation via the behavioral geometry of models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-29T17:43:47.849960Z"},"links":{"citing_paper":"/paper/2605.26409"},"observation_digest":"sha256:e484fa9bc0e4e6f6c315a2bb113d5beb01d2c957f966a8fdc746021914763e09","observation_id":"5a5e0d8c-2f6b-44be-b38d-36c804db62f5","resolution":{"observed_at":"2026-06-29T17:43:47.849960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14992","last_updated":"2024-05-26T22:27:23Z","snapshot_observed_at":"2026-08-05T12:01:06.707349Z","submitted_at":"2024-02-22T22:05:23Z","title":"tinyBenchmarks: evaluating LLMs with fewer examples","version":2},"cited_work":{"arxiv_id":"2402.14992","doi":"10.48550/arxiv.2402.14992","metadata_source":"pith","pith_arxiv_id":"2402.14992","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"David Rein, Betty Li Hou, Asa Cooper Stickland, Jack- son Petty, Richard Yuanzhe Pang, Julien Dirani, Ju- lian Michael, and Samuel R Bowman","venue":"cs.CL","work_id":"1aaa40b4-1321-4f79-85a8-e296eaa2b732","year":2024},"citing_paper":{"arxiv_id":"2605.26409","last_updated":"2026-05-26T00:36:42Z","snapshot_observed_at":"2026-08-02T10:55:21.817292Z","submitted_at":"2026-05-26T00:36:42Z","title":"Jailbreak susceptibility prediction and mitigation via the behavioral geometry of models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-29T17:43:47.849960Z"},"links":{"cited_paper":"/paper/2402.14992","citing_paper":"/paper/2605.26409"},"observation_digest":"sha256:6707b3adad718b0f476bfc6e89d50804f7f146baf666a3d7a38733a1f2cc19c8","observation_id":"1aa01361-75d2-4f56-a12e-30cdb76ff703","resolution":{"observed_at":"2026-06-29T17:53:47.703641Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T17:43:47.849960Z","title":"SVCCA: Singu- lar vector canonical correlation analysis for deep learning dynamics and interpretability","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2605.26409","last_updated":"2026-05-26T00:36:42Z","snapshot_observed_at":"2026-08-02T10:55:21.817292Z","submitted_at":"2026-05-26T00:36:42Z","title":"Jailbreak susceptibility prediction and mitigation via the behavioral geometry of models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-29T17:43:47.849960Z"},"links":{"citing_paper":"/paper/2605.26409"},"observation_digest":"sha256:a69ce5f4a5fcaf9702be1c432faf88695d396d8425676efd6037ce9dd27c5f4c","observation_id":"a86b13a9-36f5-4eda-9ca5-e5821dafed7d","resolution":{"observed_at":"2026-06-29T17:43:47.849960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03684","last_updated":"2024-06-11T19:02:52Z","snapshot_observed_at":"2026-07-06T16:28:22.350574Z","submitted_at":"2023-10-05T17:01:53Z","title":"SmoothLLM: Defending Large Language Models Against Jailbreaking Attacks","version":4},"cited_work":{"arxiv_id":"2310.03684","doi":"10.48550/arxiv.2310.03684","metadata_source":"pith","pith_arxiv_id":"2310.03684","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SmoothLLM: Defending Large Language Models Against Jailbreaking Attacks","venue":"cs.LG","work_id":"f670dc77-bf11-46fc-af9d-b77215abd084","year":2023},"citing_paper":{"arxiv_id":"2605.26409","last_updated":"2026-05-26T00:36:42Z","snapshot_observed_at":"2026-08-02T10:55:21.817292Z","submitted_at":"2026-05-26T00:36:42Z","title":"Jailbreak susceptibility prediction and mitigation via the behavioral geometry of models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-29T17:43:47.849960Z"},"links":{"cited_paper":"/paper/2310.03684","citing_paper":"/paper/2605.26409"},"observation_digest":"sha256:bbe96c4a78a6bf477a8c5aa65fba80e8713f50d8f3ed36407cb1fe660c0bb29c","observation_id":"0c9f9578-9876-4d22-aba4-d6f74d5cd1f5","resolution":{"observed_at":"2026-06-29T17:53:47.696426Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T17:43:47.849960Z","title":"Great, now write an article about that: The Crescendo multi-turn LLM jailbreak attack","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.26409","last_updated":"2026-05-26T00:36:42Z","snapshot_observed_at":"2026-08-02T10:55:21.817292Z","submitted_at":"2026-05-26T00:36:42Z","title":"Jailbreak susceptibility prediction and mitigation via the behavioral geometry of models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-29T17:43:47.849960Z"},"links":{"citing_paper":"/paper/2605.26409"},"observation_digest":"sha256:16de3c6536c6a1cff4a1b7590b2cb7787bd956a6732bb7b773a15c6ac6d35c9d","observation_id":"a1980723-2644-476c-9a39-f864704f56ea","resolution":{"observed_at":"2026-06-29T17:43:47.849960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.01687","last_updated":"2026-05-03T02:55:30Z","snapshot_observed_at":"2026-08-12T19:37:22.407983Z","submitted_at":"2026-05-03T02:55:30Z","title":"MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety","version":1},"cited_work":{"arxiv_id":"2605.01687","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.01687","snapshot_observed_at":"2026-07-04T17:09:59.507308Z","title":"MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety","venue":"cs.CL","work_id":"97439a06-e61b-4cba-b519-f72ac8f8aae1","year":2026},"citing_paper":{"arxiv_id":"2605.26409","last_updated":"2026-05-26T00:36:42Z","snapshot_observed_at":"2026-08-02T10:55:21.817292Z","submitted_at":"2026-05-26T00:36:42Z","title":"Jailbreak susceptibility prediction and mitigation via the behavioral geometry of models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-29T17:43:47.849960Z"},"links":{"cited_paper":"/paper/2605.01687","citing_paper":"/paper/2605.26409"},"observation_digest":"sha256:9967302cba421a7893b4a0334c412c43e389c327dcfb917e0ed38400eaf1ebc4","observation_id":"f2a19d41-325d-4348-a32c-b929caee1f59","resolution":{"observed_at":"2026-06-29T17:53:47.689060Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04436","last_updated":"2024-12-11T17:22:54Z","snapshot_observed_at":"2026-08-04T07:48:13.093374Z","submitted_at":"2024-02-06T22:13:51Z","title":"Continuous Multidimensional Scaling","version":3},"cited_work":{"arxiv_id":"2402.04436","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.04436","snapshot_observed_at":"2026-06-30T11:54:38.141397Z","title":"Available: https://arxiv.org/abs/2402.04436","venue":null,"work_id":"e172ad97-5c03-4cad-b828-7488c0f2668c","year":2024},"citing_paper":{"arxiv_id":"2605.26409","last_updated":"2026-05-26T00:36:42Z","snapshot_observed_at":"2026-08-02T10:55:21.817292Z","submitted_at":"2026-05-26T00:36:42Z","title":"Jailbreak susceptibility prediction and mitigation via the behavioral geometry of models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-29T17:43:47.849960Z"},"links":{"cited_paper":"/paper/2402.04436","citing_paper":"/paper/2605.26409"},"observation_digest":"sha256:f02fc164469aa6af831fecf818518ff476f207ed6d55242d29470ba77cdde6b1","observation_id":"df09e9e9-f305-45f1-91f8-e5987fe832c9","resolution":{"observed_at":"2026-06-29T17:53:47.694100Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T17:43:47.849960Z","title":"Anchor points: Benchmarking models with much fewer examples","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.26409","last_updated":"2026-05-26T00:36:42Z","snapshot_observed_at":"2026-08-02T10:55:21.817292Z","submitted_at":"2026-05-26T00:36:42Z","title":"Jailbreak susceptibility prediction and mitigation via the behavioral geometry of models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-29T17:43:47.849960Z"},"links":{"citing_paper":"/paper/2605.26409"},"observation_digest":"sha256:c2b47531c669cdc1199a76082c42f644b33bb87dc255480431cc50e3cb854571","observation_id":"8debb42c-9a4f-40c7-8424-b9fb3797cc4e","resolution":{"observed_at":"2026-06-29T17:43:47.849960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T17:43:47.849960Z","title":"Jailbroken: How does LLM safety training fail? InAdvances in Neural Information Processing Systems, volume 36, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.26409","last_updated":"2026-05-26T00:36:42Z","snapshot_observed_at":"2026-08-02T10:55:21.817292Z","submitted_at":"2026-05-26T00:36:42Z","title":"Jailbreak susceptibility prediction and mitigation via the behavioral geometry of models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-29T17:43:47.849960Z"},"links":{"citing_paper":"/paper/2605.26409"},"observation_digest":"sha256:12e21e954af0c83649c6d53074470369b05c88712a408c465738fc2d5272c829","observation_id":"f7b21712-285f-4302-9305-078551f9c0ff","resolution":{"observed_at":"2026-06-29T17:43:47.849960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06387","last_updated":"2024-05-25T07:01:15Z","snapshot_observed_at":"2026-08-06T13:25:52.403871Z","submitted_at":"2023-10-10T07:50:29Z","title":"Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations","version":3},"cited_work":{"arxiv_id":"2310.06387","doi":"10.48550/arxiv.2310.06387","metadata_source":"pith","pith_arxiv_id":"2310.06387","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Jailbreak and guard aligned language models with only few in-context demonstrations","venue":"cs.LG","work_id":"4fe10dc2-a8a4-46ec-bb39-b0edae135f1d","year":2023},"citing_paper":{"arxiv_id":"2605.26409","last_updated":"2026-05-26T00:36:42Z","snapshot_observed_at":"2026-08-02T10:55:21.817292Z","submitted_at":"2026-05-26T00:36:42Z","title":"Jailbreak susceptibility prediction and mitigation via the behavioral geometry of models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-29T17:43:47.849960Z"},"links":{"cited_paper":"/paper/2310.06387","citing_paper":"/paper/2605.26409"},"observation_digest":"sha256:118426bc496459dd3a4126fc739ce66e6f97f419a84f5911dd8b1e78363b8726","observation_id":"c766b4e8-3c80-4acc-acc4-12cc8b8205e3","resolution":{"observed_at":"2026-06-29T17:53:47.699039Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-05-24T00:53:10.432951+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T00:53:10.432951+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T17:43:47.849960Z","title":"C-Pack: Packaged resources to advance general Chinese embedding, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.26409","last_updated":"2026-05-26T00:36:42Z","snapshot_observed_at":"2026-08-02T10:55:21.817292Z","submitted_at":"2026-05-26T00:36:42Z","title":"Jailbreak susceptibility prediction and mitigation via the behavioral geometry of models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-29T17:43:47.849960Z"},"links":{"citing_paper":"/paper/2605.26409"},"observation_digest":"sha256:ac3e647041513a82f09b90807eb43ad407fe16a0951a302bbfaed2430b32222d","observation_id":"4130fe60-de60-4e94-b365-732c0eb031c6","resolution":{"observed_at":"2026-06-29T17:43:47.849960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T17:43:47.849960Z","title":"Defending ChatGPT against jailbreak attack via self-reminders.Nature Machine Intelligence, 5:1486–1496, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.26409","last_updated":"2026-05-26T00:36:42Z","snapshot_observed_at":"2026-08-02T10:55:21.817292Z","submitted_at":"2026-05-26T00:36:42Z","title":"Jailbreak susceptibility prediction and mitigation via the behavioral geometry of models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-29T17:43:47.849960Z"},"links":{"citing_paper":"/paper/2605.26409"},"observation_digest":"sha256:2a3fed0bee3aafc1f1cd9ae50b1f41bf47b0c982c7299a2208284f975c2ff7fd","observation_id":"59dd70bd-65d8-4975-8d99-7b2f0935931d","resolution":{"observed_at":"2026-06-29T17:43:47.849960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04295","last_updated":"2024-08-30T11:57:47Z","snapshot_observed_at":"2026-08-12T17:45:10.384900Z","submitted_at":"2024-07-05T06:57:30Z","title":"Jailbreak Attacks and Defenses Against Large Language Models: A Survey","version":2},"cited_work":{"arxiv_id":"2407.04295","doi":"10.48550/arxiv.2407.04295","metadata_source":"pith","pith_arxiv_id":"2407.04295","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Jailbreak Attacks and Defenses Against Large Language Models: A Survey","venue":"cs.CR","work_id":"0ee7fc45-ae61-432b-83ac-f1d93ccd88fb","year":2024},"citing_paper":{"arxiv_id":"2605.26409","last_updated":"2026-05-26T00:36:42Z","snapshot_observed_at":"2026-08-02T10:55:21.817292Z","submitted_at":"2026-05-26T00:36:42Z","title":"Jailbreak susceptibility prediction and mitigation via the behavioral geometry of models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-29T17:43:47.849960Z"},"links":{"cited_paper":"/paper/2407.04295","citing_paper":"/paper/2605.26409"},"observation_digest":"sha256:cf4d6e4005105300a9393ca3cd1f828670cdc6de3e0ef78960836f4573385f26","observation_id":"f71a068b-f6e5-4020-9789-91be10400736","resolution":{"observed_at":"2026-06-29T17:53:47.702101Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-05-24T00:53:04.67981+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T00:53:04.67981+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04783","last_updated":"2024-11-14T18:14:00Z","snapshot_observed_at":"2026-08-07T06:17:52.920196Z","submitted_at":"2024-03-02T16:52:22Z","title":"AutoDefense: Multi-Agent LLM Defense against Jailbreak Attacks","version":2},"cited_work":{"arxiv_id":"2403.04783","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.04783","snapshot_observed_at":"2026-07-09T10:26:11.076263Z","title":"Autodefense: Multi-agent llm defense against jailbreak attacks","venue":"cs.LG","work_id":"2470c178-add6-463c-b04b-b4d405767b5d","year":2024},"citing_paper":{"arxiv_id":"2605.26409","last_updated":"2026-05-26T00:36:42Z","snapshot_observed_at":"2026-08-02T10:55:21.817292Z","submitted_at":"2026-05-26T00:36:42Z","title":"Jailbreak susceptibility prediction and mitigation via the behavioral geometry of models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-29T17:43:47.849960Z"},"links":{"cited_paper":"/paper/2403.04783","citing_paper":"/paper/2605.26409"},"observation_digest":"sha256:f356db975e42c34e80994ea9336a57637a6b36b38e0a96a527125f7c414f8635","observation_id":"7d4cad6a-e56d-413b-b317-5a8a43f7c4f9","resolution":{"observed_at":"2026-06-29T17:53:47.691753Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T17:43:47.849960Z","title":"Intention analysis makes LLMs a good jailbreak defender","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.26409","last_updated":"2026-05-26T00:36:42Z","snapshot_observed_at":"2026-08-02T10:55:21.817292Z","submitted_at":"2026-05-26T00:36:42Z","title":"Jailbreak susceptibility prediction and mitigation via the behavioral geometry of models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-29T17:43:47.849960Z"},"links":{"citing_paper":"/paper/2605.26409"},"observation_digest":"sha256:95e3d1d574283859d0a71f9a437537a6627c6499e19b8f33a4e64502f72b6704","observation_id":"43dba919-3e6e-41fb-869b-99376f07e4e2","resolution":{"observed_at":"2026-06-29T17:43:47.849960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T17:43:47.849960Z","title":"Judging LLM-as-a-judge with MT-bench and chatbot arena","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.26409","last_updated":"2026-05-26T00:36:42Z","snapshot_observed_at":"2026-08-02T10:55:21.817292Z","submitted_at":"2026-05-26T00:36:42Z","title":"Jailbreak susceptibility prediction and mitigation via the behavioral geometry of models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-29T17:43:47.849960Z"},"links":{"citing_paper":"/paper/2605.26409"},"observation_digest":"sha256:ff0cf88f98fdbe90ebf54150e0be70972c82686babeed2476091aa379491ee71","observation_id":"68f52704-ff77-4012-acd7-e721434d8c61","resolution":{"observed_at":"2026-06-29T17:43:47.849960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-08-12T09:06:50.363435Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":"2307.15043","doi":"10.48550/arxiv.2307.15043","metadata_source":"pith","pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","venue":"cs.CL","work_id":"3322fa86-1768-4677-8425-dd326b45e078","year":2023},"citing_paper":{"arxiv_id":"2605.26409","last_updated":"2026-05-26T00:36:42Z","snapshot_observed_at":"2026-08-02T10:55:21.817292Z","submitted_at":"2026-05-26T00:36:42Z","title":"Jailbreak susceptibility prediction and mitigation via the behavioral geometry of models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-29T17:43:47.849960Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2605.26409"},"observation_digest":"sha256:43d613111eb9b5e098bc2dfcb0615c204d4fe2211decf6e12f029798b6bd19a6","observation_id":"05bfefe7-ad51-43a9-bd0d-989098d2d46f","resolution":{"observed_at":"2026-06-29T17:53:47.694100Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T17:43:47.849960Z","title":"{attack}","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.26409","last_updated":"2026-05-26T00:36:42Z","snapshot_observed_at":"2026-08-02T10:55:21.817292Z","submitted_at":"2026-05-26T00:36:42Z","title":"Jailbreak susceptibility prediction and mitigation via the behavioral geometry of models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-29T17:43:47.849960Z"},"links":{"citing_paper":"/paper/2605.26409"},"observation_digest":"sha256:67c7e0f888805715535a0d24d98df32f50594325fccfb119a841d5eda51161a8","observation_id":"f5d487d5-9201-4adc-a7bd-b2162d66541f","resolution":{"observed_at":"2026-06-29T17:43:47.849960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2605.26409","last_updated":"2026-05-26T00:36:42Z","latest_version":1,"primary_category":"cs.CR","snapshot_observed_at":"2026-08-02T10:55:21.817292Z","submitted_at":"2026-05-26T00:36:42Z","title":"Jailbreak susceptibility prediction and mitigation via the behavioral geometry of models"},"reference_resolution":{"displayed":48,"state_counts":{"malformed_identifier":0,"metadata_mismatch":5,"parse_uncertain":0,"unresolved":22,"verified_exact":21,"verified_fuzzy":0},"total_outbound_references":48},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 48 of 48 outbound references and 0 inbound Pith citation observations for arXiv:2605.26409."}