{"as_of":"2026-07-22T08:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:704d94e071e5bbb06fba5c30b4dcd33c7291197ccf901e886b4eb7d0a9c5295b","coverage":[{"denominator":37,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T13:10:44.728498Z","state":"measured"},{"denominator":37,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":37,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-07-22T06:31:00.163083+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.24552/citation-record","integrity":"/paper/2605.24552/integrity","json":"/paper/2605.24552/citation-record.json","paper":"/paper/2605.24552"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":"2302.13971","doi":"10.48550/arxiv.2302.13971","metadata_source":"pith","pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-07-11T03:47:48.508181Z","title":"LLaMA: Open and Efficient Foundation Language Models","venue":"cs.CL","work_id":"c018fc23-6f3f-4035-9d02-28a2173b2b9d","year":2023},"citing_paper":{"arxiv_id":"2605.24552","last_updated":"2026-05-23T12:39:25Z","snapshot_observed_at":"2026-07-06T23:34:38.098785Z","submitted_at":"2026-05-23T12:39:25Z","title":"Ellipsoid Control: A White-list Jailbreak Defense via Benign Latent Modeling","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-30T13:10:44.728498Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2605.24552"},"observation_digest":"sha256:14aa0c55232d9306b3661fef322df9aca0a0eba3a4596fe15e7e672afe0d38fd","observation_id":"66f9ff6a-f9c5-414c-a2ce-b53ad352c548","resolution":{"observed_at":"2026-06-30T13:14:40.756189Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-05-22T13:22:41.000069+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T13:22:41.000069+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2605.24552","last_updated":"2026-05-23T12:39:25Z","snapshot_observed_at":"2026-07-06T23:34:38.098785Z","submitted_at":"2026-05-23T12:39:25Z","title":"Ellipsoid Control: A White-list Jailbreak Defense via Benign Latent Modeling","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-30T13:10:44.728498Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2605.24552"},"observation_digest":"sha256:7b99b0ef418aee179392b6e83c71e02b024bd95fefd1a052a3b7d6e6a5b5eb71","observation_id":"7cbb8d6e-8f7d-4f55-b68f-8ff17d02f887","resolution":{"observed_at":"2026-06-30T13:14:40.751161Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":"2309.16609","doi":"10.48550/arxiv.2309.16609","metadata_source":"pith","pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-07-10T20:57:35.014119Z","title":"Qwen Technical Report","venue":"cs.CL","work_id":"bb1fd52f-6b2f-437c-9516-37bdf6eb9be8","year":2023},"citing_paper":{"arxiv_id":"2605.24552","last_updated":"2026-05-23T12:39:25Z","snapshot_observed_at":"2026-07-06T23:34:38.098785Z","submitted_at":"2026-05-23T12:39:25Z","title":"Ellipsoid Control: A White-list Jailbreak Defense via Benign Latent Modeling","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-30T13:10:44.728498Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2605.24552"},"observation_digest":"sha256:d969cde218d4d8b9e032e616b3ebd1c2ac34465419f4ca487c7a41f698f2e758","observation_id":"9b839605-2ba6-4cdd-afb9-2882689faaea","resolution":{"observed_at":"2026-06-30T13:14:40.787899Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-15T23:50:15.620681+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T23:50:15.620681+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:15:57.788392Z","title":"Iron: Private inference on transformers,","venue":null,"work_id":"e0cd742e-2f75-4566-b904-4efeb00e0517","year":2022},"citing_paper":{"arxiv_id":"2605.24552","last_updated":"2026-05-23T12:39:25Z","snapshot_observed_at":"2026-07-06T23:34:38.098785Z","submitted_at":"2026-05-23T12:39:25Z","title":"Ellipsoid Control: A White-list Jailbreak Defense via Benign Latent Modeling","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-30T13:10:44.728498Z"},"links":{"citing_paper":"/paper/2605.24552"},"observation_digest":"sha256:6ec38979ea71547975c50c733bfccb75c700897d641b57685fee9d26f1bdc546","observation_id":"f2c32fc5-ea25-4a6b-a2cc-ce1a2bcc4821","resolution":{"observed_at":"2026-07-09T03:15:57.789682Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:15:57.790275Z","title":"Efficient and privacy-enhanced federated learning for industrial artificial intelligence,","venue":null,"work_id":"4de40e14-a90a-4c5d-b8e6-9c62564d5432","year":2020},"citing_paper":{"arxiv_id":"2605.24552","last_updated":"2026-05-23T12:39:25Z","snapshot_observed_at":"2026-07-06T23:34:38.098785Z","submitted_at":"2026-05-23T12:39:25Z","title":"Ellipsoid Control: A White-list Jailbreak Defense via Benign Latent Modeling","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-30T13:10:44.728498Z"},"links":{"citing_paper":"/paper/2605.24552"},"observation_digest":"sha256:ac1d68b4c9614aef2d075c355f027167f50e63b45812e52baf38778bd6cb0f1c","observation_id":"e7009b8e-179e-4b2e-a7b0-4f9001eb36a8","resolution":{"observed_at":"2026-07-09T03:15:57.791615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:15:57.809251Z","title":"Scalable zero-knowledge proofs for non- linear functions in machine learning,","venue":null,"work_id":"a0287421-f38c-4913-8286-1df728d46116","year":2024},"citing_paper":{"arxiv_id":"2605.24552","last_updated":"2026-05-23T12:39:25Z","snapshot_observed_at":"2026-07-06T23:34:38.098785Z","submitted_at":"2026-05-23T12:39:25Z","title":"Ellipsoid Control: A White-list Jailbreak Defense via Benign Latent Modeling","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-30T13:10:44.728498Z"},"links":{"citing_paper":"/paper/2605.24552"},"observation_digest":"sha256:b0fe6259a19538a8ff0fca4ce5c4bbbd569beecd32179684e8d64e739e8cbe67","observation_id":"1ed14c9d-57af-4055-abd8-2c57a6db02a8","resolution":{"observed_at":"2026-07-09T03:15:57.810468Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04295","last_updated":"2024-08-30T11:57:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-05T06:57:30Z","title":"Jailbreak Attacks and Defenses Against Large Language Models: A Survey","version":2},"cited_work":{"arxiv_id":"2407.04295","doi":"10.48550/arxiv.2407.04295","metadata_source":"pith","pith_arxiv_id":"2407.04295","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Jailbreak Attacks and Defenses Against Large Language Models: A Survey","venue":"cs.CR","work_id":"0ee7fc45-ae61-432b-83ac-f1d93ccd88fb","year":2024},"citing_paper":{"arxiv_id":"2605.24552","last_updated":"2026-05-23T12:39:25Z","snapshot_observed_at":"2026-07-06T23:34:38.098785Z","submitted_at":"2026-05-23T12:39:25Z","title":"Ellipsoid Control: A White-list Jailbreak Defense via Benign Latent Modeling","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-30T13:10:44.728498Z"},"links":{"cited_paper":"/paper/2407.04295","citing_paper":"/paper/2605.24552"},"observation_digest":"sha256:804ea59be79acaf6c02b4a772b2eb5c15e1a471709dbb9ca9bccf0d3254c79ce","observation_id":"6d7bd4e5-f224-4f25-9f7d-392cdf37fedf","resolution":{"observed_at":"2026-06-30T13:14:40.753641Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-05-24T00:53:04.67981+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T00:53:04.67981+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:15:57.792195Z","title":"Improving alignment and robustness with circuit breakers,","venue":null,"work_id":"b5e198a2-0b91-43f2-93cf-621f575e7b9a","year":2024},"citing_paper":{"arxiv_id":"2605.24552","last_updated":"2026-05-23T12:39:25Z","snapshot_observed_at":"2026-07-06T23:34:38.098785Z","submitted_at":"2026-05-23T12:39:25Z","title":"Ellipsoid Control: A White-list Jailbreak Defense via Benign Latent Modeling","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-30T13:10:44.728498Z"},"links":{"citing_paper":"/paper/2605.24552"},"observation_digest":"sha256:c28515fbe3215bed4b6632951c74f845ef47d8311f5642f78e174d08e78d34ec","observation_id":"0da2d368-c72f-430b-a695-23e48690a1f1","resolution":{"observed_at":"2026-07-09T03:15:57.793385Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15549","last_updated":"2025-07-29T09:37:22Z","snapshot_observed_at":"2026-07-06T18:50:00.486434Z","submitted_at":"2024-07-22T11:19:14Z","title":"Latent Adversarial Training Improves Robustness to Persistent Harmful Behaviors in LLMs","version":3},"cited_work":{"arxiv_id":"2407.15549","doi":"10.48550/arxiv.2407.15549","metadata_source":"pith","pith_arxiv_id":"2407.15549","snapshot_observed_at":"2026-07-10T15:27:20.033839Z","title":"C., Perez, E., Hadfield-Menell, D., et al","venue":"cs.LG","work_id":"46e8b17f-8d32-4a99-ba53-ebc3b351426a","year":2024},"citing_paper":{"arxiv_id":"2605.24552","last_updated":"2026-05-23T12:39:25Z","snapshot_observed_at":"2026-07-06T23:34:38.098785Z","submitted_at":"2026-05-23T12:39:25Z","title":"Ellipsoid Control: A White-list Jailbreak Defense via Benign Latent Modeling","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-30T13:10:44.728498Z"},"links":{"cited_paper":"/paper/2407.15549","citing_paper":"/paper/2605.24552"},"observation_digest":"sha256:abab5348332b09b80451f22ac169979948d31e9f379b83a5ce3ffee8057e3584","observation_id":"6738ebac-6b5c-473d-87e3-9a19f3832e4d","resolution":{"observed_at":"2026-06-30T13:14:40.774910Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.14987","last_updated":"2022-03-28T18:00:51Z","snapshot_observed_at":"2026-07-06T12:53:50.496350Z","submitted_at":"2022-03-28T18:00:51Z","title":"Multilingual Knowledge Graph Completion with Self-Supervised Adaptive Graph Alignment","version":1},"cited_work":{"arxiv_id":"2203.14987","doi":"10.48550/arxiv","metadata_source":"doi_reference","pith_arxiv_id":"2203.14987","snapshot_observed_at":"2026-07-09T21:46:34.506658Z","title":"Dickerson","venue":"cs.AI","work_id":"5c2060c6-427c-4321-be22-49ccae439d80","year":2025},"citing_paper":{"arxiv_id":"2605.24552","last_updated":"2026-05-23T12:39:25Z","snapshot_observed_at":"2026-07-06T23:34:38.098785Z","submitted_at":"2026-05-23T12:39:25Z","title":"Ellipsoid Control: A White-list Jailbreak Defense via Benign Latent Modeling","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-30T13:10:44.728498Z"},"links":{"cited_paper":"/paper/2203.14987","citing_paper":"/paper/2605.24552"},"observation_digest":"sha256:084938e0ed461296c6b8b908c948f123e7327ab83e701ad95fedf49977014957","observation_id":"4a2d8890-698d-46fa-8e2b-87f6a233a4f9","resolution":{"observed_at":"2026-06-30T13:14:40.139833Z","resolver_source":"doi_truncated","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11717","last_updated":"2024-10-30T18:57:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-17T16:36:12Z","title":"Refusal in Language Models Is Mediated by a Single Direction","version":3},"cited_work":{"arxiv_id":"2406.11717","doi":"10.48550/arxiv.2406.11717","metadata_source":"pith","pith_arxiv_id":"2406.11717","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Refusal in Language Models Is Mediated by a Single Direction","venue":"cs.LG","work_id":"fbb9538d-8e58-4902-9fbd-b11f044bc2d5","year":2024},"citing_paper":{"arxiv_id":"2605.24552","last_updated":"2026-05-23T12:39:25Z","snapshot_observed_at":"2026-07-06T23:34:38.098785Z","submitted_at":"2026-05-23T12:39:25Z","title":"Ellipsoid Control: A White-list Jailbreak Defense via Benign Latent Modeling","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-30T13:10:44.728498Z"},"links":{"cited_paper":"/paper/2406.11717","citing_paper":"/paper/2605.24552"},"observation_digest":"sha256:d40465c2a5b59e61430cae957ba78c3e4554db2e107b4caa25473d071bdbad90","observation_id":"3f33ee8f-6323-4855-b9ce-f31cbcaaa09e","resolution":{"observed_at":"2026-06-30T13:14:40.777200Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:27:32.582436+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:27:32.582436+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02298","last_updated":"2025-02-07T06:23:17Z","snapshot_observed_at":"2026-07-06T19:26:49.672415Z","submitted_at":"2024-10-03T08:34:17Z","title":"Jailbreak Antidote: Runtime Safety-Utility Balance via Sparse Representation Adjustment in Large Language Models","version":4},"cited_work":{"arxiv_id":"2410.02298","doi":"10.48550/arxiv.2410.02298","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02298","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"arXiv preprint arXiv:2410.02298 , year=","venue":null,"work_id":"ac2802d8-6ffd-4de1-a754-c819498000f8","year":2024},"citing_paper":{"arxiv_id":"2605.24552","last_updated":"2026-05-23T12:39:25Z","snapshot_observed_at":"2026-07-06T23:34:38.098785Z","submitted_at":"2026-05-23T12:39:25Z","title":"Ellipsoid Control: A White-list Jailbreak Defense via Benign Latent Modeling","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-30T13:10:44.728498Z"},"links":{"cited_paper":"/paper/2410.02298","citing_paper":"/paper/2605.24552"},"observation_digest":"sha256:5fe2c9c484c76cacedc67384e0aaa913f450d55e88e4d096dae22fb55dd55751","observation_id":"96c08b32-767b-41ff-af22-78225efc3502","resolution":{"observed_at":"2026-06-30T13:14:40.137665Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:15:57.801446Z","title":"Programming refusal with conditional activation steering,","venue":null,"work_id":"9eaf01f9-5f38-4bf7-b5d9-efdc7b3adf65","year":2025},"citing_paper":{"arxiv_id":"2605.24552","last_updated":"2026-05-23T12:39:25Z","snapshot_observed_at":"2026-07-06T23:34:38.098785Z","submitted_at":"2026-05-23T12:39:25Z","title":"Ellipsoid Control: A White-list Jailbreak Defense via Benign Latent Modeling","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-30T13:10:44.728498Z"},"links":{"citing_paper":"/paper/2605.24552"},"observation_digest":"sha256:674c35e7060e11cdb52b7ac69435ae386ff59298663e298ec2bf955f243b028f","observation_id":"787c580f-fa62-4ea7-8498-103ca5608e79","resolution":{"observed_at":"2026-07-09T03:15:57.802702Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:15:57.793969Z","title":"Soft prompt threats: Attacking safety alignment and unlearning in open-source llms through the embedding space,","venue":null,"work_id":"392fc6dc-3849-4e02-b107-594444a53231","year":2024},"citing_paper":{"arxiv_id":"2605.24552","last_updated":"2026-05-23T12:39:25Z","snapshot_observed_at":"2026-07-06T23:34:38.098785Z","submitted_at":"2026-05-23T12:39:25Z","title":"Ellipsoid Control: A White-list Jailbreak Defense via Benign Latent Modeling","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-30T13:10:44.728498Z"},"links":{"citing_paper":"/paper/2605.24552"},"observation_digest":"sha256:57b98753b8e97edf8685155b81fc4a8f5f3833e676e4fb76c6db3f6c4ac7a1f9","observation_id":"e6acd177-c323-4a13-a90f-da37e12766dc","resolution":{"observed_at":"2026-07-09T03:15:57.795327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20947","last_updated":"2025-06-15T21:44:25Z","snapshot_observed_at":"2026-07-06T18:23:23.565502Z","submitted_at":"2024-05-31T15:44:33Z","title":"OR-Bench: An Over-Refusal Benchmark for Large Language Models","version":5},"cited_work":{"arxiv_id":"2405.20947","doi":"10.48550/arxiv.2405.20947","metadata_source":"pith","pith_arxiv_id":"2405.20947","snapshot_observed_at":"2026-07-10T15:27:20.068292Z","title":"OR- Bench: An over-refusal benchmark for large language models","venue":"cs.CL","work_id":"5dc76f29-8555-4005-954c-6e085345fc2f","year":2024},"citing_paper":{"arxiv_id":"2605.24552","last_updated":"2026-05-23T12:39:25Z","snapshot_observed_at":"2026-07-06T23:34:38.098785Z","submitted_at":"2026-05-23T12:39:25Z","title":"Ellipsoid Control: A White-list Jailbreak Defense via Benign Latent Modeling","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-30T13:10:44.728498Z"},"links":{"cited_paper":"/paper/2405.20947","citing_paper":"/paper/2605.24552"},"observation_digest":"sha256:1ca5e6aa6bd4157fb96d8c025c115ea5a3d9fc05339e9368d5b8107e3d7fa50b","observation_id":"5c988fe2-ee8a-4724-ac32-bb8ab070abe3","resolution":{"observed_at":"2026-06-30T13:14:40.779901Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:15:57.803456Z","title":"Harmbench: A standardized evaluation framework for automated red teaming and robust refusal,","venue":null,"work_id":"92d1a986-cdd1-4aa1-9776-ffbd64493bd1","year":2024},"citing_paper":{"arxiv_id":"2605.24552","last_updated":"2026-05-23T12:39:25Z","snapshot_observed_at":"2026-07-06T23:34:38.098785Z","submitted_at":"2026-05-23T12:39:25Z","title":"Ellipsoid Control: A White-list Jailbreak Defense via Benign Latent Modeling","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-30T13:10:44.728498Z"},"links":{"citing_paper":"/paper/2605.24552"},"observation_digest":"sha256:7f777f01099513e622c40cc8002804ce618dc540e71107f2ec908cccca340aab","observation_id":"5e76621a-efc1-4cc6-a561-8e29d4346fbd","resolution":{"observed_at":"2026-07-09T03:15:57.804758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00614","last_updated":"2023-09-04T17:47:36Z","snapshot_observed_at":"2026-07-06T16:13:23.343694Z","submitted_at":"2023-09-01T17:59:44Z","title":"Baseline Defenses for Adversarial Attacks Against Aligned Language Models","version":2},"cited_work":{"arxiv_id":"2309.00614","doi":"10.48550/arxiv.2309.00614","metadata_source":"pith","pith_arxiv_id":"2309.00614","snapshot_observed_at":"2026-07-10T15:47:23.193067Z","title":"Baseline Defenses for Adversarial Attacks Against Aligned Language Models","venue":"cs.LG","work_id":"db5870ca-177b-4d1d-a08d-ee5ceab17fe3","year":2023},"citing_paper":{"arxiv_id":"2605.24552","last_updated":"2026-05-23T12:39:25Z","snapshot_observed_at":"2026-07-06T23:34:38.098785Z","submitted_at":"2026-05-23T12:39:25Z","title":"Ellipsoid Control: A White-list Jailbreak Defense via Benign Latent Modeling","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-30T13:10:44.728498Z"},"links":{"cited_paper":"/paper/2309.00614","citing_paper":"/paper/2605.24552"},"observation_digest":"sha256:957fdce404aa876931e97c9fafa1cd6772e18e4df7b4267f7f9c5571d6bb59a4","observation_id":"c2478fe6-46c1-482e-a782-bb14b8478eb3","resolution":{"observed_at":"2026-06-30T13:14:40.772111Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-12T03:19:31.483658+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T03:19:31.483658+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16192","last_updated":"2024-02-28T23:11:33Z","snapshot_observed_at":"2026-07-06T17:35:14.603648Z","submitted_at":"2024-02-25T20:36:03Z","title":"Defending Large Language Models against Jailbreak Attacks via Semantic Smoothing","version":2},"cited_work":{"arxiv_id":"2402.16192","doi":"10.48550/arxiv.2402.16192","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.16192","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Defending large language models against jailbreak attacks via semantic smoothing","venue":null,"work_id":"6f0458ba-95b0-479f-8704-1317c465f4a7","year":2024},"citing_paper":{"arxiv_id":"2605.24552","last_updated":"2026-05-23T12:39:25Z","snapshot_observed_at":"2026-07-06T23:34:38.098785Z","submitted_at":"2026-05-23T12:39:25Z","title":"Ellipsoid Control: A White-list Jailbreak Defense via Benign Latent Modeling","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-30T13:10:44.728498Z"},"links":{"cited_paper":"/paper/2402.16192","citing_paper":"/paper/2605.24552"},"observation_digest":"sha256:a5886e4f6e6dce7a5271b6a220a2205742dd2a6342f79b4236b3967aaaa63028","observation_id":"e956a31d-3298-4ea6-a5dc-fcbcff75ef51","resolution":{"observed_at":"2026-06-30T13:14:40.146333Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03684","last_updated":"2024-06-11T19:02:52Z","snapshot_observed_at":"2026-07-06T16:28:22.350574Z","submitted_at":"2023-10-05T17:01:53Z","title":"SmoothLLM: Defending Large Language Models Against Jailbreaking Attacks","version":4},"cited_work":{"arxiv_id":"2310.03684","doi":"10.48550/arxiv.2310.03684","metadata_source":"pith","pith_arxiv_id":"2310.03684","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"SmoothLLM: Defending Large Language Models Against Jailbreaking Attacks","venue":"cs.LG","work_id":"f670dc77-bf11-46fc-af9d-b77215abd084","year":2023},"citing_paper":{"arxiv_id":"2605.24552","last_updated":"2026-05-23T12:39:25Z","snapshot_observed_at":"2026-07-06T23:34:38.098785Z","submitted_at":"2026-05-23T12:39:25Z","title":"Ellipsoid Control: A White-list Jailbreak Defense via Benign Latent Modeling","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-30T13:10:44.728498Z"},"links":{"cited_paper":"/paper/2310.03684","citing_paper":"/paper/2605.24552"},"observation_digest":"sha256:9df970cd35a1e1f60eb9df3d452972a82af09d3ee2feda15799a3aafd80b806c","observation_id":"12679439-e34b-427d-8426-6114c5c3f11a","resolution":{"observed_at":"2026-06-30T13:14:40.767029Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14348","last_updated":"2024-06-12T00:27:06Z","snapshot_observed_at":"2026-07-06T16:23:26.584450Z","submitted_at":"2023-09-18T02:07:22Z","title":"Defending Against Alignment-Breaking Attacks via Robustly Aligned LLM","version":3},"cited_work":{"arxiv_id":"2309.14348","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.14348","snapshot_observed_at":"2026-06-30T13:14:40.788988Z","title":"Defending against alignment-breaking attacks via robustly aligned llm","venue":null,"work_id":"d7a9a1c5-eebe-42d4-ba4d-b7f932432274","year":2023},"citing_paper":{"arxiv_id":"2605.24552","last_updated":"2026-05-23T12:39:25Z","snapshot_observed_at":"2026-07-06T23:34:38.098785Z","submitted_at":"2026-05-23T12:39:25Z","title":"Ellipsoid Control: A White-list Jailbreak Defense via Benign Latent Modeling","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-30T13:10:44.728498Z"},"links":{"cited_paper":"/paper/2309.14348","citing_paper":"/paper/2605.24552"},"observation_digest":"sha256:23bf9da2cfe5d25186cd56ffd532bc0327cae300ce71ef3c11ef27ca4edbc5bc","observation_id":"c63dfc51-94c3-4b1c-b58a-251dc347d6bf","resolution":{"observed_at":"2026-06-30T13:14:40.790523Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06561","last_updated":"2024-12-16T08:43:24Z","snapshot_observed_at":"2026-07-06T17:14:45.068795Z","submitted_at":"2024-01-12T13:15:05Z","title":"Intention Analysis Makes LLMs A Good Jailbreak Defender","version":4},"cited_work":{"arxiv_id":"2401.06561","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.06561","snapshot_observed_at":"2026-07-04T08:49:42.661881Z","title":"Intention analysis makes llms a good jailbreak defender","venue":null,"work_id":"e9e9aa70-71dc-41fe-a630-eca9a7e23b72","year":2024},"citing_paper":{"arxiv_id":"2605.24552","last_updated":"2026-05-23T12:39:25Z","snapshot_observed_at":"2026-07-06T23:34:38.098785Z","submitted_at":"2026-05-23T12:39:25Z","title":"Ellipsoid Control: A White-list Jailbreak Defense via Benign Latent Modeling","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-30T13:10:44.728498Z"},"links":{"cited_paper":"/paper/2401.06561","citing_paper":"/paper/2605.24552"},"observation_digest":"sha256:b51d7f8033623348fff623a1b86c3c66a7df58f345adff7c1186536c2dfa1daa","observation_id":"189a7923-0a41-4483-96b4-d2d9afc73e86","resolution":{"observed_at":"2026-06-30T13:14:40.769734Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:15:57.805389Z","title":"Gradient cuff: De- tecting jailbreak attacks on large language models by exploring refusal loss landscapes,","venue":null,"work_id":"e40ba258-dfb9-442a-9e17-3f64b1f254ad","year":2024},"citing_paper":{"arxiv_id":"2605.24552","last_updated":"2026-05-23T12:39:25Z","snapshot_observed_at":"2026-07-06T23:34:38.098785Z","submitted_at":"2026-05-23T12:39:25Z","title":"Ellipsoid Control: A White-list Jailbreak Defense via Benign Latent Modeling","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-30T13:10:44.728498Z"},"links":{"citing_paper":"/paper/2605.24552"},"observation_digest":"sha256:fd13976fb4a80564198fe2b52f942cbfb839338f21b6423284000a3904798c18","observation_id":"e350e98a-7ff1-4695-bae7-8e31ec4cfa57","resolution":{"observed_at":"2026-07-09T03:15:57.806746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:15:57.807372Z","title":"Gradsafe: detect- ing unsafe prompts for llms via safety-critical gradient analysis,","venue":null,"work_id":"bf6d2d63-eba9-4eb9-8ea7-968e228572fd","year":2024},"citing_paper":{"arxiv_id":"2605.24552","last_updated":"2026-05-23T12:39:25Z","snapshot_observed_at":"2026-07-06T23:34:38.098785Z","submitted_at":"2026-05-23T12:39:25Z","title":"Ellipsoid Control: A White-list Jailbreak Defense via Benign Latent Modeling","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-30T13:10:44.728498Z"},"links":{"citing_paper":"/paper/2605.24552"},"observation_digest":"sha256:6cd24dbca6ca81dee4fd2fdfc2f458458eba826ad54eb43d4ae0fa68b7534a80","observation_id":"72079b08-d575-4918-8322-b0684af56dca","resolution":{"observed_at":"2026-07-09T03:15:57.808662Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"1716.371765","doi":"10.1145/3701716.3717659","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"HSF: defending against jailbreak attacks with hidden state filtering,","venue":null,"work_id":"e84bb501-ba5c-41cd-8f74-161218f275b1","year":2025},"citing_paper":{"arxiv_id":"2605.24552","last_updated":"2026-05-23T12:39:25Z","snapshot_observed_at":"2026-07-06T23:34:38.098785Z","submitted_at":"2026-05-23T12:39:25Z","title":"Ellipsoid Control: A White-list Jailbreak Defense via Benign Latent Modeling","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-30T13:10:44.728498Z"},"links":{"citing_paper":"/paper/2605.24552"},"observation_digest":"sha256:a1cdba243467908b5ba95984bf5b972bfddce4afc413c119f34790aa1294b87d","observation_id":"fb30514a-9658-4349-b973-ed6aac1a3696","resolution":{"observed_at":"2026-06-30T13:14:40.151343Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2502","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T19:25:32.299093Z","title":"Baek, Ziming Liu, Riya Tyagi, and Max Tegmark","venue":null,"work_id":"8c68f9b9-d5fc-4fb2-9aab-32d76c437cf5","year":2025},"citing_paper":{"arxiv_id":"2605.24552","last_updated":"2026-05-23T12:39:25Z","snapshot_observed_at":"2026-07-06T23:34:38.098785Z","submitted_at":"2026-05-23T12:39:25Z","title":"Ellipsoid Control: A White-list Jailbreak Defense via Benign Latent Modeling","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-30T13:10:44.728498Z"},"links":{"citing_paper":"/paper/2605.24552"},"observation_digest":"sha256:d44f20d7c05b5b05bc5509e77741b1e520aee05a9d8cdff1e1cf4f014586a116","observation_id":"3e5f59c0-d23d-40ff-9cfd-ffe795a5403c","resolution":{"observed_at":"2026-06-30T13:14:40.148577Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-11T05:49:40.614878+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T05:49:40.614878+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":"2310.06825","doi":"10.48550/arxiv.2310.06825","metadata_source":"pith","pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-07-10T14:47:14.537301Z","title":"Mistral 7B","venue":"cs.CL","work_id":"eb5e1305-ad11-4875-ad8d-ad8b8f697599","year":2023},"citing_paper":{"arxiv_id":"2605.24552","last_updated":"2026-05-23T12:39:25Z","snapshot_observed_at":"2026-07-06T23:34:38.098785Z","submitted_at":"2026-05-23T12:39:25Z","title":"Ellipsoid Control: A White-list Jailbreak Defense via Benign Latent Modeling","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-30T13:10:44.728498Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2605.24552"},"observation_digest":"sha256:5a5c91f1510936ecd4f72218aa4c9821febc7432423af8ac4a224f1a869219d6","observation_id":"1e219939-6b53-4830-9fc1-71018045e041","resolution":{"observed_at":"2026-06-30T13:14:40.792670Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-11T05:19:23.48574+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T05:19:23.48574+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2412.15115","doi":"10.1145/3581783.3612503","metadata_source":"pith","pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen2.5 Technical Report","venue":"cs.CL","work_id":"d8432992-4980-4a81-85c7-9fa2c2b87f85","year":2024},"citing_paper":{"arxiv_id":"2605.24552","last_updated":"2026-05-23T12:39:25Z","snapshot_observed_at":"2026-07-06T23:34:38.098785Z","submitted_at":"2026-05-23T12:39:25Z","title":"Ellipsoid Control: A White-list Jailbreak Defense via Benign Latent Modeling","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-30T13:10:44.728498Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2605.24552"},"observation_digest":"sha256:7ea1d4e9c518d5c47b44122e344e8fccead7c08504dba06873e66e9ea93c2964","observation_id":"522ad08a-4cc6-442c-b16b-1c38ecfecd42","resolution":{"observed_at":"2026-06-30T13:14:40.761444Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:15:57.797617Z","title":"The llama 3 herd of models,","venue":null,"work_id":"85320f02-5aa2-4339-bd25-ff32c712733f","year":2024},"citing_paper":{"arxiv_id":"2605.24552","last_updated":"2026-05-23T12:39:25Z","snapshot_observed_at":"2026-07-06T23:34:38.098785Z","submitted_at":"2026-05-23T12:39:25Z","title":"Ellipsoid Control: A White-list Jailbreak Defense via Benign Latent Modeling","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-30T13:10:44.728498Z"},"links":{"citing_paper":"/paper/2605.24552"},"observation_digest":"sha256:ff1ac06ea678025ed681e6fff34c572f0318dba102ffc9a6574e1f8801c0071c","observation_id":"e1c22f8a-a0b5-4814-b676-2385c7bcaed1","resolution":{"observed_at":"2026-07-09T03:15:57.798753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2023.emnlp-main.183","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T03:55:19.954852Z","title":"Enhancing Chat Language Models by Scaling High-quality Instructional Conversations","venue":null,"work_id":"6cb36544-9836-44f0-8045-cada44b1177e","year":2023},"citing_paper":{"arxiv_id":"2605.24552","last_updated":"2026-05-23T12:39:25Z","snapshot_observed_at":"2026-07-06T23:34:38.098785Z","submitted_at":"2026-05-23T12:39:25Z","title":"Ellipsoid Control: A White-list Jailbreak Defense via Benign Latent Modeling","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-30T13:10:44.728498Z"},"links":{"citing_paper":"/paper/2605.24552"},"observation_digest":"sha256:bb59ee0a1bbea8c37c222d70f1e7a0e2aaf6e29423e0da2d1595f843653b5768","observation_id":"5aa09186-f3eb-4524-a800-e5bdb1d3e6b1","resolution":{"observed_at":"2026-06-30T13:14:40.153395Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":"2009.03300","doi":"10.48550/arxiv.2009.03300","metadata_source":"pith","pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-07-11T01:37:42.666395Z","title":"Measuring Massive Multitask Language Understanding","venue":"cs.CY","work_id":"e87ec49a-544b-4ec8-8991-75298c64ff5e","year":2020},"citing_paper":{"arxiv_id":"2605.24552","last_updated":"2026-05-23T12:39:25Z","snapshot_observed_at":"2026-07-06T23:34:38.098785Z","submitted_at":"2026-05-23T12:39:25Z","title":"Ellipsoid Control: A White-list Jailbreak Defense via Benign Latent Modeling","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-30T13:10:44.728498Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2605.24552"},"observation_digest":"sha256:0c4f1c9e951b5a7c9ec27b539227048299a6c9fff2ba923544ace78e7776536a","observation_id":"f6e404d2-9cc3-49c1-973c-c28f3f0bb8dd","resolution":{"observed_at":"2026-06-30T13:14:40.794813Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-11T02:19:14.061878+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T02:19:14.061878+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:15:57.799377Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena,","venue":null,"work_id":"8d9612ff-4abf-4ca8-8ad7-25fa9b727e22","year":2023},"citing_paper":{"arxiv_id":"2605.24552","last_updated":"2026-05-23T12:39:25Z","snapshot_observed_at":"2026-07-06T23:34:38.098785Z","submitted_at":"2026-05-23T12:39:25Z","title":"Ellipsoid Control: A White-list Jailbreak Defense via Benign Latent Modeling","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-30T13:10:44.728498Z"},"links":{"citing_paper":"/paper/2605.24552"},"observation_digest":"sha256:ded514452bee1b0c166b59eeea93fa98d09b860f5f40d220ef5977330340382f","observation_id":"d885efbe-c1bc-4caf-b63a-ad50a0c9d7f6","resolution":{"observed_at":"2026-07-09T03:15:57.800620Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":"2307.15043","doi":"10.48550/arxiv.2307.15043","metadata_source":"pith","pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-07-11T02:47:49.837877Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","venue":"cs.CL","work_id":"3322fa86-1768-4677-8425-dd326b45e078","year":2023},"citing_paper":{"arxiv_id":"2605.24552","last_updated":"2026-05-23T12:39:25Z","snapshot_observed_at":"2026-07-06T23:34:38.098785Z","submitted_at":"2026-05-23T12:39:25Z","title":"Ellipsoid Control: A White-list Jailbreak Defense via Benign Latent Modeling","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-30T13:10:44.728498Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2605.24552"},"observation_digest":"sha256:59852f5c5b8130a6dfe9e206ef67ffba50de3d695726b5dd26649b590a29bb60","observation_id":"f70e6c42-70d1-4495-bf42-2f56ba16b76d","resolution":{"observed_at":"2026-06-30T13:14:40.759014Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04451","last_updated":"2024-03-20T21:34:56Z","snapshot_observed_at":"2026-07-06T16:28:55.209047Z","submitted_at":"2023-10-03T19:44:37Z","title":"AutoDAN: Generating Stealthy Jailbreak Prompts on Aligned Large Language Models","version":2},"cited_work":{"arxiv_id":"2310.04451","doi":"10.48550/arxiv.2310.04451","metadata_source":"pith","pith_arxiv_id":"2310.04451","snapshot_observed_at":"2026-07-10T15:27:20.054506Z","title":"AutoDAN: Generating Stealthy Jailbreak Prompts on Aligned Large Language Models","venue":"cs.CL","work_id":"3b676de6-edef-4976-a8b5-082d4ff50867","year":2023},"citing_paper":{"arxiv_id":"2605.24552","last_updated":"2026-05-23T12:39:25Z","snapshot_observed_at":"2026-07-06T23:34:38.098785Z","submitted_at":"2026-05-23T12:39:25Z","title":"Ellipsoid Control: A White-list Jailbreak Defense via Benign Latent Modeling","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-30T13:10:44.728498Z"},"links":{"cited_paper":"/paper/2310.04451","citing_paper":"/paper/2605.24552"},"observation_digest":"sha256:623f482e203393e48f15a99e60bc1c49ff7cfe2ccdd17c452085333cf943fd98","observation_id":"48f37ce3-dba9-498c-8446-234245b03938","resolution":{"observed_at":"2026-06-30T13:14:40.763893Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-05-23T04:52:41.614605+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T04:52:41.614605+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10253","last_updated":"2024-06-27T16:01:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-19T02:19:48Z","title":"GPTFUZZER: Red Teaming Large Language Models with Auto-Generated Jailbreak Prompts","version":4},"cited_work":{"arxiv_id":"2309.10253","doi":"10.48550/arxiv.2309.10253","metadata_source":"pith","pith_arxiv_id":"2309.10253","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"GPTFUZZER: Red Teaming Large Language Models with Auto-Generated Jailbreak Prompts","venue":"cs.AI","work_id":"230d395f-9220-4e6f-a52f-e593552b049b","year":2023},"citing_paper":{"arxiv_id":"2605.24552","last_updated":"2026-05-23T12:39:25Z","snapshot_observed_at":"2026-07-06T23:34:38.098785Z","submitted_at":"2026-05-23T12:39:25Z","title":"Ellipsoid Control: A White-list Jailbreak Defense via Benign Latent Modeling","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-30T13:10:44.728498Z"},"links":{"cited_paper":"/paper/2309.10253","citing_paper":"/paper/2605.24552"},"observation_digest":"sha256:70a9d84392c1f187e051b485deb87779e2e71fd85607c5bbef0cf5e60bbb2237","observation_id":"792f2e33-c6c4-4264-bddb-fbb3f4442747","resolution":{"observed_at":"2026-06-30T13:14:40.143359Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-05-24T00:53:10.090181+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T00:53:10.090181+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08419","last_updated":"2024-07-18T18:24:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-12T15:38:28Z","title":"Jailbreaking Black Box Large Language Models in Twenty Queries","version":4},"cited_work":{"arxiv_id":"2310.08419","doi":"10.48550/arxiv.2310.08419","metadata_source":"pith","pith_arxiv_id":"2310.08419","snapshot_observed_at":"2026-07-10T15:27:20.121842Z","title":"Jailbreaking Black Box Large Language Models in Twenty Queries","venue":"cs.LG","work_id":"38678cda-6595-4ca3-916b-066c00cce063","year":2023},"citing_paper":{"arxiv_id":"2605.24552","last_updated":"2026-05-23T12:39:25Z","snapshot_observed_at":"2026-07-06T23:34:38.098785Z","submitted_at":"2026-05-23T12:39:25Z","title":"Ellipsoid Control: A White-list Jailbreak Defense via Benign Latent Modeling","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-30T13:10:44.728498Z"},"links":{"cited_paper":"/paper/2310.08419","citing_paper":"/paper/2605.24552"},"observation_digest":"sha256:2cd73dfcc6f2d56991b9683fda63a688d68c945b154bfc4dd85f027da1dfad9a","observation_id":"2ba87403-be47-45ff-9a48-ef667f99bdc1","resolution":{"observed_at":"2026-06-30T13:14:40.782609Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-05-24T00:53:06.618013+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T00:53:06.618013+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:15:57.795913Z","title":null,"venue":null,"work_id":"49caacdc-9eeb-4c3a-a6dc-9e69d54f2d55","year":null},"citing_paper":{"arxiv_id":"2605.24552","last_updated":"2026-05-23T12:39:25Z","snapshot_observed_at":"2026-07-06T23:34:38.098785Z","submitted_at":"2026-05-23T12:39:25Z","title":"Ellipsoid Control: A White-list Jailbreak Defense via Benign Latent Modeling","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-30T13:10:44.728498Z"},"links":{"citing_paper":"/paper/2605.24552"},"observation_digest":"sha256:473476c2dcb2c81804edaf17be3a60529d5edfa0f7dee04298d02de75404bef3","observation_id":"45616518-6eed-41c7-a109-0f4380a57d96","resolution":{"observed_at":"2026-07-09T03:15:57.797016Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.07022","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T13:06:58.815658Z","title":"Alphasteer: Learn- ing refusal steering with principled null-space constraint","venue":null,"work_id":"fa78bf0a-76d8-4c33-9a82-e6c4bd31216d","year":2025},"citing_paper":{"arxiv_id":"2605.24552","last_updated":"2026-05-23T12:39:25Z","snapshot_observed_at":"2026-07-06T23:34:38.098785Z","submitted_at":"2026-05-23T12:39:25Z","title":"Ellipsoid Control: A White-list Jailbreak Defense via Benign Latent Modeling","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-30T13:10:44.728498Z"},"links":{"citing_paper":"/paper/2605.24552"},"observation_digest":"sha256:91aaf136ab814b26ad2e961d6cd80dfcc1e7f2a8c9f6cf9f3d504dcdc344786a","observation_id":"6276978e-d001-481d-be42-dc3be8e20b39","resolution":{"observed_at":"2026-06-30T13:14:40.785170Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.24552","last_updated":"2026-05-23T12:39:25Z","latest_version":1,"primary_category":"cs.CR","snapshot_observed_at":"2026-07-06T23:34:38.098785Z","submitted_at":"2026-05-23T12:39:25Z","title":"Ellipsoid Control: A White-list Jailbreak Defense via Benign Latent Modeling"},"reference_resolution":{"displayed":37,"state_counts":{"malformed_identifier":1,"metadata_mismatch":4,"parse_uncertain":0,"unresolved":0,"verified_exact":20,"verified_fuzzy":12},"total_outbound_references":37},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"thesis":"As of 22 July 2026, this Paper Citation Record lists 37 of 37 outbound references and 0 inbound Pith citation observations for arXiv:2605.24552."}