{"as_of":"2026-08-06T09:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:178329e7a2417389717c8d5c5c98813653c50402a18435b388b4a018261e55e8","coverage":[{"denominator":300,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-23T04:39:04.591722Z","state":"measured"},{"denominator":118,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":118,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":18,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":18,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T04:46:59.122473Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":1,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"cited_work":{"arxiv_id":"2502.05206","doi":"10.48550/arxiv.2502.05206","metadata_source":"pith","pith_arxiv_id":"2502.05206","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","venue":"cs.CR","work_id":"fdcd074d-b686-45df-923a-9f11dbbd6a82","year":2025},"citing_paper":{"arxiv_id":"2503.06223","last_updated":"2026-05-08T07:11:22Z","snapshot_observed_at":"2026-07-06T20:49:09.368757Z","submitted_at":"2025-03-08T13:51:40Z","title":"RedDiffuser: Auditing Multimodal Safety Failures in Vision-Language Models via Reinforced Diffusion","version":5},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-23T00:13:08.603115Z"},"links":{"cited_paper":"/paper/2502.05206","citing_paper":"/paper/2503.06223"},"observation_digest":"sha256:cd9679723f37703417229299500f0261f3141b3b5be22dc37252c49dc7649ed3","observation_id":"a88c5551-98a4-4c24-b971-93768a44514f","resolution":{"observed_at":"2026-05-23T00:15:14.797246Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-20T16:52:58.948728+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T16:52:58.948728+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"cited_work":{"arxiv_id":"2502.05206","doi":"10.48550/arxiv.2502.05206","metadata_source":"pith","pith_arxiv_id":"2502.05206","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","venue":"cs.CR","work_id":"fdcd074d-b686-45df-923a-9f11dbbd6a82","year":2025},"citing_paper":{"arxiv_id":"2508.00756","last_updated":"2026-05-21T07:46:00Z","snapshot_observed_at":"2026-07-06T22:06:24.923510Z","submitted_at":"2025-08-01T16:32:48Z","title":"LeakyCLIP: Extracting Training Data from CLIP","version":4},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-22T12:31:50.876655Z"},"links":{"cited_paper":"/paper/2502.05206","citing_paper":"/paper/2508.00756"},"observation_digest":"sha256:47fa62a0f8ca24f2b1aec525cd3665c0ed83eec2843cfa2729e72990fb711766","observation_id":"0f509cda-c255-45c7-ad82-639178851d27","resolution":{"observed_at":"2026-05-22T12:34:52.554632Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-20T16:52:58.948728+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T16:52:58.948728+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05206","snapshot_observed_at":"2026-08-06T04:46:59.122473Z","title":"Safety at scale: A comprehensive survey of large model safety","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.03091","last_updated":"2025-08-05T05:10:14Z","snapshot_observed_at":"2026-08-06T04:46:58.766707Z","submitted_at":"2025-08-05T05:10:14Z","title":"T2UE: Generating Unlearnable Examples from Text Descriptions","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T04:46:59.122473Z"},"links":{"cited_paper":"/paper/2502.05206","citing_paper":"/paper/2508.03091"},"observation_digest":"sha256:58e13118bef7495a5c204e97a29c0a2b5d70f177c5352fa5f1b422bfafd3c94d","observation_id":"e21bbb09-7a71-45d0-9066-d4a3bf2925c7","resolution":{"observed_at":"2026-08-06T04:46:59.122473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05206","snapshot_observed_at":"2026-08-05T14:40:54.492314Z","title":"Safety at scale: A comprehensive survey of large model safety.arXiv preprint arXiv:2502.05206, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.21072","last_updated":"2025-08-28T17:59:59Z","snapshot_observed_at":"2026-08-05T14:40:52.330161Z","submitted_at":"2025-08-28T17:59:59Z","title":"First-Place Solution to NeurIPS 2024 Invisible Watermark Removal Challenge","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T14:40:54.492314Z"},"links":{"cited_paper":"/paper/2502.05206","citing_paper":"/paper/2508.21072"},"observation_digest":"sha256:0ea296fcfbd2fc404d8d2c3f6ce5779a651c28e3a52e072512f2531ba033feaa","observation_id":"064f7a99-bcc6-4ccd-accf-47c09ccd9273","resolution":{"observed_at":"2026-08-05T14:40:54.492314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05206","snapshot_observed_at":"2026-08-05T12:54:06.598065Z","title":"Erfani, Bo Li, Masashi Sugiyama, Dacheng Tao, James Bailey, and Yu-Gang Jiang","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06982","last_updated":"2025-09-01T04:50:02Z","snapshot_observed_at":"2026-08-05T12:54:05.411254Z","submitted_at":"2025-09-01T04:50:02Z","title":"CARE: Decoding Time Safety Alignment via Rollback and Introspection Intervention","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T12:54:06.598065Z"},"links":{"cited_paper":"/paper/2502.05206","citing_paper":"/paper/2509.06982"},"observation_digest":"sha256:8bf3b514769084a4d35d7446411a029a6a63adac794ba953bbea462e4b8800e2","observation_id":"dc2339d5-1e8b-48fe-ae58-4daa37c4103b","resolution":{"observed_at":"2026-08-05T12:54:06.598065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"cited_work":{"arxiv_id":"2502.05206","doi":"10.48550/arxiv.2502.05206","metadata_source":"pith","pith_arxiv_id":"2502.05206","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","venue":"cs.CR","work_id":"fdcd074d-b686-45df-923a-9f11dbbd6a82","year":2025},"citing_paper":{"arxiv_id":"2509.26100","last_updated":"2026-05-14T06:48:52Z","snapshot_observed_at":"2026-08-03T06:15:45.859457Z","submitted_at":"2025-09-30T11:20:41Z","title":"AgenticEval: Toward Agentic and Self-Evolving Safety Evaluation of Large Language Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-18T12:35:01.443896Z"},"links":{"cited_paper":"/paper/2502.05206","citing_paper":"/paper/2509.26100"},"observation_digest":"sha256:d3690d0b5e786fca559435c688e109c5a3dd7962a69368513a1cdf0de7cd4a88","observation_id":"65ffed6f-5fbb-4ad7-8050-7223a99206af","resolution":{"observed_at":"2026-05-18T12:36:22.453973Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-20T16:52:58.948728+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T16:52:58.948728+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"cited_work":{"arxiv_id":"2502.05206","doi":"10.48550/arxiv.2502.05206","metadata_source":"pith","pith_arxiv_id":"2502.05206","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","venue":"cs.CR","work_id":"fdcd074d-b686-45df-923a-9f11dbbd6a82","year":2025},"citing_paper":{"arxiv_id":"2511.12710","last_updated":"2026-05-18T06:50:41Z","snapshot_observed_at":"2026-07-06T22:35:55.936840Z","submitted_at":"2025-11-16T17:52:07Z","title":"Evolve the Method, Not the Prompts: Evolutionary Synthesis of Jailbreak Attacks on LLMs","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-21T18:58:53.183734Z"},"links":{"cited_paper":"/paper/2502.05206","citing_paper":"/paper/2511.12710"},"observation_digest":"sha256:247cdf6ed4b58d165b391fd6a78b8851f35f783163ebd5d945480db1bfbb687f","observation_id":"d4df0021-86ef-4500-853e-5dd7f912b2a7","resolution":{"observed_at":"2026-05-21T19:00:30.400373Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-20T16:52:58.948728+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T16:52:58.948728+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05206","snapshot_observed_at":"2026-08-03T07:47:37.549997Z","title":"Safety at scale: A comprehensive survey of large model safety.arXiv preprint arXiv:2502.05206,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.19210","last_updated":"2026-06-09T16:01:52Z","snapshot_observed_at":"2026-08-03T07:47:35.830222Z","submitted_at":"2026-01-27T05:24:45Z","title":"Contrastive Spectral Rectification: Test-Time Defense towards Zero-shot Adversarial Robustness of CLIP","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T07:47:37.549997Z"},"links":{"cited_paper":"/paper/2502.05206","citing_paper":"/paper/2601.19210"},"observation_digest":"sha256:5671f581e42ec7f6153d313eef3ee7fc4034b6be1de3f17ee104ac068ded88a9","observation_id":"bbe6cccd-ecce-4f2b-98ea-1e28c4c6c256","resolution":{"observed_at":"2026-08-03T07:47:37.549997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05206","snapshot_observed_at":"2026-07-15T13:17:48.274611Z","title":"Safety at scale: A comprehensive survey of large model and agent safety, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.10044","last_updated":"2026-06-03T17:59:34Z","snapshot_observed_at":"2026-08-01T15:08:27.655089Z","submitted_at":"2026-03-08T01:37:45Z","title":"Safety Under Scaffolding: How Evaluation Conditions Shape Measured Safety","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-15T13:17:48.274611Z"},"links":{"cited_paper":"/paper/2502.05206","citing_paper":"/paper/2603.10044"},"observation_digest":"sha256:971951cefec400c4859b5062bc7bcb80ddfb01e3ec78e43a8bd879eb6d4192a8","observation_id":"96e65a4e-3154-4a17-b6ba-60c5684323a3","resolution":{"observed_at":"2026-07-15T13:17:48.274611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"cited_work":{"arxiv_id":"2502.05206","doi":"10.48550/arxiv.2502.05206","metadata_source":"pith","pith_arxiv_id":"2502.05206","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","venue":"cs.CR","work_id":"fdcd074d-b686-45df-923a-9f11dbbd6a82","year":2025},"citing_paper":{"arxiv_id":"2604.01346","last_updated":"2026-04-06T19:07:02Z","snapshot_observed_at":"2026-08-03T08:33:40.943733Z","submitted_at":"2026-04-01T19:57:33Z","title":"Safety, Security, and Cognitive Risks in World Models","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-13T22:35:46.126714Z"},"links":{"cited_paper":"/paper/2502.05206","citing_paper":"/paper/2604.01346"},"observation_digest":"sha256:6e240f3068a8cea661306ed0541b2db04972f79230c44d02a1711ceaf7dcc7ea","observation_id":"e7cf2544-2fd7-42af-9145-150099a6cda0","resolution":{"observed_at":"2026-05-13T22:38:22.213669Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-20T16:52:58.948728+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T16:52:58.948728+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"cited_work":{"arxiv_id":"2502.05206","doi":"10.48550/arxiv.2502.05206","metadata_source":"pith","pith_arxiv_id":"2502.05206","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","venue":"cs.CR","work_id":"fdcd074d-b686-45df-923a-9f11dbbd6a82","year":2025},"citing_paper":{"arxiv_id":"2604.19083","last_updated":"2026-04-21T04:52:38Z","snapshot_observed_at":"2026-07-06T23:05:48.885141Z","submitted_at":"2026-04-21T04:52:38Z","title":"ProjLens: Unveiling the Role of Projectors in Multimodal Model Safety","version":1},"reference_index":166,"source":"arxiv_source","source_observed_at":"2026-05-10T03:00:34.862711Z"},"links":{"cited_paper":"/paper/2502.05206","citing_paper":"/paper/2604.19083"},"observation_digest":"sha256:fb872c19913e48ca5656cb67fbb7304f471218b2983a0d263560b1c615dc9cd8","observation_id":"0f400c2a-a08a-4fc5-a8db-3c4eaee9c586","resolution":{"observed_at":"2026-05-11T12:46:06.495963Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-20T16:52:58.948728+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T16:52:58.948728+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"cited_work":{"arxiv_id":"2502.05206","doi":"10.48550/arxiv.2502.05206","metadata_source":"pith","pith_arxiv_id":"2502.05206","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","venue":"cs.CR","work_id":"fdcd074d-b686-45df-923a-9f11dbbd6a82","year":2025},"citing_paper":{"arxiv_id":"2605.05058","last_updated":"2026-05-06T15:53:17Z","snapshot_observed_at":"2026-07-06T23:17:43.402046Z","submitted_at":"2026-05-06T15:53:17Z","title":"SoK: Robustness in Large Language Models against Jailbreak Attacks","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-08T16:42:41.137808Z"},"links":{"cited_paper":"/paper/2502.05206","citing_paper":"/paper/2605.05058"},"observation_digest":"sha256:a3694a55f563ca8a607a9ff40fb73303dfd7cb9311fd22227653f3b25fa4c2f3","observation_id":"906504e4-fbcd-4894-8862-6a55df8dd875","resolution":{"observed_at":"2026-05-11T18:01:08.749386Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-20T16:52:58.948728+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T16:52:58.948728+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"cited_work":{"arxiv_id":"2502.05206","doi":"10.48550/arxiv.2502.05206","metadata_source":"pith","pith_arxiv_id":"2502.05206","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","venue":"cs.CR","work_id":"fdcd074d-b686-45df-923a-9f11dbbd6a82","year":2025},"citing_paper":{"arxiv_id":"2605.16282","last_updated":"2026-04-11T04:25:19Z","snapshot_observed_at":"2026-07-06T23:27:29.931962Z","submitted_at":"2026-04-11T04:25:19Z","title":"Taxonomy and Consistency Analysis of Safety Benchmarks for AI Agents","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-05-21T01:42:55.693115Z"},"links":{"cited_paper":"/paper/2502.05206","citing_paper":"/paper/2605.16282"},"observation_digest":"sha256:43a256136f57a922dd0eba28c0655698f46900019a7f68ba7a62fd723d877bec","observation_id":"c1eafb32-4e8a-4616-bc67-c910bcde6c26","resolution":{"observed_at":"2026-05-21T01:43:56.823188Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-20T16:52:58.948728+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T16:52:58.948728+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"cited_work":{"arxiv_id":"2502.05206","doi":"10.48550/arxiv.2502.05206","metadata_source":"pith","pith_arxiv_id":"2502.05206","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","venue":"cs.CR","work_id":"fdcd074d-b686-45df-923a-9f11dbbd6a82","year":2025},"citing_paper":{"arxiv_id":"2605.19227","last_updated":"2026-05-19T00:55:18Z","snapshot_observed_at":"2026-07-31T18:48:53.380189Z","submitted_at":"2026-05-19T00:55:18Z","title":"Token by Token, Compromised: Backdoor Vulnerabilities in Unified Autoregressive Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-20T05:35:46.236860Z"},"links":{"cited_paper":"/paper/2502.05206","citing_paper":"/paper/2605.19227"},"observation_digest":"sha256:e874e19db2f3b6738439f030633804114cbbd073ae643a8fa79c09316d7c5a50","observation_id":"dd7d664a-711f-43fc-aacf-7626cedbd054","resolution":{"observed_at":"2026-05-20T05:38:04.871760Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-20T16:52:58.948728+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T16:52:58.948728+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"cited_work":{"arxiv_id":"2502.05206","doi":"10.48550/arxiv.2502.05206","metadata_source":"pith","pith_arxiv_id":"2502.05206","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","venue":"cs.CR","work_id":"fdcd074d-b686-45df-923a-9f11dbbd6a82","year":2025},"citing_paper":{"arxiv_id":"2605.23989","last_updated":"2026-05-17T10:26:37Z","snapshot_observed_at":"2026-07-06T23:34:08.786038Z","submitted_at":"2026-05-17T10:26:37Z","title":"Towards trustworthy agentic AI: a comprehensive survey of safety, robustness, privacy, and system security","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-06-30T19:18:40.244556Z"},"links":{"cited_paper":"/paper/2502.05206","citing_paper":"/paper/2605.23989"},"observation_digest":"sha256:89f2f726e4e3e9ccf1f4b08e7741ca2096928528c0b9366eda6a7e42d422cce9","observation_id":"2edc4021-17ee-4890-a02f-9b799d9a19f0","resolution":{"observed_at":"2026-06-30T19:45:01.626483Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-20T16:52:58.948728+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T16:52:58.948728+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"cited_work":{"arxiv_id":"2502.05206","doi":"10.48550/arxiv.2502.05206","metadata_source":"pith","pith_arxiv_id":"2502.05206","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","venue":"cs.CR","work_id":"fdcd074d-b686-45df-923a-9f11dbbd6a82","year":2025},"citing_paper":{"arxiv_id":"2605.25002","last_updated":"2026-05-26T06:35:05Z","snapshot_observed_at":"2026-07-06T23:35:01.860096Z","submitted_at":"2026-05-24T11:04:35Z","title":"MemMark: State-Evolution Attribution Watermarking for Agent Long-Term Memory Systems","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-30T00:04:20.261679Z"},"links":{"cited_paper":"/paper/2502.05206","citing_paper":"/paper/2605.25002"},"observation_digest":"sha256:61ed29c39c873ff4aa18586e82a468aeb21d776243ea5613ae05eec3f44b5fa3","observation_id":"bbfd3ba3-ea69-4d14-8767-40dca7add7ad","resolution":{"observed_at":"2026-06-30T00:14:04.403606Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-20T16:52:58.948728+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T16:52:58.948728+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"cited_work":{"arxiv_id":"2502.05206","doi":"10.48550/arxiv.2502.05206","metadata_source":"pith","pith_arxiv_id":"2502.05206","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","venue":"cs.CR","work_id":"fdcd074d-b686-45df-923a-9f11dbbd6a82","year":2025},"citing_paper":{"arxiv_id":"2606.02947","last_updated":"2026-06-01T22:58:04Z","snapshot_observed_at":"2026-07-06T23:43:17.879245Z","submitted_at":"2026-06-01T22:58:04Z","title":"BYORn: Bootstrap Your Own Responses to Defend Large Vision-Language Models Against Backdoor Attacks","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-06-28T15:10:18.936026Z"},"links":{"cited_paper":"/paper/2502.05206","citing_paper":"/paper/2606.02947"},"observation_digest":"sha256:0c1a5e0184a67ee0083e68dcda46f67cff0e537e0f888d0c9b2df882c827bef7","observation_id":"e79b7baa-e666-4a92-810d-08a3b585a0c6","resolution":{"observed_at":"2026-07-01T22:36:17.840636Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-20T16:52:58.948728+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T16:52:58.948728+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05206","snapshot_observed_at":"2026-08-02T07:06:19.432277Z","title":"Safety at scale: A comprehensive survey of large model and agent safety, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13078","last_updated":"2026-07-12T22:34:02Z","snapshot_observed_at":"2026-08-06T04:19:48.114808Z","submitted_at":"2026-07-12T22:34:02Z","title":"Operational Evidence Gaps for LLMs in Fraud Detection and Trust-and-Safety Workflows","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T07:06:19.432277Z"},"links":{"cited_paper":"/paper/2502.05206","citing_paper":"/paper/2607.13078"},"observation_digest":"sha256:233df1e80542a567749f097fa23f5202ae7675da6d99733107e3678d570f6819","observation_id":"ca918491-74ac-4d57-8dff-e52206643b57","resolution":{"observed_at":"2026-08-02T07:06:19.432277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2502.05206/citation-record","integrity":"/paper/2502.05206/integrity","json":"/paper/2502.05206/citation-record.json","paper":"/paper/2502.05206"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Patch-fool: Are vision transformers always robust against adversarial perturbations?","venue":null,"work_id":"3f23408f-f965-4a7a-b693-3091573f6264","year":2022},"citing_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-23T04:39:04.591722Z"},"links":{"citing_paper":"/paper/2502.05206"},"observation_digest":"sha256:93da451ed79c9a4743b05bcc2ece2e6e308d9f8659c90a5e64959eabba217573","observation_id":"d4507708-96c6-405d-b57d-b85d947e2ad8","resolution":{"observed_at":"2026-05-23T05:17:36.927020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Slowformer: Adversarial attack on compute and energy consumption of efficient vision transformers","venue":null,"work_id":"bfc0f238-d6cd-4a8e-8c4c-a3fee2f4372e","year":2024},"citing_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-23T04:39:04.591722Z"},"links":{"citing_paper":"/paper/2502.05206"},"observation_digest":"sha256:39f2ae79af79536fd29fab3ddad26c4dbcfc7a8f321fc61916b69f02ebd96c76","observation_id":"520edf65-12a4-4c5f-a890-b9db88c80a27","resolution":{"observed_at":"2026-05-23T05:17:36.824536Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pe-attack: On the universal positional embedding vulnerability in transformer-based models","venue":null,"work_id":"e2161491-1d04-438c-a276-7f833c11df0e","year":2024},"citing_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-23T04:39:04.591722Z"},"links":{"citing_paper":"/paper/2502.05206"},"observation_digest":"sha256:7eb0e25efa0242bc774938551fc905f1d17580a39fd464b817a2d3ea0cb12ec0","observation_id":"eb6ef798-b396-4f58-bc4c-c72011429c63","resolution":{"observed_at":"2026-05-23T05:17:36.882161Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Give me your attention: Dot-product attention considered harmful for adversarial patch robustness","venue":null,"work_id":"500dcf61-df24-4e23-be48-e358ed112e11","year":2022},"citing_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-23T04:39:04.591722Z"},"links":{"citing_paper":"/paper/2502.05206"},"observation_digest":"sha256:89a5ffa27466e8012040a0454767079dbc943aa75efcb37e42b9f51e0fbedf56","observation_id":"39dde15e-c81d-47a2-b9cb-d6db8dc473f3","resolution":{"observed_at":"2026-05-23T05:17:36.923127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards understanding and improving adversarial robustness of vision transformers","venue":null,"work_id":"d4e3b91c-dae2-4c4c-bcdd-c1430d4c4017","year":2024},"citing_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-23T04:39:04.591722Z"},"links":{"citing_paper":"/paper/2502.05206"},"observation_digest":"sha256:09c4422350668b314742838817fc645a8437aa39211e0e27dd6712b78883d04b","observation_id":"e6a4a8d9-1c49-4d99-b3cc-c1f8c413f25c","resolution":{"observed_at":"2026-05-23T05:17:37.031516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04169","last_updated":"2022-03-03T12:08:18Z","snapshot_observed_at":"2026-08-03T15:51:05.444743Z","submitted_at":"2021-06-08T08:20:38Z","title":"On Improving Adversarial Transferability of Vision Transformers","version":3},"cited_work":{"arxiv_id":"2106.04169","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2106.04169","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On improving adversarial transferability of vision transformers","venue":null,"work_id":"61873ff8-8271-4ef2-a5e8-a65cc5044533","year":2021},"citing_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-23T04:39:04.591722Z"},"links":{"cited_paper":"/paper/2106.04169","citing_paper":"/paper/2502.05206"},"observation_digest":"sha256:857a2881d3d45f57eb8c0ce5d17906df58db8f075c9aa1c97b0806c84faafe00","observation_id":"fae9c966-f986-460c-8225-d4220815d472","resolution":{"observed_at":"2026-05-23T04:42:33.885322Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gen- erating transferable adversarial examples against vision transformers","venue":null,"work_id":"a5e07829-f8ba-4d83-9361-b206dad851cc","year":2022},"citing_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-23T04:39:04.591722Z"},"links":{"citing_paper":"/paper/2502.05206"},"observation_digest":"sha256:3e8287e716eb020307e1bf3ad1ec0ce2ed65b531c48922d5c870610c24f3a7cc","observation_id":"2f979305-19f3-4d7c-8a93-5f0d629cd1a5","resolution":{"observed_at":"2026-05-23T05:17:36.919209Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards transferable adversarial attacks on vision transformers","venue":null,"work_id":"8b8ab38b-d8f6-4743-8164-fabb0019cf04","year":2022},"citing_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-23T04:39:04.591722Z"},"links":{"citing_paper":"/paper/2502.05206"},"observation_digest":"sha256:c8266037a61b05fa8a76b4f1c989c3a93d62180d01c6de4354ec8be802ece276","observation_id":"ccf3cef1-523d-4816-ad14-e4a6028c5f8d","resolution":{"observed_at":"2026-05-23T05:17:37.108036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Boosting adversarial transferability with learnable patch-wise masks","venue":null,"work_id":"3171270a-215c-4c82-9620-7b5824a933d8","year":2023},"citing_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-23T04:39:04.591722Z"},"links":{"citing_paper":"/paper/2502.05206"},"observation_digest":"sha256:d9101981497ddf0bb5150e03bf1dbc57aa209dad98f8f86c0ef3ef7f57e5c31a","observation_id":"301cc788-709b-4ebe-b3d5-ebeff795b37f","resolution":{"observed_at":"2026-05-23T05:17:37.112069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Transferable adversarial attack for both vision transformers and convolutional networks via momentum integrated gradients","venue":null,"work_id":"8af0d8c5-0f86-4868-961f-47ff2eeafee9","year":2023},"citing_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-23T04:39:04.591722Z"},"links":{"citing_paper":"/paper/2502.05206"},"observation_digest":"sha256:0482f0e72c0b70134762cd8475e18af13348cd0656dd824f52c7609003d323ff","observation_id":"726cf37a-47a2-4856-9b87-d811e9e91186","resolution":{"observed_at":"2026-05-23T05:17:36.894588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Transferable adversarial attacks on vision transformers with token gradient regularization","venue":null,"work_id":"d552f971-7723-44b2-aec0-a489870e58c9","year":2023},"citing_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-23T04:39:04.591722Z"},"links":{"citing_paper":"/paper/2502.05206"},"observation_digest":"sha256:3b7a341296b272cd10d4b29a41cd741013c155ff7385e4d4d2212c96cfc2197b","observation_id":"d1114d34-4e54-498a-8a07-253f11119e1e","resolution":{"observed_at":"2026-05-23T05:17:36.898378Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improving the adversarial transferability of vision transformers with virtual dense connection","venue":null,"work_id":"7ea3af76-b222-4161-8619-c7a63947d930","year":2024},"citing_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-23T04:39:04.591722Z"},"links":{"citing_paper":"/paper/2502.05206"},"observation_digest":"sha256:67f05e8011d9eebff99c95ae4a337e408a36a7bdc33cce943a56406b9dd08195","observation_id":"bd27b953-773c-4719-94c0-e442b0ed1fc8","resolution":{"observed_at":"2026-05-23T05:17:36.915073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Attacking transformers with feature diversity adversarial perturbation","venue":null,"work_id":"1500e6d2-7a27-4ce2-aae7-3203b77a8e0e","year":2024},"citing_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-23T04:39:04.591722Z"},"links":{"citing_paper":"/paper/2502.05206"},"observation_digest":"sha256:190b9b5a030a45a1307357a856e9df888c9920f08526a7405daf66dcc1f46a96","observation_id":"cc10c1a2-ccc4-477c-b5f5-8f93b63be8bf","resolution":{"observed_at":"2026-05-23T05:17:36.837109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Decision-based black-box attack against vision transformers via patch-wise adversarial removal","venue":null,"work_id":"4ce72c6c-05b2-49fc-af1d-d3b97c7704d8","year":2022},"citing_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-23T04:39:04.591722Z"},"links":{"citing_paper":"/paper/2502.05206"},"observation_digest":"sha256:bd9eb6a08694c7a8091d92c924d467d63520e2d687bcd51ed46c9d80ac197e10","observation_id":"becbbdd4-a535-46e5-93ba-d1109769bd73","resolution":{"observed_at":"2026-05-23T05:17:37.127613Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improving transferable targeted adversarial attacks with model self-enhancement","venue":null,"work_id":"c92854ca-dec9-4cba-857f-0322125d7cd1","year":2024},"citing_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-23T04:39:04.591722Z"},"links":{"citing_paper":"/paper/2502.05206"},"observation_digest":"sha256:dd58ec55d1bcdcf2787960293a9f0107cb1091937673d7a3c737a47793e4bdf1","observation_id":"13b67fa4-f705-436e-8e23-3974300441bb","resolution":{"observed_at":"2026-05-23T05:17:37.020025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improving transferability of adversarial samples via critical region-oriented feature-level attack","venue":null,"work_id":"30235988-acd4-4d3c-ba08-1d3de2230c86","year":2024},"citing_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-23T04:39:04.591722Z"},"links":{"citing_paper":"/paper/2502.05206"},"observation_digest":"sha256:370b590fb077aca111abbdcb5b6a476db7ffeee03ebfa36041779792b5c05478","observation_id":"4b59fed6-bc34-4d26-b6c7-369573f0b7a6","resolution":{"observed_at":"2026-05-23T05:17:36.886364Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.04337","last_updated":"2021-10-08T19:00:16Z","snapshot_observed_at":"2026-07-06T11:56:00.533330Z","submitted_at":"2021-10-08T19:00:16Z","title":"Adversarial Token Attacks on Vision Transformers","version":1},"cited_work":{"arxiv_id":"2110.04337","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2110.04337","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Adversarial token attacks on vision transformers","venue":null,"work_id":"f48992e8-3e7e-452b-befb-b13c9aa8e91a","year":2021},"citing_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-23T04:39:04.591722Z"},"links":{"cited_paper":"/paper/2110.04337","citing_paper":"/paper/2502.05206"},"observation_digest":"sha256:cab4d735965390a88924d31b9c4bb6a0ba5ffbe567a4922e0f0ab7a0da164bf7","observation_id":"73ab4dad-19f4-4fe1-ae57-b65ce304f7b8","resolution":{"observed_at":"2026-05-23T04:42:33.722137Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Understanding and improving adversarial transferability of vision transformers and convolutional neural networks","venue":null,"work_id":"e8ff849b-efff-4226-bec8-3ba8312f5d9b","year":2023},"citing_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-23T04:39:04.591722Z"},"links":{"citing_paper":"/paper/2502.05206"},"observation_digest":"sha256:de23bdedcf16ff8afceda4e14ba2c37899ddee454d82d4a41179a6661402993d","observation_id":"7dcca432-441f-473c-9b7a-596242ba7912","resolution":{"observed_at":"2026-05-23T05:17:36.890411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards transferable adversarial attacks on image and video transformers","venue":null,"work_id":"d754904b-4c67-4daf-a75d-1d9845705558","year":2023},"citing_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-23T04:39:04.591722Z"},"links":{"citing_paper":"/paper/2502.05206"},"observation_digest":"sha256:977c7e32d8af6d4fd9b3b3fe50bec3f8d698b590a42ff84b8657424787c83470","observation_id":"d88331f1-59df-4f85-9575-c0ff762baa54","resolution":{"observed_at":"2026-05-23T05:17:36.902237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards efficient adversarial training on vision transformers","venue":null,"work_id":"50d15b7a-a86c-4f23-94d9-356371e5beb3","year":2022},"citing_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-23T04:39:04.591722Z"},"links":{"citing_paper":"/paper/2502.05206"},"observation_digest":"sha256:1095b7695c35c517fc65cfdd659067026e86b2612bdd56e6624ddfe0c18dc23b","observation_id":"ea35ba4e-4a3a-4272-b446-ab9feb184b35","resolution":{"observed_at":"2026-05-23T05:17:37.056779Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Patch vestiges in the adversarial examples against vision trans- former can be leveraged for adversarial detection","venue":null,"work_id":"64cc14f6-bb45-4b57-be36-a203b254ecd7","year":2022},"citing_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-23T04:39:04.591722Z"},"links":{"citing_paper":"/paper/2502.05206"},"observation_digest":"sha256:2c1b7683240ed20d845971aae174bfa7186b987e175df7bcb28e9dd29a0bfa77","observation_id":"6581608f-eac7-4d3f-8b15-0024fc90be82","resolution":{"observed_at":"2026-05-23T05:17:36.987228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.13828","last_updated":"2024-09-20T18:11:56Z","snapshot_observed_at":"2026-08-05T21:58:27.652148Z","submitted_at":"2024-09-20T18:11:56Z","title":"ViTGuard: Attention-aware Detection against Adversarial Examples for Vision Transformer","version":1},"cited_work":{"arxiv_id":"2409.13828","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.13828","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vitguard: Attention-aware detection against adversarial examples for vision trans- former","venue":null,"work_id":"21f67d53-5d80-4ac8-ab48-20a33a5d69e5","year":2024},"citing_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-23T04:39:04.591722Z"},"links":{"cited_paper":"/paper/2409.13828","citing_paper":"/paper/2502.05206"},"observation_digest":"sha256:edcba989adabaabea0194bf159886d1a86c50257259ae291230b84b7334ff0ec","observation_id":"6cf929a3-114d-4d76-b740-6e227591806f","resolution":{"observed_at":"2026-05-23T04:42:33.979913Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Understanding and defending patched-based adversarial attacks for vision transformer","venue":null,"work_id":"69d5b01e-5539-4ee0-8d01-750ae8143bcd","year":2023},"citing_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-23T04:39:04.591722Z"},"links":{"citing_paper":"/paper/2502.05206"},"observation_digest":"sha256:6060dc1b4417e23fc9b0500b0a6b2e6abdd9f5cb7cf66fc29e5398a82371103c","observation_id":"142bffe4-2a5c-40f7-9b09-7cad61c6711d","resolution":{"observed_at":"2026-05-23T05:17:36.860994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Diffusion models demand contrastive guidance for adversarial purifi- cation to advance","venue":null,"work_id":"c489821c-79b8-4e22-a8a9-d12afa5492ef","year":2024},"citing_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-23T04:39:04.591722Z"},"links":{"citing_paper":"/paper/2502.05206"},"observation_digest":"sha256:bb067288a4e1188d6ba9478f10ee3d3c344cd674ad52e0bf5f9dbf8288866cc7","observation_id":"ae60aadd-0218-4a26-90e1-a97d56c02be6","resolution":{"observed_at":"2026-05-23T05:17:36.868779Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00315","last_updated":"2025-03-19T05:26:47Z","snapshot_observed_at":"2026-07-06T18:55:24.393147Z","submitted_at":"2024-08-01T06:26:05Z","title":"ADBM: Adversarial diffusion bridge model for reliable adversarial purification","version":4},"cited_work":{"arxiv_id":"2408.00315","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2408.00315","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Adbm: Adversarial diffusion bridge model for reliable adversarial purification","venue":null,"work_id":"ab2f3a52-9a3b-4b6d-886d-51d15025aa4c","year":2024},"citing_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-23T04:39:04.591722Z"},"links":{"cited_paper":"/paper/2408.00315","citing_paper":"/paper/2502.05206"},"observation_digest":"sha256:0e8f528949bb93a99c1b7c080e5d7ca4725041e82fcca3d6f0377757600d553c","observation_id":"2853f39e-a7c6-4839-99a7-7a25542ef225","resolution":{"observed_at":"2026-05-23T04:42:33.913047Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.17064","last_updated":"2025-03-21T13:58:47Z","snapshot_observed_at":"2026-07-31T01:35:19.859044Z","submitted_at":"2024-08-30T07:49:35Z","title":"Instant Adversarial Purification with Adversarial Consistency Distillation","version":3},"cited_work":{"arxiv_id":"2408.17064","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2408.17064","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Instant adversarial purification with adversarial consistency distillation","venue":null,"work_id":"e48d9fb0-793c-4603-b993-49a900479b27","year":2024},"citing_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-23T04:39:04.591722Z"},"links":{"cited_paper":"/paper/2408.17064","citing_paper":"/paper/2502.05206"},"observation_digest":"sha256:25b0c2fcd48300ad1a0d2a7faf40ae34be109b0db0981a63389544aa79ad76a7","observation_id":"180603a0-5868-47d5-a98f-38c76231c091","resolution":{"observed_at":"2026-05-23T04:42:33.710245Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Are vision transformers robust to patch perturbations?","venue":null,"work_id":"0749a477-2b05-4032-9dee-3bf5ae55144a","year":2022},"citing_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-23T04:39:04.591722Z"},"links":{"citing_paper":"/paper/2502.05206"},"observation_digest":"sha256:12ea6afc93593e343a45fac58910234d0105f787b66b9ba7023ee2cf520f1749","observation_id":"6d84dc1a-988e-4371-98c2-c630c8e62767","resolution":{"observed_at":"2026-05-23T05:17:37.048444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"When adversarial train- ing meets vision transformers: Recipes from training to architecture","venue":null,"work_id":"d9ed01d9-a844-4400-b152-a23c1e7efd80","year":2022},"citing_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-23T04:39:04.591722Z"},"links":{"citing_paper":"/paper/2502.05206"},"observation_digest":"sha256:51391bf0a4aed8eefaeecf7effb3a5ec7d74ed061dedc9d8e3a7a04fa3f41b36","observation_id":"2c5ec92d-c60e-4f21-9caf-7446b705040d","resolution":{"observed_at":"2026-05-23T05:17:36.853195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Robustifying token attention for vision transformers","venue":null,"work_id":"afef10d9-76cc-4239-888d-fe85d6e19930","year":2023},"citing_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-23T04:39:04.591722Z"},"links":{"citing_paper":"/paper/2502.05206"},"observation_digest":"sha256:6610367346ad0190992161e748a1e172c3d3298966370e2623bab6aeac1efdf9","observation_id":"4a0cd5f7-e3c8-4ef5-9d2f-0d041b8e4eef","resolution":{"observed_at":"2026-05-23T05:17:36.801002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improving robustness of vision transformers by reducing sensitivity to patch corruptions","venue":null,"work_id":"32f43dd7-483d-40ad-b79d-c5ba01e4e676","year":2023},"citing_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-23T04:39:04.591722Z"},"links":{"citing_paper":"/paper/2502.05206"},"observation_digest":"sha256:bf3475d98927178f3ce9cb65816f9329cee3cb60638be4d3addba92dbd5694fe","observation_id":"90807744-c570-4a09-87c6-1a8d864619bc","resolution":{"observed_at":"2026-05-23T05:17:36.804999Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improving interpretation faithfulness for vision transformers","venue":null,"work_id":"7861f163-1553-4e73-bb7d-593735f47048","year":2024},"citing_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-23T04:39:04.591722Z"},"links":{"citing_paper":"/paper/2502.05206"},"observation_digest":"sha256:a8246c43fd8b7de4e22d7ffea7cd64f34b605fb79dc267b7143a173a42cbbce6","observation_id":"97da5ab8-8cd8-46ca-a533-0a4389e06095","resolution":{"observed_at":"2026-05-23T05:17:36.797167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Random entangled tokens for adversarially robust vision transformer","venue":null,"work_id":"4454b1c6-9bf4-4c7d-849b-5f7fba6fb707","year":2024},"citing_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-23T04:39:04.591722Z"},"links":{"citing_paper":"/paper/2502.05206"},"observation_digest":"sha256:766a93c434ae0d87aed64e22816ec2f533164a7bb09fec1599046bb7ac32fbbf","observation_id":"77867cea-1c09-4ff3-997b-d5ef2b27d0b9","resolution":{"observed_at":"2026-05-23T05:17:36.808884Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Diffusion models for adversarial purification","venue":null,"work_id":"8d739a32-42a4-4e99-bd8d-0029bf4d59c9","year":2022},"citing_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-23T04:39:04.591722Z"},"links":{"citing_paper":"/paper/2502.05206"},"observation_digest":"sha256:cc93c66c176ccc85ce4e853fe0f4394e5df5551cbe55f10707f64c0cdfd2c120","observation_id":"12fbf677-6896-4abc-8046-c802189b7f50","resolution":{"observed_at":"2026-05-23T05:17:37.003374Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.18762","last_updated":"2023-10-28T17:18:38Z","snapshot_observed_at":"2026-07-06T16:39:56.348150Z","submitted_at":"2023-10-28T17:18:38Z","title":"Purify++: Improving Diffusion-Purification with Advanced Diffusion Models and Control of Randomness","version":1},"cited_work":{"arxiv_id":"2310.18762","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.18762","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Purify++: Improving diffusion- purification with advanced diffusion models and control of random- ness","venue":null,"work_id":"5d10144d-3f89-4598-ae41-d2dffc606946","year":2023},"citing_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-23T04:39:04.591722Z"},"links":{"cited_paper":"/paper/2310.18762","citing_paper":"/paper/2502.05206"},"observation_digest":"sha256:e4fe1e7ca70eec739093fb972bf57faf2ff56e66551d65e5743a7f5d562ee727","observation_id":"308d1b9c-f1d1-474e-8dc4-9b57e7ded1ba","resolution":{"observed_at":"2026-05-23T04:42:33.795622Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Diffilter: Defending against adversarial perturbations with diffusion filter","venue":null,"work_id":"c616c305-5d2c-4d8f-bc74-99ab326ed117","year":2024},"citing_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-23T04:39:04.591722Z"},"links":{"citing_paper":"/paper/2502.05206"},"observation_digest":"sha256:fcb98ea6e36d84e3248550107ec42ee9b98b9f26dae9abd2ea9b90769cd99dc2","observation_id":"ad67eb2c-2613-4667-a8a9-d22ab9f5f633","resolution":{"observed_at":"2026-05-23T05:17:36.906013Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mimicdiffusion: Purifying ad- versarial perturbation via mimicking clean diffusion model","venue":null,"work_id":"f6b917f5-bc5a-467c-8265-f0e43e845818","year":2024},"citing_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-23T04:39:04.591722Z"},"links":{"citing_paper":"/paper/2502.05206"},"observation_digest":"sha256:d015c8b94ba39b9cf28138e242c85a46a0c8b23197e3a4b72f5af92fd4cd5653","observation_id":"72b44325-da1f-4eaa-bdaa-c7c5c3976e93","resolution":{"observed_at":"2026-05-23T05:17:36.946245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lightpure: Realtime adversarial image purification for mobile devices using diffusion models","venue":null,"work_id":"40becd8c-a2ea-42cb-a315-6e0899592e3d","year":2024},"citing_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-23T04:39:04.591722Z"},"links":{"citing_paper":"/paper/2502.05206"},"observation_digest":"sha256:fe4c25292dedc5231728e1f51f4791dbe1d1de3a70b3ebcf0d8c514ff892605a","observation_id":"02e283f3-021c-4eab-a1f4-f2ce5979696a","resolution":{"observed_at":"2026-05-23T05:17:36.938501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.08255","last_updated":"2024-09-12T17:51:25Z","snapshot_observed_at":"2026-08-03T05:21:30.937901Z","submitted_at":"2024-09-12T17:51:25Z","title":"LoRID: Low-Rank Iterative Diffusion for Adversarial Purification","version":1},"cited_work":{"arxiv_id":"2409.08255","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.08255","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lorid: Low-rank iterative diffusion for adversarial purifi- cation","venue":null,"work_id":"53cf937f-690b-4178-872e-6f245e4f219f","year":2024},"citing_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-23T04:39:04.591722Z"},"links":{"cited_paper":"/paper/2409.08255","citing_paper":"/paper/2502.05206"},"observation_digest":"sha256:9a64653605cd000cccf10c734c4ea298589b4c6397e914d2518612b9090dd349","observation_id":"c88015e2-fefb-4809-b372-bd7ad1abc4f1","resolution":{"observed_at":"2026-05-23T04:42:34.235562Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"You are catching my attention: Are vision transformers bad learners under backdoor attacks?","venue":null,"work_id":"04823848-94e6-43bf-a35c-88d2da57a9d8","year":2023},"citing_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-23T04:39:04.591722Z"},"links":{"citing_paper":"/paper/2502.05206"},"observation_digest":"sha256:8ada5ab0531bbaacecc0dc3260c9c35cecf05c5263dffe1b9ec85f723d110ce4","observation_id":"9b32e6f9-9ac3-47f4-b75d-bb854234d58c","resolution":{"observed_at":"2026-05-23T05:17:36.962693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Trojvit: Trojan insertion in vision transformers","venue":null,"work_id":"3396b951-645b-4928-8ba8-ef6941ad7a3b","year":2023},"citing_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-23T04:39:04.591722Z"},"links":{"citing_paper":"/paper/2502.05206"},"observation_digest":"sha256:cf0c4ef3d608a290581ab28a9492bbe535b7f37a1f1db300a5975daaf6270a1e","observation_id":"8c5f2521-9f6d-42bb-9285-9661be191860","resolution":{"observed_at":"2026-05-23T05:17:37.011711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Not all prompts are secure: A switchable backdoor attack against pre-trained vision transfomers","venue":null,"work_id":"51be8aef-545f-41a0-871b-0f8e5c0ba9df","year":2024},"citing_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-23T04:39:04.591722Z"},"links":{"citing_paper":"/paper/2502.05206"},"observation_digest":"sha256:a417a8dee0a3972952ae61af91ef63c1be6c6f5c035187fce70f7ffa7327e14a","observation_id":"7d2465d3-c2ab-4db0-b6c7-d78e85190967","resolution":{"observed_at":"2026-05-23T05:17:36.600430Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dbia: Data-free backdoor attack against transformer networks","venue":null,"work_id":"787b80b4-c7e1-4f18-ac59-64229e8414de","year":2023},"citing_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-23T04:39:04.591722Z"},"links":{"citing_paper":"/paper/2502.05206"},"observation_digest":"sha256:0ff936cf35d803d3f9b0d05662f3051784917658eec4e31ec9e67f0fd98a2225","observation_id":"c72bb732-7160-41e5-8d00-f545fba87ee5","resolution":{"observed_at":"2026-05-23T05:17:36.786222Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2401.15295","doi":"10.48550/arxiv.2401.15295","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multi-trigger backdoor attacks: More triggers, more threats","venue":"arXiv (Cornell University)","work_id":"7748bac0-19bc-4dfe-953a-98cbb078c1d8","year":2024},"citing_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-23T04:39:04.591722Z"},"links":{"citing_paper":"/paper/2502.05206"},"observation_digest":"sha256:823651513835bbaec8cd5464dd09c5f5ccfa9b6d3b53a0268dc777a97d31164c","observation_id":"34018dd0-5cda-43e2-a8f0-f047aff6dbf1","resolution":{"observed_at":"2026-05-23T04:42:33.736542Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-20T18:52:20.702381+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T18:52:20.702381+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Defending backdoor attacks on vision transformer via patch processing","venue":null,"work_id":"ec6138df-9188-4827-a51f-a87576098ae0","year":2023},"citing_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-23T04:39:04.591722Z"},"links":{"citing_paper":"/paper/2502.05206"},"observation_digest":"sha256:533129d89573635eaa8262fe589729f1686ebe24ead32479ba3ee0c54ed78413","observation_id":"70125927-72e7-49bb-ad75-432370cfea6e","resolution":{"observed_at":"2026-05-23T05:17:36.575601Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A closer look at robustness of vision transformers to backdoor attacks","venue":null,"work_id":"5519263e-330d-4220-829d-18666db75c09","year":2024},"citing_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-23T04:39:04.591722Z"},"links":{"citing_paper":"/paper/2502.05206"},"observation_digest":"sha256:ee9ea1cbfa82e60a3d4a3400b953555b477017937561bda6cf2bdd6d93e70f49","observation_id":"7d852ece-0777-4c67-bbef-a5c27585152c","resolution":{"observed_at":"2026-05-23T05:17:36.742267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08477","last_updated":"2022-06-16T22:55:32Z","snapshot_observed_at":"2026-07-06T13:21:49.288193Z","submitted_at":"2022-06-16T22:55:32Z","title":"Backdoor Attacks on Vision Transformers","version":1},"cited_work":{"arxiv_id":"2206.08477","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2206.08477","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Backdoor attacks on vision transformers","venue":null,"work_id":"2fc592e1-da04-4208-8c03-efba4dc9299c","year":2022},"citing_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-23T04:39:04.591722Z"},"links":{"cited_paper":"/paper/2206.08477","citing_paper":"/paper/2502.05206"},"observation_digest":"sha256:3403c51770a406a93285dee8ec2a8c9c9cb4946de92913cb5bc2fcda0ad65fc5","observation_id":"1019570f-b8f7-4dc6-a8f8-f8d7bd0056d8","resolution":{"observed_at":"2026-05-23T04:42:34.214275Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Practical region-level attack against segment anything models","venue":null,"work_id":"610a1b9b-59d8-423d-954d-7b808de02f77","year":2024},"citing_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-23T04:39:04.591722Z"},"links":{"citing_paper":"/paper/2502.05206"},"observation_digest":"sha256:19389ec2095498e7e406aabca5a31759924c7ee578a9fce59b823d1ae0fcc3f2","observation_id":"4f52856f-4bf4-47f7-b1d9-35269606d040","resolution":{"observed_at":"2026-05-23T05:17:36.619204Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Segment (almost) nothing: Prompt-agnostic adversarial attacks on segmentation models","venue":null,"work_id":"2b2ba5aa-e55d-41ba-92fa-1b21470511d0","year":2024},"citing_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-23T04:39:04.591722Z"},"links":{"citing_paper":"/paper/2502.05206"},"observation_digest":"sha256:be7dcf593413107c25213875fb8d6579e2a01c8c8d98d8059ca651a2e47b3299","observation_id":"ad2203df-0473-4ccd-9508-10f7122e5a00","resolution":{"observed_at":"2026-05-23T05:17:36.766094Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.00866","last_updated":"2023-05-08T07:36:15Z","snapshot_observed_at":"2026-08-04T13:54:56.263336Z","submitted_at":"2023-05-01T15:08:17Z","title":"Attack-SAM: Towards Attacking Segment Anything Model With Adversarial Examples","version":2},"cited_work":{"arxiv_id":"2305.00866","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.00866","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Attack-sam: Towards evaluating adversarial robustness of segment anything model","venue":null,"work_id":"c649e2c0-6635-401e-9ed8-8832ce2086eb","year":2023},"citing_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-23T04:39:04.591722Z"},"links":{"cited_paper":"/paper/2305.00866","citing_paper":"/paper/2502.05206"},"observation_digest":"sha256:72eff32a254ed9424540f7073b8370ef0a743efbfa4a1bdeedc058e133230509","observation_id":"83c1d89b-3bb1-4cfc-ac20-f16c94044042","resolution":{"observed_at":"2026-05-23T04:42:34.203936Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10010","last_updated":"2024-02-28T06:10:39Z","snapshot_observed_at":"2026-07-06T16:33:26.145691Z","submitted_at":"2023-10-16T02:09:03Z","title":"Black-box Targeted Adversarial Attack on Segment Anything (SAM)","version":2},"cited_work":{"arxiv_id":"2310.10010","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.10010","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Black-box targeted adversarial attack on segment anything (sam)","venue":null,"work_id":"8b589062-0836-436b-8258-11783b4e51c6","year":2023},"citing_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-23T04:39:04.591722Z"},"links":{"cited_paper":"/paper/2310.10010","citing_paper":"/paper/2502.05206"},"observation_digest":"sha256:d151ce919fc68c9ac59da1a028c6503ab75d7519eae857e5265228ec41589e3a","observation_id":"27211bfb-5184-412f-9270-caf38abf3e33","resolution":{"observed_at":"2026-05-23T04:42:34.208812Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Unsegment anything by simulating deformation","venue":null,"work_id":"3da00183-2575-4d68-90e9-ea12fa0411ec","year":2024},"citing_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-23T04:39:04.591722Z"},"links":{"citing_paper":"/paper/2502.05206"},"observation_digest":"sha256:c85cef0978a4adbe9673fc72076974c6e5707f31a9b7ed7cc91e2b878f2e0f67","observation_id":"c3249f74-4000-427c-845e-af7298d9fde5","resolution":{"observed_at":"2026-05-23T05:17:36.675454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Transferable adversarial attacks on sam and its downstream models","venue":null,"work_id":"5a841521-9a95-4216-bae9-c4465131bf19","year":2024},"citing_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-23T04:39:04.591722Z"},"links":{"citing_paper":"/paper/2502.05206"},"observation_digest":"sha256:6dcc1e909bc034cf9dc09bc0805b1073542be001e2d257970565ae9caec71f8b","observation_id":"6e823951-1fb9-4ef2-bb5c-34762c19d735","resolution":{"observed_at":"2026-05-23T05:17:36.734175Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12431","last_updated":"2024-08-20T12:10:24Z","snapshot_observed_at":"2026-08-03T20:34:55.494182Z","submitted_at":"2023-10-19T02:49:24Z","title":"SAM Meets UAP: Attacking Segment Anything Model With Universal Adversarial Perturbation","version":2},"cited_work":{"arxiv_id":"2310.12431","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.12431","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Segment anything meets universal adversarial perturbation","venue":null,"work_id":"0307c81e-9d55-41bf-a526-54d8dc4b7920","year":2023},"citing_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-23T04:39:04.591722Z"},"links":{"cited_paper":"/paper/2310.12431","citing_paper":"/paper/2502.05206"},"observation_digest":"sha256:1598204c07d0049b1051f20b3be2decb993730064b1fce1704097bf5913eca47","observation_id":"a6e016ba-73d0-45c5-b9cf-9b179c2fe779","resolution":{"observed_at":"2026-05-23T04:42:33.692011Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Darksam: Fooling segment anything model to segment nothing","venue":null,"work_id":"d655bae2-8d3f-408a-999f-2638aae18edd","year":2024},"citing_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-23T04:39:04.591722Z"},"links":{"citing_paper":"/paper/2502.05206"},"observation_digest":"sha256:6be011ce2d69a99192936ece842ab63a63ae3944551b20e4fc5346a8c629ae4e","observation_id":"c1db7297-67a1-446c-bee6-6107c108291b","resolution":{"observed_at":"2026-05-23T05:17:36.790167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Asam: Boosting segment anything model with adversarial tuning","venue":null,"work_id":"9643aba3-1c9d-4a03-97e0-00e4e9d5bcef","year":2024},"citing_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-23T04:39:04.591722Z"},"links":{"citing_paper":"/paper/2502.05206"},"observation_digest":"sha256:04720b6ff453ee8063373067ab62cbb13cb0a2632c2494ebeeb4f01faff6c6ca","observation_id":"29c03919-6963-46a5-9491-04604a372c58","resolution":{"observed_at":"2026-05-23T05:17:36.670715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Badsam: Exploring security vulnerabilities of sam via backdoor attacks (student abstract)","venue":null,"work_id":"30828e41-d091-4fc5-a028-ffb21898eb2e","year":2024},"citing_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-23T04:39:04.591722Z"},"links":{"citing_paper":"/paper/2502.05206"},"observation_digest":"sha256:4c94a344bebe013cb9fc9e077e440ff0fd6695d6c91841381a82cbda778a1542","observation_id":"1028a23f-7d75-42b5-ac4d-8980faf344d8","resolution":{"observed_at":"2026-05-23T05:17:36.774541Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Unseg: One universal unlearnable example generator is enough against all image segmentation","venue":null,"work_id":"e0df8d94-98d1-40b5-94e7-cb43b8abe572","year":2024},"citing_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-23T04:39:04.591722Z"},"links":{"citing_paper":"/paper/2502.05206"},"observation_digest":"sha256:190f638ec8e203bc8a49c1252e58dc2db7c3d5d0cf960e066fe2821f8e6e0933","observation_id":"04facf76-b7df-4386-abfc-8bf6730e523d","resolution":{"observed_at":"2026-05-23T05:17:36.634440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bad charac- ters: Imperceptible nlp attacks","venue":null,"work_id":"c8757aea-023c-474c-a4fd-bdfc9c493d41","year":2022},"citing_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-23T04:39:04.591722Z"},"links":{"citing_paper":"/paper/2502.05206"},"observation_digest":"sha256:806bf70982cb0e132ad46150033c8f5bba7e63eaa0405bb5d1cd0b08b8d3605c","observation_id":"c5253791-c580-45ba-93f1-af549cdfd730","resolution":{"observed_at":"2026-05-23T05:17:36.638742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Is bert really robust? a strong baseline for natural language attack on text classification and entailment","venue":null,"work_id":"1958f779-707d-410d-ae9e-6e445233e2ca","year":2020},"citing_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-23T04:39:04.591722Z"},"links":{"citing_paper":"/paper/2502.05206"},"observation_digest":"sha256:76671dfad3cf2641c3cdf7137fb5c9815392124d0b9896320713de081eefbeaa","observation_id":"5fbbbd6e-935a-49f3-8524-41d4d50ff13e","resolution":{"observed_at":"2026-05-23T05:17:36.604053Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bert-attack: Adversarial attack against bert using bert","venue":null,"work_id":"58aea8c0-d221-4094-9879-695bdab162c9","year":2020},"citing_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-23T04:39:04.591722Z"},"links":{"citing_paper":"/paper/2502.05206"},"observation_digest":"sha256:3cf52bdfbced7bad688748d7d5244c707963d78999036cebb4578b45c9736a37","observation_id":"7298d2e4-0615-4bf3-969a-bc44305674e0","resolution":{"observed_at":"2026-05-23T05:17:36.665483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gradient-based adversarial attacks against text transformers","venue":null,"work_id":"9c88df0d-d14b-4ba8-b4f7-7932e2d96f80","year":2021},"citing_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-23T04:39:04.591722Z"},"links":{"citing_paper":"/paper/2502.05206"},"observation_digest":"sha256:834b803054d226d98d9e5254bfd4f6f10a54343127c292ae73158e2a8b74bdc5","observation_id":"4de37ab6-17d9-48ad-9af0-b9865c55cf0b","resolution":{"observed_at":"2026-05-23T05:17:36.661555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.11308","last_updated":"2022-01-31T12:57:19Z","snapshot_observed_at":"2026-07-06T11:50:37.315673Z","submitted_at":"2021-09-23T11:47:27Z","title":"Breaking BERT: Understanding its Vulnerabilities for Named Entity Recognition through Adversarial Attack","version":3},"cited_work":{"arxiv_id":"2109.11308","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2109.11308","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Breaking bert: Understanding its vulnerabilities for named entity recognition through adversarial attack","venue":null,"work_id":"4ce8f489-ba0c-438f-91b5-5cf786f26c26","year":2021},"citing_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-23T04:39:04.591722Z"},"links":{"cited_paper":"/paper/2109.11308","citing_paper":"/paper/2502.05206"},"observation_digest":"sha256:e1ca228f24cbfbfb15602873c2ec75c681b69adc5e34f4cb6e2adbf1b65efca0","observation_id":"d8f5561d-36d0-4787-918f-2fb7a0b6aba3","resolution":{"observed_at":"2026-05-23T04:42:33.673333Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.12507","last_updated":"2023-08-18T03:07:02Z","snapshot_observed_at":"2026-07-06T15:57:36.128928Z","submitted_at":"2023-07-24T03:44:17Z","title":"Gradient-Based Word Substitution for Obstinate Adversarial Examples Generation in Language Models","version":2},"cited_work":{"arxiv_id":"2307.12507","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2307.12507","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gradient-based word substitution for obstinate adversarial examples generation in language models","venue":null,"work_id":"3caacd0d-b1c2-44c3-8373-36832719ac52","year":2023},"citing_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-23T04:39:04.591722Z"},"links":{"cited_paper":"/paper/2307.12507","citing_paper":"/paper/2502.05206"},"observation_digest":"sha256:b22d8194e28468a89b1141f5e3c83d82501735d5e97bdf49c679af2df9ebea4e","observation_id":"264f9fed-159d-4c25-bdca-0a37e30d6cd2","resolution":{"observed_at":"2026-05-23T04:42:33.666757Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Expanding scope: Adapting english adver- sarial attacks to chinese","venue":null,"work_id":"d2a029f1-142e-4b14-91ce-0808175ab2b2","year":2023},"citing_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-23T04:39:04.591722Z"},"links":{"citing_paper":"/paper/2502.05206"},"observation_digest":"sha256:ccc39bd0602fbcfe2416f86548261b16eedaa3440ab15e3d9889f4eeaf5366ba","observation_id":"6a1afedf-6336-486d-b07a-290d06db1d82","resolution":{"observed_at":"2026-05-23T05:17:36.596331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14950","last_updated":"2023-10-14T05:03:53Z","snapshot_observed_at":"2026-07-06T15:32:22.277926Z","submitted_at":"2023-05-24T09:40:56Z","title":"Adversarial Demonstration Attacks on Large Language Models","version":2},"cited_work":{"arxiv_id":"2305.14950","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.14950","snapshot_observed_at":"2026-06-29T22:34:02.693240Z","title":"Adversarial demonstration attacks on large language models","venue":null,"work_id":"5d3374f6-dbde-48ef-98db-b4ce43496c56","year":2023},"citing_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-23T04:39:04.591722Z"},"links":{"cited_paper":"/paper/2305.14950","citing_paper":"/paper/2502.05206"},"observation_digest":"sha256:4532b21efdf9176019bcc6551dbf8d9a5f8208f6f9a48c40e24e5ab3c474bbb1","observation_id":"dad0650b-7048-41e5-996a-4eeb76b8ba21","resolution":{"observed_at":"2026-05-23T04:42:33.806868Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Adversarial attacks on large language model-based system and mitigating strategies: A case study on chatgpt","venue":null,"work_id":"b6a5cec2-3863-4fd8-a821-0b92265e0c66","year":2023},"citing_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-23T04:39:04.591722Z"},"links":{"citing_paper":"/paper/2502.05206"},"observation_digest":"sha256:6a4ec07f83cb6423fec1fafbaffe85eafc0305ea7f46f706edca00c619a832cc","observation_id":"43fd6788-e2b0-4b25-9ae8-de2393893515","resolution":{"observed_at":"2026-05-23T05:17:36.770418Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.08650","last_updated":"2023-09-15T15:03:33Z","snapshot_observed_at":"2026-07-06T16:19:10.103540Z","submitted_at":"2023-09-15T15:03:33Z","title":"Adversarial Attacks on Tables with Entity Swap","version":1},"cited_work":{"arxiv_id":"2309.08650","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.08650","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Adversarial attacks on tables with entity swap","venue":null,"work_id":"d9911c17-b2f3-420d-8094-de37a819b44e","year":2023},"citing_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-23T04:39:04.591722Z"},"links":{"cited_paper":"/paper/2309.08650","citing_paper":"/paper/2502.05206"},"observation_digest":"sha256:15fa1793f89a29efef923d0ca3572355b6b6c81dc1387c0568126285c36404bf","observation_id":"470eb8b6-1fc3-4b32-a927-8b06b9935c2f","resolution":{"observed_at":"2026-05-23T04:42:34.112486Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00614","last_updated":"2023-09-04T17:47:36Z","snapshot_observed_at":"2026-07-06T16:13:23.343694Z","submitted_at":"2023-09-01T17:59:44Z","title":"Baseline Defenses for Adversarial Attacks Against Aligned Language Models","version":2},"cited_work":{"arxiv_id":"2309.00614","doi":"10.48550/arxiv.2309.00614","metadata_source":"pith","pith_arxiv_id":"2309.00614","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Baseline Defenses for Adversarial Attacks Against Aligned Language Models","venue":"cs.LG","work_id":"db5870ca-177b-4d1d-a08d-ee5ceab17fe3","year":2023},"citing_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-23T04:39:04.591722Z"},"links":{"cited_paper":"/paper/2309.00614","citing_paper":"/paper/2502.05206"},"observation_digest":"sha256:2c9db203f12925da695228dd4f0b25b4cccebe66dcae9244adc4a542320b420f","observation_id":"be32f9b8-7f3c-4b43-9f23-2918c1c180df","resolution":{"observed_at":"2026-05-23T04:42:34.123161Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-12T03:19:31.483658+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T03:19:31.483658+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02705","last_updated":"2025-02-04T19:47:09Z","snapshot_observed_at":"2026-07-06T16:15:00.517258Z","submitted_at":"2023-09-06T04:37:20Z","title":"Certifying LLM Safety against Adversarial Prompting","version":4},"cited_work":{"arxiv_id":"2309.02705","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.02705","snapshot_observed_at":"2026-07-09T10:26:11.131634Z","title":"Certifying llm safety against adversar- ial prompting","venue":"cs.CL","work_id":"d19a91a9-d209-412c-b9b6-c7600e55ccf9","year":2023},"citing_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-23T04:39:04.591722Z"},"links":{"cited_paper":"/paper/2309.02705","citing_paper":"/paper/2502.05206"},"observation_digest":"sha256:17a5057c82c2fc7a6598ff860cf7470f3c3dd2b6918f9d054219c44fa1f43df5","observation_id":"9828062f-5849-40d1-9b97-d663117bbc92","resolution":{"observed_at":"2026-05-23T04:42:33.899921Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improving alignment and robustness with circuit breakers","venue":null,"work_id":"4364d2e3-1852-4127-818c-86f4b5f57881","year":2024},"citing_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-23T04:39:04.591722Z"},"links":{"citing_paper":"/paper/2502.05206"},"observation_digest":"sha256:f52df94b4ce8fbd77118235526a22cdf64b4685abe21b7afd5d8a69ba2191037","observation_id":"f2f8f0b8-6462-4d0c-8fbf-b2ab324969d4","resolution":{"observed_at":"2026-05-23T05:17:36.778492Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Low-resource languages jailbreak gpt-4","venue":null,"work_id":"2d26e944-c143-4bc1-9be1-55755bb71a50","year":2023},"citing_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-23T04:39:04.591722Z"},"links":{"citing_paper":"/paper/2502.05206"},"observation_digest":"sha256:081b35d0462d29becfe375fa1ee8c123ba7bb2fd40bd40c557eb47ee8a72b738","observation_id":"cf8f6f74-559e-4617-84e6-80d803ea746a","resolution":{"observed_at":"2026-05-23T05:17:36.626600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06463","last_updated":"2024-03-26T04:23:12Z","snapshot_observed_at":"2026-07-06T16:05:31.757410Z","submitted_at":"2023-08-12T04:05:57Z","title":"GPT-4 Is Too Smart To Be Safe: Stealthy Chat with LLMs via Cipher","version":2},"cited_work":{"arxiv_id":"2308.06463","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.06463","snapshot_observed_at":"2026-07-09T10:26:11.073540Z","title":"Gpt- 4 is too smart to be safe: Stealthy chat with llms via cipher","venue":"cs.CL","work_id":"c0bea3ab-35ce-4045-8b4f-46d34943d688","year":2023},"citing_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-23T04:39:04.591722Z"},"links":{"cited_paper":"/paper/2308.06463","citing_paper":"/paper/2502.05206"},"observation_digest":"sha256:1b11a003ff3a61f545de1cebd7d134973092e533cd66ecce31fdec09856a34cb","observation_id":"f6012ba0-abe9-46d9-86b0-fa47570d8577","resolution":{"observed_at":"2026-05-23T04:42:33.940336Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Jailbroken: How does llm safety training fail?","venue":null,"work_id":"96b2dec4-ebe9-42e1-adef-5b5e9e8d0297","year":2024},"citing_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-23T04:39:04.591722Z"},"links":{"citing_paper":"/paper/2502.05206"},"observation_digest":"sha256:0b74490b8027cc06e79d217a29581d7a5823dbcaa60560e0d5c63830f5981df9","observation_id":"3986d0c6-98fe-47c4-b65a-14f14aa4846d","resolution":{"observed_at":"2026-05-23T05:17:36.686403Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16765","last_updated":"2024-01-30T06:04:04Z","snapshot_observed_at":"2026-08-06T05:07:17.837298Z","submitted_at":"2024-01-30T06:04:04Z","title":"A Cross-Language Investigation into Jailbreak Attacks in Large Language Models","version":1},"cited_work":{"arxiv_id":"2401.16765","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.16765","snapshot_observed_at":"2026-07-05T04:50:41.667197Z","title":"A cross-language investigation into jailbreak attacks in large language models","venue":null,"work_id":"ef6ef8b5-2314-4226-b407-f647fab1af99","year":2024},"citing_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-23T04:39:04.591722Z"},"links":{"cited_paper":"/paper/2401.16765","citing_paper":"/paper/2502.05206"},"observation_digest":"sha256:ac180291eca4849cd79b44a3315f9a815be203a336a79976500236061539cecc","observation_id":"c3729edd-1c79-4184-be53-7383deb459f7","resolution":{"observed_at":"2026-05-23T04:42:34.134448Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12171","last_updated":"2024-03-18T18:39:53Z","snapshot_observed_at":"2026-07-06T17:46:38.027974Z","submitted_at":"2024-03-18T18:39:53Z","title":"EasyJailbreak: A Unified Framework for Jailbreaking Large Language Models","version":1},"cited_work":{"arxiv_id":"2403.12171","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.12171","snapshot_observed_at":"2026-07-01T23:06:20.853115Z","title":"Easyjailbreak: A unified framework for jailbreaking large language models","venue":null,"work_id":"f3f8772f-0e4e-41f2-944f-826f3e036403","year":2024},"citing_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-23T04:39:04.591722Z"},"links":{"cited_paper":"/paper/2403.12171","citing_paper":"/paper/2502.05206"},"observation_digest":"sha256:45173fd24d10e066e96fd540af7ecefa2085c51b5780be538c5273a1f7fe18e6","observation_id":"5f881974-725b-4550-bdc6-efdfc2777273","resolution":{"observed_at":"2026-05-23T04:42:33.872115Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14857","last_updated":"2024-06-18T19:22:19Z","snapshot_observed_at":"2026-08-04T14:20:58.554737Z","submitted_at":"2024-02-20T17:39:40Z","title":"Is the System Message Really Important to Jailbreaks in Large Language Models?","version":2},"cited_work":{"arxiv_id":"2402.14857","doi":"10.48550/arxiv.2402.14857","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.14857","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Is the system message really important to jailbreaks in large language models?","venue":"arXiv (Cornell University)","work_id":"17c11848-8842-4226-843a-072be2b10403","year":2024},"citing_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-23T04:39:04.591722Z"},"links":{"cited_paper":"/paper/2402.14857","citing_paper":"/paper/2502.05206"},"observation_digest":"sha256:42b280fa6d356111a365f41922b82d494af2172fa77a1f81a736eccfd09de045","observation_id":"1b9d4862-3607-430b-8c9c-ef8c5ce9d4c1","resolution":{"observed_at":"2026-05-23T04:42:34.075439Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tastle: Distract large language models for automatic jailbreak attack","venue":null,"work_id":"ab7154b0-8636-4545-931f-5efb2dbd7335","year":2024},"citing_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-23T04:39:04.591722Z"},"links":{"citing_paper":"/paper/2502.05206"},"observation_digest":"sha256:53e88357db06d085dfbedbf72ce2022148fb7d52d176bb22f04dc37bad6080ab","observation_id":"1ca4ac1c-1032-43a9-b2bc-e72e711de775","resolution":{"observed_at":"2026-05-23T05:17:36.750192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08754","last_updated":"2025-02-18T02:14:46Z","snapshot_observed_at":"2026-07-06T18:30:02.349638Z","submitted_at":"2024-06-13T02:24:08Z","title":"StructuralSleight: Automated Jailbreak Attacks on Large Language Models Utilizing Uncommon Text-Organization Structures","version":3},"cited_work":{"arxiv_id":"2406.08754","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.08754","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Structuralsleight: Automated jailbreak attacks on large language models utilizing uncommon text-encoded structure","venue":null,"work_id":"58c7e4c9-36f8-40a0-afc7-b03788789163","year":2024},"citing_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-23T04:39:04.591722Z"},"links":{"cited_paper":"/paper/2406.08754","citing_paper":"/paper/2502.05206"},"observation_digest":"sha256:f2aa1fa2a4cf31146549a339ef9181fd59cc959a3bbfa2fbbcaa62380841ba79","observation_id":"113ace04-a48e-4fad-a159-4ca3777a66bf","resolution":{"observed_at":"2026-05-23T04:42:33.784653Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16717","last_updated":"2024-02-26T16:35:59Z","snapshot_observed_at":"2026-07-06T17:35:36.900600Z","submitted_at":"2024-02-26T16:35:59Z","title":"CodeChameleon: Personalized Encryption Framework for Jailbreaking Large Language Models","version":1},"cited_work":{"arxiv_id":"2402.16717","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.16717","snapshot_observed_at":"2026-07-04T03:59:33.733302Z","title":"Codechameleon: Personalized encryption framework for jailbreaking large language models","venue":null,"work_id":"49218842-791e-4674-9da4-868d901d2b19","year":2024},"citing_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-23T04:39:04.591722Z"},"links":{"cited_paper":"/paper/2402.16717","citing_paper":"/paper/2502.05206"},"observation_digest":"sha256:6acd99a44a681117b995235a42160fb078e7cb1dedabeb189b0b82e3db948643","observation_id":"6ad69d10-7201-426b-9e20-a90fa9ecd089","resolution":{"observed_at":"2026-05-23T04:42:33.818659Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Play guessing game with llm: Indirect jailbreak attack with implicit clues","venue":null,"work_id":"a87ccc02-17e2-4a87-a113-2a9937859341","year":2024},"citing_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-23T04:39:04.591722Z"},"links":{"citing_paper":"/paper/2502.05206"},"observation_digest":"sha256:a19c213d3434a20ba89cc436d54ec1bf343ea9dafcd0f016646a5af06c98f0e6","observation_id":"0c47b453-4a50-4cd8-8711-f643dd53aae5","resolution":{"observed_at":"2026-05-23T05:17:36.681554Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Evaluating implicit bias in large language models by attacking from a psychometric perspective","venue":null,"work_id":"5346d6aa-dd7b-4883-a4a3-1ccf2e9a222e","year":2025},"citing_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-05-23T04:39:04.591722Z"},"links":{"citing_paper":"/paper/2502.05206"},"observation_digest":"sha256:034943f25a0c567bdc41e2ab6d9fa1cf1e85fe676586c16f7abe4d0c06e5cdf5","observation_id":"69d41336-2ebf-48a2-b3d2-140f0afb3213","resolution":{"observed_at":"2026-05-23T05:17:36.630730Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.16205","last_updated":"2025-06-18T02:41:56Z","snapshot_observed_at":"2026-07-06T18:50:31.528338Z","submitted_at":"2024-07-23T06:14:41Z","title":"LLMs can be Dangerous Reasoners: Analyzing-based Jailbreak Attack on Large Language Models","version":6},"cited_work":{"arxiv_id":"2407.16205","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.16205","snapshot_observed_at":"2026-07-04T03:59:33.724943Z","title":"Llms can be dangerous reasoners: Analyzing-based jailbreak attack on large language models","venue":null,"work_id":"05e6d8a8-206a-463d-9663-27cf7130a2a2","year":2024},"citing_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-23T04:39:04.591722Z"},"links":{"cited_paper":"/paper/2407.16205","citing_paper":"/paper/2502.05206"},"observation_digest":"sha256:3480b3a201303ca0c9d6d75c63c787fbc01133641220a2ccf626a8cdd59c1cc8","observation_id":"62e381a7-d7ac-4001-a4b1-173b4eacfd10","resolution":{"observed_at":"2026-05-23T04:42:33.756304Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"AutoDAN: Generating stealthy jailbreak prompts on aligned large language models","venue":null,"work_id":"9e4e3628-c8b4-4edc-837c-c1ae38f75728","year":2024},"citing_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-23T04:39:04.591722Z"},"links":{"citing_paper":"/paper/2502.05206"},"observation_digest":"sha256:fd9d84b97021f1cbf645d10394e4d6075d318fc9167df0334fa5b0d91317316a","observation_id":"02bdfea2-0dc5-461c-9bd9-b4e0094b635e","resolution":{"observed_at":"2026-05-23T05:17:36.558044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10253","last_updated":"2024-06-27T16:01:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-19T02:19:48Z","title":"GPTFUZZER: Red Teaming Large Language Models with Auto-Generated Jailbreak Prompts","version":4},"cited_work":{"arxiv_id":"2309.10253","doi":"10.48550/arxiv.2309.10253","metadata_source":"pith","pith_arxiv_id":"2309.10253","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPTFUZZER: Red Teaming Large Language Models with Auto-Generated Jailbreak Prompts","venue":"cs.AI","work_id":"230d395f-9220-4e6f-a52f-e593552b049b","year":2023},"citing_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-05-23T04:39:04.591722Z"},"links":{"cited_paper":"/paper/2309.10253","citing_paper":"/paper/2502.05206"},"observation_digest":"sha256:d98a3fa882d7a665f82eef78d7df6c106924e85fccfa1f5c137c515f3ca416ce","observation_id":"2d131d2d-11d1-4533-8557-0568fc07297a","resolution":{"observed_at":"2026-05-23T04:42:33.679810Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-24T00:53:10.090181+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T00:53:10.090181+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Jailbreaking black box large language models in twenty queries","venue":null,"work_id":"10ce3326-13d3-49f1-bbb5-17b1d5a06a4b","year":2023},"citing_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-05-23T04:39:04.591722Z"},"links":{"citing_paper":"/paper/2502.05206"},"observation_digest":"sha256:f550ce49242b900100df67700e12cc6f283027f5ca750f42b9486a46905f90c9","observation_id":"d8220671-ca82-4cfe-b808-b9a81b0daf04","resolution":{"observed_at":"2026-05-23T05:17:36.607657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Masterkey: Automated jailbreaking of large language model chatbots","venue":null,"work_id":"e3efa5a6-3418-4d84-a286-d3f40437d1ab","year":2024},"citing_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-05-23T04:39:04.591722Z"},"links":{"citing_paper":"/paper/2502.05206"},"observation_digest":"sha256:19445d7b65564967ca41459298e2169f7af27818c753aff137ac2ee39f24999e","observation_id":"4e29f3c5-de65-483f-8fc0-4aa636244851","resolution":{"observed_at":"2026-05-23T05:17:36.793567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20653","last_updated":"2025-06-17T03:03:45Z","snapshot_observed_at":"2026-07-06T18:23:10.807498Z","submitted_at":"2024-05-31T07:41:03Z","title":"Mind the Inconspicuous: Revealing the Hidden Weakness in Aligned LLMs' Refusal Boundaries","version":3},"cited_work":{"arxiv_id":"2405.20653","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.20653","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Enhancing jailbreak attack against large language models through silent tokens","venue":null,"work_id":"c631bee8-b687-4d33-acd2-127688801b28","year":2024},"citing_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-05-23T04:39:04.591722Z"},"links":{"cited_paper":"/paper/2405.20653","citing_paper":"/paper/2502.05206"},"observation_digest":"sha256:3c1482328f83944c8454d1cd999df4c349cb8bcf5e6a1196b177336725b4bc10","observation_id":"7758fee1-dae0-4588-b025-05dce8dcbdc1","resolution":{"observed_at":"2026-05-23T04:42:33.848607Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fuzzllm: A novel and universal fuzzing framework for proactively discovering jailbreak vulnerabilities in large language models","venue":null,"work_id":"95b59bb9-e9d7-4e78-b5bb-5ee6cd41375b","year":2024},"citing_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-05-23T04:39:04.591722Z"},"links":{"citing_paper":"/paper/2502.05206"},"observation_digest":"sha256:c4e16a4400c178a2259e8ddf6f3d29f8a1675afa7e39f33b5b7c1f6e8bc9d760","observation_id":"0d01b685-0547-402a-a42f-38253a463a4e","resolution":{"observed_at":"2026-05-23T05:17:36.588494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03603","last_updated":"2024-08-07T07:46:08Z","snapshot_observed_at":"2026-08-05T06:17:29.776544Z","submitted_at":"2024-08-07T07:46:08Z","title":"EnJa: Ensemble Jailbreak on Large Language Models","version":1},"cited_work":{"arxiv_id":"2408.03603","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2408.03603","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Enja: Ensemble jailbreak on large language models","venue":null,"work_id":"878921c5-bde1-426c-82cc-b04270dd4c3d","year":2024},"citing_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-05-23T04:39:04.591722Z"},"links":{"cited_paper":"/paper/2408.03603","citing_paper":"/paper/2502.05206"},"observation_digest":"sha256:5f952c04c9394b94fb82ccb0ebb8840c91b487715fc093558967767897e749d8","observation_id":"de14a188-2096-47d3-87a3-2cdde5186f6f","resolution":{"observed_at":"2026-05-23T04:42:33.654548Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Red teaming language models with language models","venue":null,"work_id":"e3f31f79-39c9-49a1-a1f6-b691cb4f7272","year":2022},"citing_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-05-23T04:39:04.591722Z"},"links":{"citing_paper":"/paper/2502.05206"},"observation_digest":"sha256:e5acffd77b3b06054e3cc43dcc3e6fe8f47401443c7023bdb2d9f165418526d3","observation_id":"d0a42fa9-2b95-42ce-9192-f70388557978","resolution":{"observed_at":"2026-05-23T05:17:36.762034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Curiosity-driven red-teaming for large language models","venue":null,"work_id":"b1535693-ef9f-45ed-8db4-43397656f5ff","year":2024},"citing_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-05-23T04:39:04.591722Z"},"links":{"citing_paper":"/paper/2502.05206"},"observation_digest":"sha256:5e16470f908e9468a08b56175b29cc63708f987e59fff7a9300193b01ff7e984","observation_id":"4cd70880-6e40-44d1-bfd1-ca1d1a0e7b3b","resolution":{"observed_at":"2026-05-23T05:17:36.592261Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"“do anything now","venue":null,"work_id":"970a5d04-6008-4b9a-af00-58c919b1372b","year":2024},"citing_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-05-23T04:39:04.591722Z"},"links":{"citing_paper":"/paper/2502.05206"},"observation_digest":"sha256:84863e44c71169d54aed43a946c9591f10916e74b2e6ce4f0541150e0cdefaac","observation_id":"06d73ad8-a097-42db-8943-c37bc1038f72","resolution":{"observed_at":"2026-05-23T05:17:36.646507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":"2307.15043","doi":"10.48550/arxiv.2307.15043","metadata_source":"pith","pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","venue":"cs.CL","work_id":"3322fa86-1768-4677-8425-dd326b45e078","year":2023},"citing_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-05-23T04:39:04.591722Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2502.05206"},"observation_digest":"sha256:600050d7b2b562d10974f3e64875c7072bb6e292eec85d6d2e759753df19529f","observation_id":"637f526e-2929-40eb-97d3-90a660c36cc2","resolution":{"observed_at":"2026-05-23T04:42:33.773359Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21018","last_updated":"2024-06-05T16:35:49Z","snapshot_observed_at":"2026-07-06T18:23:23.565502Z","submitted_at":"2024-05-31T17:07:15Z","title":"Improved Techniques for Optimization-Based Jailbreaking on Large Language Models","version":2},"cited_work":{"arxiv_id":"2405.21018","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.21018","snapshot_observed_at":"2026-07-10T11:57:03.497396Z","title":"Improved Techniques for Optimization-Based Jailbreaking on Large Language Models","venue":"cs.LG","work_id":"5e4ac646-f92e-47a8-b299-00ec4f1960f7","year":2024},"citing_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-05-23T04:39:04.591722Z"},"links":{"cited_paper":"/paper/2405.21018","citing_paper":"/paper/2502.05206"},"observation_digest":"sha256:2117fc2329e3aa2d95ec73e00762a427b9e743b8b441d1fa5d9cb883760eea85","observation_id":"9fb65307-e2e1-4b9c-a6f2-7a32e13f3fd1","resolution":{"observed_at":"2026-05-23T04:42:34.240968Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Semantic-guided prompt organization for universal goal hijacking against llms","venue":null,"work_id":"047662a9-02f0-499e-988f-35d5e1d9da9e","year":2025},"citing_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-05-23T04:39:04.591722Z"},"links":{"citing_paper":"/paper/2502.05206"},"observation_digest":"sha256:8a68e061d00d121247ff85f3b2d490e73acc0e857dfe6a86d61c31e885755f15","observation_id":"e4b8cf3c-3f16-45c0-87ec-e1b111785471","resolution":{"observed_at":"2026-05-23T05:17:36.738226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01288","last_updated":"2024-10-30T12:08:42Z","snapshot_observed_at":"2026-07-06T18:24:26.225262Z","submitted_at":"2024-06-03T12:59:17Z","title":"Improved Few-Shot Jailbreaking Can Circumvent Aligned Language Models and Their Defenses","version":2},"cited_work":{"arxiv_id":"2406.01288","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.01288","snapshot_observed_at":"2026-07-04T19:50:11.193751Z","title":"Improved few- shot jailbreaking can circumvent aligned language models and their defenses","venue":null,"work_id":"dcf8173d-4f97-4a8c-8809-e49e50087e05","year":2024},"citing_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-05-23T04:39:04.591722Z"},"links":{"cited_paper":"/paper/2406.01288","citing_paper":"/paper/2502.05206"},"observation_digest":"sha256:8eda32d0bd28cf22128ef685890718dad431c5dfe325384971073f43f55021c3","observation_id":"23119037-8784-4bda-8a5d-ad01d32a4e2b","resolution":{"observed_at":"2026-05-23T04:42:34.262850Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.17256","last_updated":"2025-07-23T18:43:18Z","snapshot_observed_at":"2026-07-06T17:22:41.286422Z","submitted_at":"2024-01-30T18:48:37Z","title":"Weak-to-Strong Jailbreaking on Large Language Models","version":5},"cited_work":{"arxiv_id":"2401.17256","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.17256","snapshot_observed_at":"2026-07-04T09:29:44.257667Z","title":"Weak-to-strong jailbreaking on large language models","venue":null,"work_id":"1a77a248-051b-47d2-b768-c2e9e9f7dadc","year":2025},"citing_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-05-23T04:39:04.591722Z"},"links":{"cited_paper":"/paper/2401.17256","citing_paper":"/paper/2502.05206"},"observation_digest":"sha256:4044fd7bae12904372caba5f56df00ec3d5e06c1cb68acdac046293a42ecd4e2","observation_id":"e17858c5-6305-4ec4-a4cc-c9d78526c34f","resolution":{"observed_at":"2026-05-23T04:42:34.219547Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11313","last_updated":"2025-04-02T08:03:11Z","snapshot_observed_at":"2026-08-06T08:22:43.050012Z","submitted_at":"2024-08-21T03:35:24Z","title":"An Optimizable Suffix Is Worth A Thousand Templates: Efficient Black-box Jailbreaking without Affirmative Phrases via LLM as Optimizer","version":2},"cited_work":{"arxiv_id":"2408.11313","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2408.11313","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Un- locking adversarial suffix optimization without affirmative phrases: Efficient black-box jailbreaking via llm as optimizer","venue":null,"work_id":"43514ce0-83a9-41dc-8cd3-b0f1dac1ee9e","year":2024},"citing_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-05-23T04:39:04.591722Z"},"links":{"cited_paper":"/paper/2408.11313","citing_paper":"/paper/2502.05206"},"observation_digest":"sha256:94673011535939af7544621cba18b32c5bf1c914999fa6680bee6423bab10d15","observation_id":"6a3a682e-b897-4adf-9041-a885df213db2","resolution":{"observed_at":"2026-05-23T04:42:34.224637Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":"2310.03693","doi":"10.48550/arxiv.2310.03693","metadata_source":"pith","pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","venue":"cs.CL","work_id":"8b07137a-7175-4dd1-a8d9-570493d3f404","year":2023},"citing_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-05-23T04:39:04.591722Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2502.05206"},"observation_digest":"sha256:d2c57ddfd760cf0b7bc9a0194c8d71eb4ce6dee84430b9893d38299efc9a8894","observation_id":"835096e9-28fb-48b8-a2f6-0b9a7610125a","resolution":{"observed_at":"2026-05-23T04:42:34.192432Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17433","last_updated":"2025-01-29T06:24:58Z","snapshot_observed_at":"2026-08-06T08:51:13.562155Z","submitted_at":"2025-01-29T06:24:58Z","title":"Virus: Harmful Fine-tuning Attack for Large Language Models Bypassing Guardrail Moderation","version":1},"cited_work":{"arxiv_id":"2501.17433","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.17433","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Virus: Harmful fine-tuning attack for large language models bypassing guardrail mod- eration","venue":null,"work_id":"0dfb332e-6732-4179-9139-263173590cbb","year":2025},"citing_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-05-23T04:39:04.591722Z"},"links":{"cited_paper":"/paper/2501.17433","citing_paper":"/paper/2502.05206"},"observation_digest":"sha256:8b7dd2911956af466f52f82ba09cd6d5e25b19eca320c2f3006c5823577dd61b","observation_id":"40fb8e02-5ed2-48e4-9805-054843b93c9b","resolution":{"observed_at":"2026-05-23T04:42:34.279284Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","latest_version":6,"primary_category":"cs.CR","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":35,"verified_fuzzy":65},"total_outbound_references":300},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 100 of 300 outbound references and 18 inbound Pith citation observations for arXiv:2502.05206."}