{"as_of":"2026-08-08T23:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8b92b2cc4970ec10afb77e6c91cce565aaefd62a9b39e6c1cf3f8fc5db97583a","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":27,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T15:38:17.480616Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T23:59:07.063832Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.12336","last_updated":"2024-06-05T15:32:03Z","snapshot_observed_at":"2026-07-06T17:32:24.161667Z","submitted_at":"2024-02-19T18:09:48Z","title":"Robust CLIP: Unsupervised Adversarial Fine-Tuning of Vision Embeddings for Robust Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12336","snapshot_observed_at":"2026-08-08T15:38:17.480616Z","title":"Robust clip: Unsupervised adversarial fine-tuning of vision embeddings for robust large vision-language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06390","last_updated":"2025-02-11T04:42:24Z","snapshot_observed_at":"2026-08-08T15:33:58.231746Z","submitted_at":"2025-02-10T12:20:08Z","title":"When Data Manipulation Meets Attack Goals: An In-depth Survey of Attacks for VLMs","version":2},"reference_index":107,"source":"pdf_text","source_observed_at":"2026-08-08T15:38:17.480616Z"},"links":{"cited_paper":"/paper/2402.12336","citing_paper":"/paper/2502.06390"},"observation_digest":"sha256:0a0f931bc0b032d714d29d85c5fb44e4bba560a4cc6e0feb1e23a00b0b79963e","observation_id":"d2f5efb4-3dbf-442c-b739-0e378715e711","resolution":{"observed_at":"2026-08-08T15:38:17.480616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12336","last_updated":"2024-06-05T15:32:03Z","snapshot_observed_at":"2026-07-06T17:32:24.161667Z","submitted_at":"2024-02-19T18:09:48Z","title":"Robust CLIP: Unsupervised Adversarial Fine-Tuning of Vision Embeddings for Robust Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12336","snapshot_observed_at":"2026-08-07T19:45:19.969645Z","title":"Robust clip: Unsupervised adversarial fine-tuning of vision embed- dings for robust large vision-language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.14881","last_updated":"2025-02-14T08:42:43Z","snapshot_observed_at":"2026-08-07T22:02:21.919237Z","submitted_at":"2025-02-14T08:42:43Z","title":"A Survey of Safety on Large Vision-Language Models: Attacks, Defenses and Evaluations","version":1},"reference_index":148,"source":"pdf_text","source_observed_at":"2026-08-07T19:45:19.969645Z"},"links":{"cited_paper":"/paper/2402.12336","citing_paper":"/paper/2502.14881"},"observation_digest":"sha256:46b9ae1cd11af3cd9532a28bdbb19b7f61a3a0292a52efbd4c5be77e323add70","observation_id":"0b0d825d-4486-4c91-b147-d572b13c2511","resolution":{"observed_at":"2026-08-07T19:45:19.969645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12336","last_updated":"2024-06-05T15:32:03Z","snapshot_observed_at":"2026-07-06T17:32:24.161667Z","submitted_at":"2024-02-19T18:09:48Z","title":"Robust CLIP: Unsupervised Adversarial Fine-Tuning of Vision Embeddings for Robust Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12336","snapshot_observed_at":"2026-08-07T15:42:31.555198Z","title":"D., Croce, F","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14204","last_updated":"2025-05-20T11:04:14Z","snapshot_observed_at":"2026-08-07T23:52:33.058884Z","submitted_at":"2025-05-20T11:04:14Z","title":"Beginning with You: Perceptual-Initialization Improves Vision-Language Representation and Alignment","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:31.555198Z"},"links":{"cited_paper":"/paper/2402.12336","citing_paper":"/paper/2505.14204"},"observation_digest":"sha256:436c95943c118179156bc71ba38288756f4a1f6192174a1d6fa675c63e091c25","observation_id":"60a5a2dd-ed63-4bae-94e8-2a741ef83965","resolution":{"observed_at":"2026-08-07T15:42:31.555198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12336","last_updated":"2024-06-05T15:32:03Z","snapshot_observed_at":"2026-07-06T17:32:24.161667Z","submitted_at":"2024-02-19T18:09:48Z","title":"Robust CLIP: Unsupervised Adversarial Fine-Tuning of Vision Embeddings for Robust Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12336","snapshot_observed_at":"2026-08-07T11:26:14.409174Z","title":"D., Croce, F., and Hein, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-08T05:48:10.443610Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:14.409174Z"},"links":{"cited_paper":"/paper/2402.12336","citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:bd1f0ef0b1cde360634f9474a218b349ce35ab1d76f640274d2fcb81a9fd960d","observation_id":"ebf584df-d99f-4edd-a28a-dc9ee716d36c","resolution":{"observed_at":"2026-08-07T11:26:14.409174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12336","last_updated":"2024-06-05T15:32:03Z","snapshot_observed_at":"2026-07-06T17:32:24.161667Z","submitted_at":"2024-02-19T18:09:48Z","title":"Robust CLIP: Unsupervised Adversarial Fine-Tuning of Vision Embeddings for Robust Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12336","snapshot_observed_at":"2026-08-07T10:59:19.962834Z","title":"Robust clip: Unsupervised adversarial fine-tuning of vision embeddings for robust large vision-language models.arXiv preprint arXiv:2402.12336, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03933","last_updated":"2026-06-10T10:07:38Z","snapshot_observed_at":"2026-08-07T16:57:10.610923Z","submitted_at":"2025-06-04T13:26:33Z","title":"Diffusion-based Cumulative Adversarial Purification for Vision Language Models","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T10:59:19.962834Z"},"links":{"cited_paper":"/paper/2402.12336","citing_paper":"/paper/2506.03933"},"observation_digest":"sha256:42ad2d567a56dd9621d746348bbae91a60af6baad19a905de5dee63004836f3e","observation_id":"7bf6b250-1b9c-40ed-92e4-0b3daabdcbca","resolution":{"observed_at":"2026-08-07T10:59:19.962834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12336","last_updated":"2024-06-05T15:32:03Z","snapshot_observed_at":"2026-07-06T17:32:24.161667Z","submitted_at":"2024-02-19T18:09:48Z","title":"Robust CLIP: Unsupervised Adversarial Fine-Tuning of Vision Embeddings for Robust Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12336","snapshot_observed_at":"2026-08-06T21:34:45.196277Z","title":"Robust clip: Unsupervised adversarial fine-tuning of vision embeddings,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23844","last_updated":"2025-06-30T13:34:34Z","snapshot_observed_at":"2026-08-08T15:24:13.507722Z","submitted_at":"2025-06-30T13:34:34Z","title":"A Survey on Autonomy-Induced Security Risks in Large Model-Based Agents","version":1},"reference_index":154,"source":"pdf_text","source_observed_at":"2026-08-06T21:34:45.196277Z"},"links":{"cited_paper":"/paper/2402.12336","citing_paper":"/paper/2506.23844"},"observation_digest":"sha256:b89e72b4206e113f40081fd8d392eb4a5481d1bab32bcf2f1a479c2e19731461","observation_id":"0f6951c7-d207-492e-a4ee-d99974500a89","resolution":{"observed_at":"2026-08-06T21:34:45.196277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12336","last_updated":"2024-06-05T15:32:03Z","snapshot_observed_at":"2026-07-06T17:32:24.161667Z","submitted_at":"2024-02-19T18:09:48Z","title":"Robust CLIP: Unsupervised Adversarial Fine-Tuning of Vision Embeddings for Robust Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12336","snapshot_observed_at":"2026-08-06T15:19:59.332470Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.16257","last_updated":"2026-07-24T03:48:49Z","snapshot_observed_at":"2026-08-08T19:58:25.647309Z","submitted_at":"2025-07-22T06:13:30Z","title":"Quality Text, Robust Vision: The Role of Language in Enhancing Visual Robustness of Vision-Language Models","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:59.332470Z"},"links":{"cited_paper":"/paper/2402.12336","citing_paper":"/paper/2507.16257"},"observation_digest":"sha256:3f20704ac6a77f9edab61f13330d38184e78b6717050dbf6fcbd49ef8119b323","observation_id":"40c52470-0a62-4685-8bf2-293a3fe76fa5","resolution":{"observed_at":"2026-08-06T15:19:59.332470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12336","last_updated":"2024-06-05T15:32:03Z","snapshot_observed_at":"2026-07-06T17:32:24.161667Z","submitted_at":"2024-02-19T18:09:48Z","title":"Robust CLIP: Unsupervised Adversarial Fine-Tuning of Vision Embeddings for Robust Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12336","snapshot_observed_at":"2026-08-06T11:54:43.232843Z","title":"”Robust CLIP: Unsupervised Adversarial Fine- Tuning of Vision Embeddings for Robust Large Vision-Language Mod- els” arXiv preprint arXiv:2402.12336 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22304","last_updated":"2025-07-30T00:34:20Z","snapshot_observed_at":"2026-08-07T22:27:04.322645Z","submitted_at":"2025-07-30T00:34:20Z","title":"Invisible Injections: Exploiting Vision-Language Models Through Steganographic Prompt Embedding","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T11:54:43.232843Z"},"links":{"cited_paper":"/paper/2402.12336","citing_paper":"/paper/2507.22304"},"observation_digest":"sha256:69ddeb5db967b29a0d8d6bbcd60a47081e2c62a66f133130676900a040fefc58","observation_id":"44628e35-95c1-46cb-a172-88e77b633620","resolution":{"observed_at":"2026-08-06T11:54:43.232843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12336","last_updated":"2024-06-05T15:32:03Z","snapshot_observed_at":"2026-07-06T17:32:24.161667Z","submitted_at":"2024-02-19T18:09:48Z","title":"Robust CLIP: Unsupervised Adversarial Fine-Tuning of Vision Embeddings for Robust Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12336","snapshot_observed_at":"2026-08-05T16:17:37.853389Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.18772","last_updated":"2025-08-26T07:55:46Z","snapshot_observed_at":"2026-08-07T08:24:33.804357Z","submitted_at":"2025-08-26T07:55:46Z","title":"Beyond the Textual: Generating Coherent Visual Options for MCQs","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-05T16:17:37.853389Z"},"links":{"cited_paper":"/paper/2402.12336","citing_paper":"/paper/2508.18772"},"observation_digest":"sha256:0707db80582e2db27ee91c54e9b3baeea6ea50bd7794d0658dacd3255fa4ccc9","observation_id":"42f5acdd-0d3a-4206-9f1f-8a3e676722b5","resolution":{"observed_at":"2026-08-05T16:17:37.853389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12336","last_updated":"2024-06-05T15:32:03Z","snapshot_observed_at":"2026-07-06T17:32:24.161667Z","submitted_at":"2024-02-19T18:09:48Z","title":"Robust CLIP: Unsupervised Adversarial Fine-Tuning of Vision Embeddings for Robust Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2402.12336","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.12336","snapshot_observed_at":"2026-07-03T23:59:07.063832Z","title":"the object","venue":null,"work_id":"19b0c995-0cbb-4efd-b6bd-0eb3fe955faf","year":2024},"citing_paper":{"arxiv_id":"2509.15435","last_updated":"2026-05-19T14:30:01Z","snapshot_observed_at":"2026-07-06T22:30:17.163909Z","submitted_at":"2025-09-18T21:17:23Z","title":"ORCA: An Agentic Reasoning Framework for Hallucination and Adversarial Robustness in Vision-Language Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-18T15:23:13.318310Z"},"links":{"cited_paper":"/paper/2402.12336","citing_paper":"/paper/2509.15435"},"observation_digest":"sha256:6f2a3f124be62e7cebc3d72f14c7444437d58a66fb2971286c2857229ca08ef1","observation_id":"9d741b0b-7ea8-47c8-b0a1-15ab48bef964","resolution":{"observed_at":"2026-05-18T15:26:33.866893Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12336","last_updated":"2024-06-05T15:32:03Z","snapshot_observed_at":"2026-07-06T17:32:24.161667Z","submitted_at":"2024-02-19T18:09:48Z","title":"Robust CLIP: Unsupervised Adversarial Fine-Tuning of Vision Embeddings for Robust Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2402.12336","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.12336","snapshot_observed_at":"2026-07-03T23:59:07.063832Z","title":"the object","venue":null,"work_id":"19b0c995-0cbb-4efd-b6bd-0eb3fe955faf","year":2024},"citing_paper":{"arxiv_id":"2509.15435","last_updated":"2026-05-19T14:30:01Z","snapshot_observed_at":"2026-07-06T22:30:17.163909Z","submitted_at":"2025-09-18T21:17:23Z","title":"ORCA: An Agentic Reasoning Framework for Hallucination and Adversarial Robustness in Vision-Language Models","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-21T21:28:59.898029Z"},"links":{"cited_paper":"/paper/2402.12336","citing_paper":"/paper/2509.15435"},"observation_digest":"sha256:bccb5f6c8828a865eeff4ac183a1cfb9498537f3be558521f8868af5cbcb12a4","observation_id":"1f6c570e-8d54-4f01-bab1-e703eb2c4c22","resolution":{"observed_at":"2026-05-21T21:30:39.404154Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12336","last_updated":"2024-06-05T15:32:03Z","snapshot_observed_at":"2026-07-06T17:32:24.161667Z","submitted_at":"2024-02-19T18:09:48Z","title":"Robust CLIP: Unsupervised Adversarial Fine-Tuning of Vision Embeddings for Robust Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12336","snapshot_observed_at":"2026-08-04T12:41:50.528290Z","title":"Robust clip: Unsupervised adversarial fine-tuning of vision embeddings for robust large vision-language models.arXiv preprint arXiv:2402.12336, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.02913","last_updated":"2026-07-25T20:08:20Z","snapshot_observed_at":"2026-08-04T12:41:46.129800Z","submitted_at":"2025-10-03T11:36:02Z","title":"Improving Adversarial Robustness of Zero-Shot CLIP with Confidence-Aware Weighting","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-04T12:41:50.528290Z"},"links":{"cited_paper":"/paper/2402.12336","citing_paper":"/paper/2510.02913"},"observation_digest":"sha256:7e5c15052360b81c60ebbc4ec9933d559a9d51670e4ae0a4417c549c91cca751","observation_id":"79c270ba-1df5-424b-9319-3061f87632e6","resolution":{"observed_at":"2026-08-04T12:41:50.528290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12336","last_updated":"2024-06-05T15:32:03Z","snapshot_observed_at":"2026-07-06T17:32:24.161667Z","submitted_at":"2024-02-19T18:09:48Z","title":"Robust CLIP: Unsupervised Adversarial Fine-Tuning of Vision Embeddings for Robust Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2402.12336","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.12336","snapshot_observed_at":"2026-07-03T23:59:07.063832Z","title":"the object","venue":null,"work_id":"19b0c995-0cbb-4efd-b6bd-0eb3fe955faf","year":2024},"citing_paper":{"arxiv_id":"2511.21893","last_updated":"2026-04-21T12:31:10Z","snapshot_observed_at":"2026-08-02T23:18:14.454521Z","submitted_at":"2025-11-26T20:18:20Z","title":"Breaking the Illusion: Consensus-Based Generative Mitigation of Adversarial Illusions in Multi-Modal Embeddings","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-17T04:15:38.632039Z"},"links":{"cited_paper":"/paper/2402.12336","citing_paper":"/paper/2511.21893"},"observation_digest":"sha256:338bb2774eceac7a7682e8f7ac141f8016a8de4ae255dd34c257dc65f2d7c301","observation_id":"07b7e299-dd12-43fa-9994-0c7e0a87f8b5","resolution":{"observed_at":"2026-05-17T04:19:00.649555Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12336","last_updated":"2024-06-05T15:32:03Z","snapshot_observed_at":"2026-07-06T17:32:24.161667Z","submitted_at":"2024-02-19T18:09:48Z","title":"Robust CLIP: Unsupervised Adversarial Fine-Tuning of Vision Embeddings for Robust Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2402.12336","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.12336","snapshot_observed_at":"2026-07-03T23:59:07.063832Z","title":"the object","venue":null,"work_id":"19b0c995-0cbb-4efd-b6bd-0eb3fe955faf","year":2024},"citing_paper":{"arxiv_id":"2512.07222","last_updated":"2026-04-16T04:54:16Z","snapshot_observed_at":"2026-08-06T07:19:18.941325Z","submitted_at":"2025-12-08T07:05:18Z","title":"Pay Less Attention to Function Words for Free Robustness of Vision-Language Models","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-17T00:33:13.977360Z"},"links":{"cited_paper":"/paper/2402.12336","citing_paper":"/paper/2512.07222"},"observation_digest":"sha256:fc704e50d6b25c978c0222d3387b672cca1d67b4d8175302f406ba6941274f33","observation_id":"47352615-a4e4-4a93-941d-2173c1eb5178","resolution":{"observed_at":"2026-05-17T00:33:44.684493Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12336","last_updated":"2024-06-05T15:32:03Z","snapshot_observed_at":"2026-07-06T17:32:24.161667Z","submitted_at":"2024-02-19T18:09:48Z","title":"Robust CLIP: Unsupervised Adversarial Fine-Tuning of Vision Embeddings for Robust Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2402.12336","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.12336","snapshot_observed_at":"2026-07-03T23:59:07.063832Z","title":"the object","venue":null,"work_id":"19b0c995-0cbb-4efd-b6bd-0eb3fe955faf","year":2024},"citing_paper":{"arxiv_id":"2604.18867","last_updated":"2026-04-20T21:42:14Z","snapshot_observed_at":"2026-08-01T22:32:20.962036Z","submitted_at":"2026-04-20T21:42:14Z","title":"Hierarchically Robust Zero-shot Vision-language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-10T04:25:24.008261Z"},"links":{"cited_paper":"/paper/2402.12336","citing_paper":"/paper/2604.18867"},"observation_digest":"sha256:db0514c90ecc6f016bd6ddd233a581acdb5ef28aea897e2a43e0eb0213f56047","observation_id":"18c41af6-dc16-4dfd-9daf-0e3ec428f094","resolution":{"observed_at":"2026-05-11T11:56:31.436342Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12336","last_updated":"2024-06-05T15:32:03Z","snapshot_observed_at":"2026-07-06T17:32:24.161667Z","submitted_at":"2024-02-19T18:09:48Z","title":"Robust CLIP: Unsupervised Adversarial Fine-Tuning of Vision Embeddings for Robust Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2402.12336","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.12336","snapshot_observed_at":"2026-07-03T23:59:07.063832Z","title":"the object","venue":null,"work_id":"19b0c995-0cbb-4efd-b6bd-0eb3fe955faf","year":2024},"citing_paper":{"arxiv_id":"2605.01449","last_updated":"2026-05-02T13:56:50Z","snapshot_observed_at":"2026-08-03T12:34:05.607551Z","submitted_at":"2026-05-02T13:56:50Z","title":"VisInject: Disruption != Injection -- A Dual-Dimension Evaluation of Universal Adversarial Attacks on Vision-Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-09T14:24:48.999632Z"},"links":{"cited_paper":"/paper/2402.12336","citing_paper":"/paper/2605.01449"},"observation_digest":"sha256:3937e1e676363a40ce706108e10942bdbac18a2e92e669922d5a8c75c1129abe","observation_id":"2de6a4d2-d14f-4c8e-a78b-2f7dec54061f","resolution":{"observed_at":"2026-05-11T16:56:08.096327Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12336","last_updated":"2024-06-05T15:32:03Z","snapshot_observed_at":"2026-07-06T17:32:24.161667Z","submitted_at":"2024-02-19T18:09:48Z","title":"Robust CLIP: Unsupervised Adversarial Fine-Tuning of Vision Embeddings for Robust Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2402.12336","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.12336","snapshot_observed_at":"2026-07-03T23:59:07.063832Z","title":"the object","venue":null,"work_id":"19b0c995-0cbb-4efd-b6bd-0eb3fe955faf","year":2024},"citing_paper":{"arxiv_id":"2605.08440","last_updated":"2026-05-08T20:02:57Z","snapshot_observed_at":"2026-08-03T10:58:40.265119Z","submitted_at":"2026-05-08T20:02:57Z","title":"TARO: Temporal Adversarial Rectification Optimization Using Diffusion Models as Purifiers","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-12T02:52:25.317140Z"},"links":{"cited_paper":"/paper/2402.12336","citing_paper":"/paper/2605.08440"},"observation_digest":"sha256:0caf49720238fa227bde35dcec382fe725ad08553037b3d27a5727e9a70e4991","observation_id":"bf82e486-a7ba-410e-829d-9b0784ee6381","resolution":{"observed_at":"2026-05-12T07:26:30.625340Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12336","last_updated":"2024-06-05T15:32:03Z","snapshot_observed_at":"2026-07-06T17:32:24.161667Z","submitted_at":"2024-02-19T18:09:48Z","title":"Robust CLIP: Unsupervised Adversarial Fine-Tuning of Vision Embeddings for Robust Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2402.12336","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.12336","snapshot_observed_at":"2026-07-03T23:59:07.063832Z","title":"the object","venue":null,"work_id":"19b0c995-0cbb-4efd-b6bd-0eb3fe955faf","year":2024},"citing_paper":{"arxiv_id":"2605.15584","last_updated":"2026-05-15T03:48:22Z","snapshot_observed_at":"2026-08-03T05:11:41.739403Z","submitted_at":"2026-05-15T03:48:22Z","title":"AGC: Adaptive Geodesic Correction for Adversarial Robustness on Vision-Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-20T19:37:09.983024Z"},"links":{"cited_paper":"/paper/2402.12336","citing_paper":"/paper/2605.15584"},"observation_digest":"sha256:9ba9c5ba992c02885631f0a38b11c33926c38dba9a4a4ebf7d63effc18ac522a","observation_id":"8fad4a87-bd7c-45d5-90b0-8083bf4bd21b","resolution":{"observed_at":"2026-05-20T19:38:56.014305Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12336","last_updated":"2024-06-05T15:32:03Z","snapshot_observed_at":"2026-07-06T17:32:24.161667Z","submitted_at":"2024-02-19T18:09:48Z","title":"Robust CLIP: Unsupervised Adversarial Fine-Tuning of Vision Embeddings for Robust Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2402.12336","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.12336","snapshot_observed_at":"2026-07-03T23:59:07.063832Z","title":"the object","venue":null,"work_id":"19b0c995-0cbb-4efd-b6bd-0eb3fe955faf","year":2024},"citing_paper":{"arxiv_id":"2605.25922","last_updated":"2026-05-25T15:00:07Z","snapshot_observed_at":"2026-08-02T01:29:33.033813Z","submitted_at":"2026-05-25T15:00:07Z","title":"Closed-Loop Bidirectional Prompting for Adversarial Robustness of Vision Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:26.803098Z"},"links":{"cited_paper":"/paper/2402.12336","citing_paper":"/paper/2605.25922"},"observation_digest":"sha256:a007cf85a45f9bb47464a183f037d450793ff68ff60583e27e535dfcebb04807","observation_id":"e2c317cd-cc9f-4d88-a85a-0070af298475","resolution":{"observed_at":"2026-06-29T22:44:01.424531Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12336","last_updated":"2024-06-05T15:32:03Z","snapshot_observed_at":"2026-07-06T17:32:24.161667Z","submitted_at":"2024-02-19T18:09:48Z","title":"Robust CLIP: Unsupervised Adversarial Fine-Tuning of Vision Embeddings for Robust Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2402.12336","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.12336","snapshot_observed_at":"2026-07-03T23:59:07.063832Z","title":"the object","venue":null,"work_id":"19b0c995-0cbb-4efd-b6bd-0eb3fe955faf","year":2024},"citing_paper":{"arxiv_id":"2606.03713","last_updated":"2026-06-02T14:34:48Z","snapshot_observed_at":"2026-08-01T18:41:34.888563Z","submitted_at":"2026-06-02T14:34:48Z","title":"Investigating Adversarial Robustness of Multi-modal Large Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-28T11:11:34.152223Z"},"links":{"cited_paper":"/paper/2402.12336","citing_paper":"/paper/2606.03713"},"observation_digest":"sha256:39213f5718b1ac99356d91a7ff115294863ba014127db5d311f028e8c194d1d7","observation_id":"88d00781-61dc-4169-be5e-9483b0047586","resolution":{"observed_at":"2026-07-02T02:06:27.643485Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12336","last_updated":"2024-06-05T15:32:03Z","snapshot_observed_at":"2026-07-06T17:32:24.161667Z","submitted_at":"2024-02-19T18:09:48Z","title":"Robust CLIP: Unsupervised Adversarial Fine-Tuning of Vision Embeddings for Robust Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2402.12336","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.12336","snapshot_observed_at":"2026-07-03T23:59:07.063832Z","title":"the object","venue":null,"work_id":"19b0c995-0cbb-4efd-b6bd-0eb3fe955faf","year":2024},"citing_paper":{"arxiv_id":"2606.03730","last_updated":"2026-06-04T14:10:51Z","snapshot_observed_at":"2026-08-03T22:55:12.534950Z","submitted_at":"2026-06-02T14:49:04Z","title":"Beyond False Stability: High-Noise Drift Gating for Test-Time Adversarial Defenses in Vision-Language Models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-28T11:04:30.654255Z"},"links":{"cited_paper":"/paper/2402.12336","citing_paper":"/paper/2606.03730"},"observation_digest":"sha256:947952209f318af7888251ba825b763750cf1893840671c022c30df05e1e5fed","observation_id":"8c1a1912-7c5a-4c20-9366-be2a7de70aca","resolution":{"observed_at":"2026-07-02T02:16:26.844167Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12336","last_updated":"2024-06-05T15:32:03Z","snapshot_observed_at":"2026-07-06T17:32:24.161667Z","submitted_at":"2024-02-19T18:09:48Z","title":"Robust CLIP: Unsupervised Adversarial Fine-Tuning of Vision Embeddings for Robust Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2402.12336","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.12336","snapshot_observed_at":"2026-07-03T23:59:07.063832Z","title":"the object","venue":null,"work_id":"19b0c995-0cbb-4efd-b6bd-0eb3fe955faf","year":2024},"citing_paper":{"arxiv_id":"2606.03793","last_updated":"2026-06-02T15:42:10Z","snapshot_observed_at":"2026-08-05T09:22:21.521124Z","submitted_at":"2026-06-02T15:42:10Z","title":"Exploring Adversarial Robustness and Safety Alignment in Multilingual Multi-Modal Large Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-28T10:10:38.261635Z"},"links":{"cited_paper":"/paper/2402.12336","citing_paper":"/paper/2606.03793"},"observation_digest":"sha256:737d092f7f3ef9e1426f5fc5ecae7b85fa63c77912269c1f936dd5d5e7b8a4b4","observation_id":"15bcbbc8-c1d1-4e41-b3bb-1cf236b83bef","resolution":{"observed_at":"2026-07-02T03:16:34.811575Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12336","last_updated":"2024-06-05T15:32:03Z","snapshot_observed_at":"2026-07-06T17:32:24.161667Z","submitted_at":"2024-02-19T18:09:48Z","title":"Robust CLIP: Unsupervised Adversarial Fine-Tuning of Vision Embeddings for Robust Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2402.12336","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.12336","snapshot_observed_at":"2026-07-03T23:59:07.063832Z","title":"the object","venue":null,"work_id":"19b0c995-0cbb-4efd-b6bd-0eb3fe955faf","year":2024},"citing_paper":{"arxiv_id":"2606.18839","last_updated":"2026-06-17T09:15:50Z","snapshot_observed_at":"2026-08-05T10:14:00.241766Z","submitted_at":"2026-06-17T09:15:50Z","title":"Semantic Robustness Certification for Vision-Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-26T21:32:54.522220Z"},"links":{"cited_paper":"/paper/2402.12336","citing_paper":"/paper/2606.18839"},"observation_digest":"sha256:6b53a6b6b6dc67220d6b24c1b5fe4462f70c759d85293ddb97f738b4bdcd0cc4","observation_id":"89952cc8-2263-4c1c-b85d-c46a9375ba8c","resolution":{"observed_at":"2026-07-03T23:59:07.065828Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12336","last_updated":"2024-06-05T15:32:03Z","snapshot_observed_at":"2026-07-06T17:32:24.161667Z","submitted_at":"2024-02-19T18:09:48Z","title":"Robust CLIP: Unsupervised Adversarial Fine-Tuning of Vision Embeddings for Robust Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12336","snapshot_observed_at":"2026-07-12T04:24:39.660564Z","title":"Robust clip: Unsupervised adversarial fine-tuning of vision embeddings for robust large vision-language models.arXiv preprint arXiv:2402.12336, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03165","last_updated":"2026-07-03T10:05:55Z","snapshot_observed_at":"2026-07-12T04:24:39.169631Z","submitted_at":"2026-07-03T10:05:55Z","title":"Rethinking Brain Decoding with CLIP: The Role of Adversarial Robustness","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-12T04:24:39.660564Z"},"links":{"cited_paper":"/paper/2402.12336","citing_paper":"/paper/2607.03165"},"observation_digest":"sha256:714a10c7463b79a3d9464071174c5743f6806d8264f9a257891ac19c5e94a965","observation_id":"538d2546-01bd-4239-a8ac-34713d4da38b","resolution":{"observed_at":"2026-07-12T04:24:39.660564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12336","last_updated":"2024-06-05T15:32:03Z","snapshot_observed_at":"2026-07-06T17:32:24.161667Z","submitted_at":"2024-02-19T18:09:48Z","title":"Robust CLIP: Unsupervised Adversarial Fine-Tuning of Vision Embeddings for Robust Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12336","snapshot_observed_at":"2026-07-12T01:16:40.492300Z","title":"Schlarmann, N","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03600","last_updated":"2026-07-03T20:56:12Z","snapshot_observed_at":"2026-08-02T17:34:14.996776Z","submitted_at":"2026-07-03T20:56:12Z","title":"A Step Towards Robust Unsupervised Domain Adaptation via Fine-Tuning and Reinforcement Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-12T01:16:40.492300Z"},"links":{"cited_paper":"/paper/2402.12336","citing_paper":"/paper/2607.03600"},"observation_digest":"sha256:9f29b41d153a0f6dd82be456bc2bbb1bf70f64a065ebfb7bce6a65907096e06c","observation_id":"4ac2d30b-6440-46da-a1cd-4dd36c0c6ef1","resolution":{"observed_at":"2026-07-12T01:16:40.492300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12336","last_updated":"2024-06-05T15:32:03Z","snapshot_observed_at":"2026-07-06T17:32:24.161667Z","submitted_at":"2024-02-19T18:09:48Z","title":"Robust CLIP: Unsupervised Adversarial Fine-Tuning of Vision Embeddings for Robust Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12336","snapshot_observed_at":"2026-07-31T23:31:48.797271Z","title":"Robust clip: Unsupervised adversarial fine-tuning of vision embeddings for robust large vision-language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27897","last_updated":"2026-07-30T09:13:35Z","snapshot_observed_at":"2026-08-02T23:46:09.065588Z","submitted_at":"2026-07-30T09:13:35Z","title":"Unifying Adversarially Robust Model Experts in Vision-Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-31T23:31:48.797271Z"},"links":{"cited_paper":"/paper/2402.12336","citing_paper":"/paper/2607.27897"},"observation_digest":"sha256:246a681c51596b771cecaff8e6735dd54ea1db0025424f50b89a4f1c8e839d34","observation_id":"45b3fb0f-1089-4e95-9caf-ba4113ac01b8","resolution":{"observed_at":"2026-07-31T23:31:48.797271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12336","last_updated":"2024-06-05T15:32:03Z","snapshot_observed_at":"2026-07-06T17:32:24.161667Z","submitted_at":"2024-02-19T18:09:48Z","title":"Robust CLIP: Unsupervised Adversarial Fine-Tuning of Vision Embeddings for Robust Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12336","snapshot_observed_at":"2026-08-04T13:51:18.042445Z","title":"Schlarmann, N","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02137","last_updated":"2026-08-03T12:24:50Z","snapshot_observed_at":"2026-08-07T03:01:54.342210Z","submitted_at":"2026-08-03T12:24:50Z","title":"Two Sides of the Same Coin: Co-Evolving Search for Cross-Task Attacks on Vision-Language Models","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-04T13:51:18.042445Z"},"links":{"cited_paper":"/paper/2402.12336","citing_paper":"/paper/2608.02137"},"observation_digest":"sha256:984ba72fcb0a53151b536be9b66e6ec626f412cc04d9f37d5150ee40435d21fd","observation_id":"8da3932e-745e-4220-96c4-9f02a0a37b5f","resolution":{"observed_at":"2026-08-04T13:51:18.042445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2402.12336/citation-record","integrity":"/paper/2402.12336/integrity","json":"/paper/2402.12336/citation-record.json","paper":"/paper/2402.12336"},"outbound":[],"paper":{"arxiv_id":"2402.12336","last_updated":"2024-06-05T15:32:03Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T17:32:24.161667Z","submitted_at":"2024-02-19T18:09:48Z","title":"Robust CLIP: Unsupervised Adversarial Fine-Tuning of Vision Embeddings for Robust Large Vision-Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 27 inbound Pith citation observations for arXiv:2402.12336."}