{"as_of":"2026-08-08T01:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:46eb3ea91b7ae8d372a9591a6a5e974b9645e90f9552622da4c282f0b0b4a4f9","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":14,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":14,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":14,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":14,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:04:01.363663Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-29T13:23:28.107852Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.19287","last_updated":"2024-11-12T10:48:21Z","snapshot_observed_at":"2026-07-06T18:07:27.432252Z","submitted_at":"2024-04-30T06:34:21Z","title":"Revisiting the Adversarial Robustness of Vision Language Models: a Multimodal Perspective","version":3},"cited_work":{"arxiv_id":"2404.19287","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.19287","snapshot_observed_at":"2026-06-29T13:23:28.107852Z","title":"Revisiting the adversarial robustness of vision language models: a multimodal perspective","venue":null,"work_id":"f81621fe-6f41-4ce4-b31c-62776bc33bf1","year":2024},"citing_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"reference_index":243,"source":"pdf_text","source_observed_at":"2026-05-23T04:39:04.591722Z"},"links":{"cited_paper":"/paper/2404.19287","citing_paper":"/paper/2502.05206"},"observation_digest":"sha256:581cf39f02fde47eea779e622e9d9168786bb2f27f2e531ef957ae87fec9b095","observation_id":"c45f3868-043e-4b3e-98c7-f58623422f7e","resolution":{"observed_at":"2026-05-23T04:42:34.230016Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.19287","last_updated":"2024-11-12T10:48:21Z","snapshot_observed_at":"2026-07-06T18:07:27.432252Z","submitted_at":"2024-04-30T06:34:21Z","title":"Revisiting the Adversarial Robustness of Vision Language Models: a Multimodal Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.19287","snapshot_observed_at":"2026-08-07T15:04:01.363663Z","title":"Pick up the alphabet soup and place it in the basket","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16640","last_updated":"2025-05-22T13:12:46Z","snapshot_observed_at":"2026-08-07T14:55:29.164249Z","submitted_at":"2025-05-22T13:12:46Z","title":"BadVLA: Towards Backdoor Attacks on Vision-Language-Action Models via Objective-Decoupled Optimization","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T15:04:01.363663Z"},"links":{"cited_paper":"/paper/2404.19287","citing_paper":"/paper/2505.16640"},"observation_digest":"sha256:921dc6cc7ca34a76b88f3d45baed2e5d6c92136e4e647064bbc98990907b0429","observation_id":"b9b58612-b4bb-4b69-a49d-d0ceda8543f4","resolution":{"observed_at":"2026-08-07T15:04:01.363663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.19287","last_updated":"2024-11-12T10:48:21Z","snapshot_observed_at":"2026-07-06T18:07:27.432252Z","submitted_at":"2024-04-30T06:34:21Z","title":"Revisiting the Adversarial Robustness of Vision Language Models: a Multimodal Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.19287","snapshot_observed_at":"2026-08-07T14:29:34.741589Z","title":"Revisiting the adversarial robustness of vision language models: a multimodal perspective,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18770","last_updated":"2025-05-24T16:20:06Z","snapshot_observed_at":"2026-08-07T14:23:43.806027Z","submitted_at":"2025-05-24T16:20:06Z","title":"Dual-Path Stable Soft Prompt Generation for Domain Generalization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:34.741589Z"},"links":{"cited_paper":"/paper/2404.19287","citing_paper":"/paper/2505.18770"},"observation_digest":"sha256:c944c871f73d68894eff4644aa34343a344df0f99843b3864e9b0ce53bc1989d","observation_id":"ed9c31f9-b857-487a-bd06-383e5ae4aa40","resolution":{"observed_at":"2026-08-07T14:29:34.741589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.19287","last_updated":"2024-11-12T10:48:21Z","snapshot_observed_at":"2026-07-06T18:07:27.432252Z","submitted_at":"2024-04-30T06:34:21Z","title":"Revisiting the Adversarial Robustness of Vision Language Models: a Multimodal Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.19287","snapshot_observed_at":"2026-08-07T10:40:49.610244Z","title":"Revisiting the adversarial robustness of vision lan- guage models: a multimodal perspective","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05429","last_updated":"2025-06-05T08:09:05Z","snapshot_observed_at":"2026-08-07T10:32:06.331613Z","submitted_at":"2025-06-05T08:09:05Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:49.610244Z"},"links":{"cited_paper":"/paper/2404.19287","citing_paper":"/paper/2506.05429"},"observation_digest":"sha256:8027627f200f664e227e353a914815dba635f1d64210c16fedb4f06ad102213e","observation_id":"48fb0b46-4211-47e3-ade7-8dedcfe9dfa8","resolution":{"observed_at":"2026-08-07T10:40:49.610244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.19287","last_updated":"2024-11-12T10:48:21Z","snapshot_observed_at":"2026-07-06T18:07:27.432252Z","submitted_at":"2024-04-30T06:34:21Z","title":"Revisiting the Adversarial Robustness of Vision Language Models: a Multimodal Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.19287","snapshot_observed_at":"2026-08-06T22:23:50.267956Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21874","last_updated":"2025-06-27T03:13:47Z","snapshot_observed_at":"2026-08-06T22:14:36.819384Z","submitted_at":"2025-06-27T03:13:47Z","title":"On the Feasibility of Poisoning Text-to-Image AI Models via Adversarial Mislabeling","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-06T22:23:50.267956Z"},"links":{"cited_paper":"/paper/2404.19287","citing_paper":"/paper/2506.21874"},"observation_digest":"sha256:3059579459a623504225f0915951ab26d6f7ccbf5af098198ea2f360d9d00eba","observation_id":"6cdb1c89-ffa7-413e-98b4-26347ee70ee5","resolution":{"observed_at":"2026-08-06T22:23:50.267956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.19287","last_updated":"2024-11-12T10:48:21Z","snapshot_observed_at":"2026-07-06T18:07:27.432252Z","submitted_at":"2024-04-30T06:34:21Z","title":"Revisiting the Adversarial Robustness of Vision Language Models: a Multimodal Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.19287","snapshot_observed_at":"2026-08-06T11:54:43.081752Z","title":"”Revisiting the Adversarial Robustness of Vi- sion Language Models: a Multimodal Perspective” arXiv preprint arXiv:2404.19287 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22304","last_updated":"2025-07-30T00:34:20Z","snapshot_observed_at":"2026-08-07T22:27:04.322645Z","submitted_at":"2025-07-30T00:34:20Z","title":"Invisible Injections: Exploiting Vision-Language Models Through Steganographic Prompt Embedding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T11:54:43.081752Z"},"links":{"cited_paper":"/paper/2404.19287","citing_paper":"/paper/2507.22304"},"observation_digest":"sha256:20b57ea26652e45faea084d1ea09bcf62eed100d7765cb6d9f2fd328893e2677","observation_id":"d3863703-51e5-41df-9d6c-1d1c333341cb","resolution":{"observed_at":"2026-08-06T11:54:43.081752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.19287","last_updated":"2024-11-12T10:48:21Z","snapshot_observed_at":"2026-07-06T18:07:27.432252Z","submitted_at":"2024-04-30T06:34:21Z","title":"Revisiting the Adversarial Robustness of Vision Language Models: a Multimodal Perspective","version":3},"cited_work":{"arxiv_id":"2404.19287","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.19287","snapshot_observed_at":"2026-06-29T13:23:28.107852Z","title":"Revisiting the adversarial robustness of vision language models: a multimodal perspective","venue":null,"work_id":"f81621fe-6f41-4ce4-b31c-62776bc33bf1","year":2024},"citing_paper":{"arxiv_id":"2509.15435","last_updated":"2026-05-19T14:30:01Z","snapshot_observed_at":"2026-07-06T22:30:17.163909Z","submitted_at":"2025-09-18T21:17:23Z","title":"ORCA: An Agentic Reasoning Framework for Hallucination and Adversarial Robustness in Vision-Language Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-18T15:23:13.318310Z"},"links":{"cited_paper":"/paper/2404.19287","citing_paper":"/paper/2509.15435"},"observation_digest":"sha256:c5e369be8f3ef7a42fc718106bbc17df8a8e44d05740c5e3c6ae5d11f57910b7","observation_id":"460e04dd-8b0b-4288-91bb-5d1f87039018","resolution":{"observed_at":"2026-05-18T15:26:33.883060Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.19287","last_updated":"2024-11-12T10:48:21Z","snapshot_observed_at":"2026-07-06T18:07:27.432252Z","submitted_at":"2024-04-30T06:34:21Z","title":"Revisiting the Adversarial Robustness of Vision Language Models: a Multimodal Perspective","version":3},"cited_work":{"arxiv_id":"2404.19287","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.19287","snapshot_observed_at":"2026-06-29T13:23:28.107852Z","title":"Revisiting the adversarial robustness of vision language models: a multimodal perspective","venue":null,"work_id":"f81621fe-6f41-4ce4-b31c-62776bc33bf1","year":2024},"citing_paper":{"arxiv_id":"2509.15435","last_updated":"2026-05-19T14:30:01Z","snapshot_observed_at":"2026-07-06T22:30:17.163909Z","submitted_at":"2025-09-18T21:17:23Z","title":"ORCA: An Agentic Reasoning Framework for Hallucination and Adversarial Robustness in Vision-Language Models","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-21T21:28:59.898029Z"},"links":{"cited_paper":"/paper/2404.19287","citing_paper":"/paper/2509.15435"},"observation_digest":"sha256:a94580938876b2cd4b89160f8d826188fef6fd028dcffc34289f8f48ff764652","observation_id":"7178a73d-70d6-497f-a870-60ef53d4a74a","resolution":{"observed_at":"2026-05-21T21:30:39.418151Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.19287","last_updated":"2024-11-12T10:48:21Z","snapshot_observed_at":"2026-07-06T18:07:27.432252Z","submitted_at":"2024-04-30T06:34:21Z","title":"Revisiting the Adversarial Robustness of Vision Language Models: a Multimodal Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.19287","snapshot_observed_at":"2026-08-03T07:47:37.588939Z","title":"P., Zhao, Q., and Chen, B","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.19210","last_updated":"2026-06-09T16:01:52Z","snapshot_observed_at":"2026-08-06T16:38:35.610168Z","submitted_at":"2026-01-27T05:24:45Z","title":"Contrastive Spectral Rectification: Test-Time Defense towards Zero-shot Adversarial Robustness of CLIP","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T07:47:37.588939Z"},"links":{"cited_paper":"/paper/2404.19287","citing_paper":"/paper/2601.19210"},"observation_digest":"sha256:2e6ffb93731eff3523392003c7e25faaf10f308cc18b7ec18c9df713a08567b7","observation_id":"25df41f2-ed47-49fe-b0ad-c51c755b6b34","resolution":{"observed_at":"2026-08-03T07:47:37.588939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.19287","last_updated":"2024-11-12T10:48:21Z","snapshot_observed_at":"2026-07-06T18:07:27.432252Z","submitted_at":"2024-04-30T06:34:21Z","title":"Revisiting the Adversarial Robustness of Vision Language Models: a Multimodal Perspective","version":3},"cited_work":{"arxiv_id":"2404.19287","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.19287","snapshot_observed_at":"2026-06-29T13:23:28.107852Z","title":"Revisiting the adversarial robustness of vision language models: a multimodal perspective","venue":null,"work_id":"f81621fe-6f41-4ce4-b31c-62776bc33bf1","year":2024},"citing_paper":{"arxiv_id":"2604.03117","last_updated":"2026-07-18T15:19:06Z","snapshot_observed_at":"2026-08-02T16:52:00.328103Z","submitted_at":"2026-04-03T15:42:55Z","title":"Revealing Physical-World Semantic Vulnerabilities: Universal Adversarial Patch for Infrared Vision-Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-13T19:43:29.058335Z"},"links":{"cited_paper":"/paper/2404.19287","citing_paper":"/paper/2604.03117"},"observation_digest":"sha256:1fe80255d84adeb2eeea1367bd8f3b3ddec3cd37642826f795aaea375cb56c4d","observation_id":"537782d0-b461-44ba-a0c9-ee9e00e5ff48","resolution":{"observed_at":"2026-05-13T19:48:11.625968Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.19287","last_updated":"2024-11-12T10:48:21Z","snapshot_observed_at":"2026-07-06T18:07:27.432252Z","submitted_at":"2024-04-30T06:34:21Z","title":"Revisiting the Adversarial Robustness of Vision Language Models: a Multimodal Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.19287","snapshot_observed_at":"2026-08-02T16:52:02.261328Z","title":"Mandic, Qibin Zhao, and Badong Chen","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.03117","last_updated":"2026-07-18T15:19:06Z","snapshot_observed_at":"2026-08-02T16:52:00.328103Z","submitted_at":"2026-04-03T15:42:55Z","title":"Revealing Physical-World Semantic Vulnerabilities: Universal Adversarial Patch for Infrared Vision-Language Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T16:52:02.261328Z"},"links":{"cited_paper":"/paper/2404.19287","citing_paper":"/paper/2604.03117"},"observation_digest":"sha256:27e8bca4cdd7e2fbf5a12ce3beacd8f38b02ae673a443bcffcf09a7162d50b51","observation_id":"361705f3-d9fa-4e77-a6f4-173ccdcbdf28","resolution":{"observed_at":"2026-08-02T16:52:02.261328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.19287","last_updated":"2024-11-12T10:48:21Z","snapshot_observed_at":"2026-07-06T18:07:27.432252Z","submitted_at":"2024-04-30T06:34:21Z","title":"Revisiting the Adversarial Robustness of Vision Language Models: a Multimodal Perspective","version":3},"cited_work":{"arxiv_id":"2404.19287","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.19287","snapshot_observed_at":"2026-06-29T13:23:28.107852Z","title":"Revisiting the adversarial robustness of vision language models: a multimodal perspective","venue":null,"work_id":"f81621fe-6f41-4ce4-b31c-62776bc33bf1","year":2024},"citing_paper":{"arxiv_id":"2605.13213","last_updated":"2026-05-13T09:06:21Z","snapshot_observed_at":"2026-07-06T23:24:47.309044Z","submitted_at":"2026-05-13T09:06:21Z","title":"Hierarchical Attacks for Multi-Modal Multi-Agent Reasoning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-14T20:16:30.070819Z"},"links":{"cited_paper":"/paper/2404.19287","citing_paper":"/paper/2605.13213"},"observation_digest":"sha256:92501bf4f95f624063eb1aa2060bbd595118e2e704aa71f74f23456fc10dea53","observation_id":"ca664a2a-660c-4bd0-8455-5fd486f25e56","resolution":{"observed_at":"2026-05-14T20:19:27.931230Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.19287","last_updated":"2024-11-12T10:48:21Z","snapshot_observed_at":"2026-07-06T18:07:27.432252Z","submitted_at":"2024-04-30T06:34:21Z","title":"Revisiting the Adversarial Robustness of Vision Language Models: a Multimodal Perspective","version":3},"cited_work":{"arxiv_id":"2404.19287","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.19287","snapshot_observed_at":"2026-06-29T13:23:28.107852Z","title":"Revisiting the adversarial robustness of vision language models: a multimodal perspective","venue":null,"work_id":"f81621fe-6f41-4ce4-b31c-62776bc33bf1","year":2024},"citing_paper":{"arxiv_id":"2605.17577","last_updated":"2026-05-17T18:07:08Z","snapshot_observed_at":"2026-08-03T01:04:57.342492Z","submitted_at":"2026-05-17T18:07:08Z","title":"TAME: Test-Time Adversarial Prompt Tuning via Mixture-of-Experts for Vision-Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-20T14:20:49.278545Z"},"links":{"cited_paper":"/paper/2404.19287","citing_paper":"/paper/2605.17577"},"observation_digest":"sha256:87ea9919fc9747697623882f71b4c4e8f314f65059efab11b140c53fedfa4d87","observation_id":"ef32f8f9-1cf9-435e-9468-f114b735f816","resolution":{"observed_at":"2026-05-20T14:23:21.496636Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.19287","last_updated":"2024-11-12T10:48:21Z","snapshot_observed_at":"2026-07-06T18:07:27.432252Z","submitted_at":"2024-04-30T06:34:21Z","title":"Revisiting the Adversarial Robustness of Vision Language Models: a Multimodal Perspective","version":3},"cited_work":{"arxiv_id":"2404.19287","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.19287","snapshot_observed_at":"2026-06-29T13:23:28.107852Z","title":"Revisiting the adversarial robustness of vision language models: a multimodal perspective","venue":null,"work_id":"f81621fe-6f41-4ce4-b31c-62776bc33bf1","year":2024},"citing_paper":{"arxiv_id":"2605.28609","last_updated":"2026-05-27T15:24:31Z","snapshot_observed_at":"2026-08-03T19:09:23.628613Z","submitted_at":"2026-05-27T15:24:31Z","title":"JECA^2: Judgment-Explanation Consistent Adversarial Attack against Forensic Vision-Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-29T13:18:46.414179Z"},"links":{"cited_paper":"/paper/2404.19287","citing_paper":"/paper/2605.28609"},"observation_digest":"sha256:e59161c0cc0398dcab43fa5764a9dd2bd2f671aba4ad99e5ed25cb19cbe44293","observation_id":"9e9b3f9d-0f8a-47cf-ae78-e3f053369026","resolution":{"observed_at":"2026-06-29T13:23:28.109593Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2404.19287/citation-record","integrity":"/paper/2404.19287/integrity","json":"/paper/2404.19287/citation-record.json","paper":"/paper/2404.19287"},"outbound":[],"paper":{"arxiv_id":"2404.19287","last_updated":"2024-11-12T10:48:21Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T18:07:27.432252Z","submitted_at":"2024-04-30T06:34:21Z","title":"Revisiting the Adversarial Robustness of Vision Language Models: a Multimodal Perspective"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 14 inbound Pith citation observations for arXiv:2404.19287."}