{"as_of":"2026-08-07T08:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e6218cbbfb13648f7472a09e6dcc659915d38f09789c98459b3fbdb226f9e316","coverage":[{"denominator":48,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":48,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:16:31.806132Z","state":"measured"},{"denominator":48,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":48,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.08982/citation-record","integrity":"/paper/2507.08982/integrity","json":"/paper/2507.08982/citation-record.json","paper":"/paper/2507.08982"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T18:16:28.313408Z","title":"Gpt-4 technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08982","last_updated":"2025-07-11T19:34:01Z","snapshot_observed_at":"2026-08-06T18:05:15.934788Z","submitted_at":"2025-07-11T19:34:01Z","title":"VIP: Visual Information Protection through Adversarial Attacks on Vision-Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T18:16:28.313408Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.08982"},"observation_digest":"sha256:b3d707ed1dbb8409b0feb5cdcc020df17f6c99f0476a7f5ab0c0825e04633712","observation_id":"27319ba2-0a68-4d01-ba80-77cd213fd58e","resolution":{"observed_at":"2026-08-06T18:16:28.313408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-06T18:16:28.361118Z","title":"Gemini: a family of highly capable multimodal models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08982","last_updated":"2025-07-11T19:34:01Z","snapshot_observed_at":"2026-08-06T18:05:15.934788Z","submitted_at":"2025-07-11T19:34:01Z","title":"VIP: Visual Information Protection through Adversarial Attacks on Vision-Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T18:16:28.361118Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2507.08982"},"observation_digest":"sha256:e130c52a76832288cf23c4fba775b506fc36a17049443d141263525cf9924ff5","observation_id":"6319c400-7eb6-45af-b32d-67e090d954e1","resolution":{"observed_at":"2026-08-06T18:16:28.361118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07073","last_updated":"2024-10-10T17:59:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-09T17:16:22Z","title":"Pixtral 12B","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07073","snapshot_observed_at":"2026-08-06T18:16:28.456642Z","title":"Pixtral 12b,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08982","last_updated":"2025-07-11T19:34:01Z","snapshot_observed_at":"2026-08-06T18:05:15.934788Z","submitted_at":"2025-07-11T19:34:01Z","title":"VIP: Visual Information Protection through Adversarial Attacks on Vision-Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T18:16:28.456642Z"},"links":{"cited_paper":"/paper/2410.07073","citing_paper":"/paper/2507.08982"},"observation_digest":"sha256:2cdaa6e13154b9444e49ed42d1e6fd5ffac30b040a2adb60a7b96a3cfa215299","observation_id":"96a6b29a-9892-4e5a-b7d8-4c5396a76d2e","resolution":{"observed_at":"2026-08-06T18:16:28.456642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-07-06T19:29:46.997580Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-08-06T18:16:28.576320Z","title":"Aria: An open multimodal native mixture-of-experts model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08982","last_updated":"2025-07-11T19:34:01Z","snapshot_observed_at":"2026-08-06T18:05:15.934788Z","submitted_at":"2025-07-11T19:34:01Z","title":"VIP: Visual Information Protection through Adversarial Attacks on Vision-Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T18:16:28.576320Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2507.08982"},"observation_digest":"sha256:7a6891f6685c12bf83684b871ec604cd9ab6d863075845d154232a7e140b3c24","observation_id":"a3e25417-5864-4888-a920-35b88ceee824","resolution":{"observed_at":"2026-08-06T18:16:28.576320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-06T18:16:28.671502Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08982","last_updated":"2025-07-11T19:34:01Z","snapshot_observed_at":"2026-08-06T18:05:15.934788Z","submitted_at":"2025-07-11T19:34:01Z","title":"VIP: Visual Information Protection through Adversarial Attacks on Vision-Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T18:16:28.671502Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2507.08982"},"observation_digest":"sha256:17149064d8cbd687cabeb25ec7831048c05392c957ece5aa03ccbd0a2d419d4f","observation_id":"dc2bae78-e581-48f4-8cdb-a3a4d930f6d7","resolution":{"observed_at":"2026-08-06T18:16:28.671502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:16:35.039823Z","title":"Reconstructing training data from diverse ml models by ensemble inversion,","venue":null,"work_id":"4ed323ad-40cb-4f27-b608-0e8e56c5dcbd","year":2022},"citing_paper":{"arxiv_id":"2507.08982","last_updated":"2025-07-11T19:34:01Z","snapshot_observed_at":"2026-08-06T18:05:15.934788Z","submitted_at":"2025-07-11T19:34:01Z","title":"VIP: Visual Information Protection through Adversarial Attacks on Vision-Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T18:16:28.742385Z"},"links":{"citing_paper":"/paper/2507.08982"},"observation_digest":"sha256:e6ea6ed46d2e0cc23aaa529e8a821e49778dfb5355bd5b9bdbc39702685a3174","observation_id":"55971cd9-f361-4ae7-84ec-6d667772de97","resolution":{"observed_at":"2026-08-06T18:16:35.106727Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:16:34.905574Z","title":"Effective prompt extraction from language models,","venue":null,"work_id":"23e4825d-3783-458d-9fe2-b3255b37a320","year":2024},"citing_paper":{"arxiv_id":"2507.08982","last_updated":"2025-07-11T19:34:01Z","snapshot_observed_at":"2026-08-06T18:05:15.934788Z","submitted_at":"2025-07-11T19:34:01Z","title":"VIP: Visual Information Protection through Adversarial Attacks on Vision-Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T18:16:28.815014Z"},"links":{"citing_paper":"/paper/2507.08982"},"observation_digest":"sha256:d54904dc5dd6e15a337be0e2b0ecbf8f655c056aaf2235ed37dd07b8bfb4b403","observation_id":"f61a5fc9-425c-45cc-8aee-853770267d31","resolution":{"observed_at":"2026-08-06T18:16:34.942391Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:16:28.886540Z","title":"Extracting training data from large language models,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.08982","last_updated":"2025-07-11T19:34:01Z","snapshot_observed_at":"2026-08-06T18:05:15.934788Z","submitted_at":"2025-07-11T19:34:01Z","title":"VIP: Visual Information Protection through Adversarial Attacks on Vision-Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T18:16:28.886540Z"},"links":{"citing_paper":"/paper/2507.08982"},"observation_digest":"sha256:6ceab159b52cf366f3c245c4b4845953d95e143cba37e8ae483709af3fe98c81","observation_id":"c7f0254b-699d-476d-ae2f-871e22513447","resolution":{"observed_at":"2026-08-06T18:16:28.886540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:16:34.662737Z","title":"Are aligned neural networks adversarially aligned?","venue":null,"work_id":"3f2cb27c-74af-46be-a653-48567f55ba33","year":2024},"citing_paper":{"arxiv_id":"2507.08982","last_updated":"2025-07-11T19:34:01Z","snapshot_observed_at":"2026-08-06T18:05:15.934788Z","submitted_at":"2025-07-11T19:34:01Z","title":"VIP: Visual Information Protection through Adversarial Attacks on Vision-Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T18:16:28.960674Z"},"links":{"citing_paper":"/paper/2507.08982"},"observation_digest":"sha256:6586f4756c287c4bfaf6cd39c8a00fd0a7d2593c4446480524e91e24c83745c9","observation_id":"77670c13-7295-4ad5-87db-706dc8d232c5","resolution":{"observed_at":"2026-08-06T18:16:34.824986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:16:34.498781Z","title":"Jailbreak in pieces: Compositional adversarial attacks on multi-modal language models,","venue":null,"work_id":"ad1f6401-83d0-4a99-a6c6-f77bd4447a89","year":2024},"citing_paper":{"arxiv_id":"2507.08982","last_updated":"2025-07-11T19:34:01Z","snapshot_observed_at":"2026-08-06T18:05:15.934788Z","submitted_at":"2025-07-11T19:34:01Z","title":"VIP: Visual Information Protection through Adversarial Attacks on Vision-Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T18:16:29.017741Z"},"links":{"citing_paper":"/paper/2507.08982"},"observation_digest":"sha256:f92a55c3acc546217c44613a1e9bf66aaf40d2339b67b720e230ad56339230d1","observation_id":"1f7b0e40-1b50-437e-8cd2-211aa344c194","resolution":{"observed_at":"2026-08-06T18:16:34.588236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:16:34.360557Z","title":"On the robustness of large multimodal models against image adversarial attacks,","venue":null,"work_id":"a1252955-f89a-4fcd-a535-98c6008da6a4","year":2024},"citing_paper":{"arxiv_id":"2507.08982","last_updated":"2025-07-11T19:34:01Z","snapshot_observed_at":"2026-08-06T18:05:15.934788Z","submitted_at":"2025-07-11T19:34:01Z","title":"VIP: Visual Information Protection through Adversarial Attacks on Vision-Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T18:16:29.090003Z"},"links":{"citing_paper":"/paper/2507.08982"},"observation_digest":"sha256:45aeb066bebb9fe78fadbc17a79e8c6ed328f4c67bc5ebc70a6bdf84c93b8027","observation_id":"a9517a8d-3314-4080-958f-1a3a7effefec","resolution":{"observed_at":"2026-08-06T18:16:34.438093Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:16:34.182718Z","title":"An image is worth 1000 lies: Transferability of adversarial images across prompts on vision-language models,","venue":null,"work_id":"21e96e92-fcca-4d69-87aa-a9f204ae4cd7","year":2024},"citing_paper":{"arxiv_id":"2507.08982","last_updated":"2025-07-11T19:34:01Z","snapshot_observed_at":"2026-08-06T18:05:15.934788Z","submitted_at":"2025-07-11T19:34:01Z","title":"VIP: Visual Information Protection through Adversarial Attacks on Vision-Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T18:16:29.156011Z"},"links":{"citing_paper":"/paper/2507.08982"},"observation_digest":"sha256:132fe098b9b9e251e9339d84004ab23c58699b37a3a574d68fdb019faf17969b","observation_id":"50fb1c4f-19d8-4e2e-9546-f2a1fe5d90f3","resolution":{"observed_at":"2026-08-06T18:16:34.287767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12693","last_updated":"2024-03-19T12:51:39Z","snapshot_observed_at":"2026-08-06T11:14:06.049414Z","submitted_at":"2024-03-19T12:51:39Z","title":"As Firm As Their Foundations: Can open-sourced foundation models be used to create adversarial examples for downstream tasks?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12693","snapshot_observed_at":"2026-08-06T18:16:29.252024Z","title":"As firm as their foundations: Can open-sourced foundation models be used to create adversarial examples for downstream tasks?","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08982","last_updated":"2025-07-11T19:34:01Z","snapshot_observed_at":"2026-08-06T18:05:15.934788Z","submitted_at":"2025-07-11T19:34:01Z","title":"VIP: Visual Information Protection through Adversarial Attacks on Vision-Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T18:16:29.252024Z"},"links":{"cited_paper":"/paper/2403.12693","citing_paper":"/paper/2507.08982"},"observation_digest":"sha256:f69b30f8d461548a7bedbf4e5b87e66f40819671be98466a3604796492d3da9a","observation_id":"462880f4-3997-471c-bb04-1ce23bc6d017","resolution":{"observed_at":"2026-08-06T18:16:29.252024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:16:33.961109Z","title":"Inducing high energy-latency of large vision-language models with verbose images,","venue":null,"work_id":"fc57c420-6fcb-4777-a20e-4448887ec1cf","year":2024},"citing_paper":{"arxiv_id":"2507.08982","last_updated":"2025-07-11T19:34:01Z","snapshot_observed_at":"2026-08-06T18:05:15.934788Z","submitted_at":"2025-07-11T19:34:01Z","title":"VIP: Visual Information Protection through Adversarial Attacks on Vision-Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T18:16:29.301347Z"},"links":{"citing_paper":"/paper/2507.08982"},"observation_digest":"sha256:f119d923e8d2c14a9dbd2f906e473802f268cd4a26922af3136c8ede36e2e255","observation_id":"5bb7b1a7-1c01-4795-be3e-b3138c13b568","resolution":{"observed_at":"2026-08-06T18:16:34.028772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:16:33.826220Z","title":"Tafim: Targeted adversarial attacks against facial image manipulations,","venue":null,"work_id":"260ce1b1-3865-4202-9abf-6875454c2985","year":2022},"citing_paper":{"arxiv_id":"2507.08982","last_updated":"2025-07-11T19:34:01Z","snapshot_observed_at":"2026-08-06T18:05:15.934788Z","submitted_at":"2025-07-11T19:34:01Z","title":"VIP: Visual Information Protection through Adversarial Attacks on Vision-Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T18:16:29.387915Z"},"links":{"citing_paper":"/paper/2507.08982"},"observation_digest":"sha256:e27383b14d9ce0d28024f549e540abe6c9a4531e6a23ccf7de0c02c19f4373a4","observation_id":"072575c3-4d01-4208-b890-995a4f8d6de2","resolution":{"observed_at":"2026-08-06T18:16:33.865713Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1145/3614098","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:16:31.900001Z","title":"Adversary for social good: Leveraging adversarial attacks to protect personal attribute privacy,","venue":null,"work_id":"0502b594-662f-4838-ba5e-bd711d6178db","year":2023},"citing_paper":{"arxiv_id":"2507.08982","last_updated":"2025-07-11T19:34:01Z","snapshot_observed_at":"2026-08-06T18:05:15.934788Z","submitted_at":"2025-07-11T19:34:01Z","title":"VIP: Visual Information Protection through Adversarial Attacks on Vision-Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T18:16:29.464482Z"},"links":{"citing_paper":"/paper/2507.08982"},"observation_digest":"sha256:0b158021418da28254ccc00ab438ece79d7e5c8d27416756e4e166b7def754e3","observation_id":"f3aeb4aa-6c06-43eb-b6cf-35e6bb2a8e0b","resolution":{"observed_at":"2026-08-06T18:16:31.958086Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.04387","last_updated":"2023-06-08T13:44:24Z","snapshot_observed_at":"2026-07-06T15:39:41.431581Z","submitted_at":"2023-06-07T12:35:37Z","title":"M$^3$IT: A Large-Scale Dataset towards Multi-Modal Multilingual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.04387","snapshot_observed_at":"2026-08-06T18:16:29.523026Z","title":"m3it: A large-scale dataset towards multi-modal multilingual instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08982","last_updated":"2025-07-11T19:34:01Z","snapshot_observed_at":"2026-08-06T18:05:15.934788Z","submitted_at":"2025-07-11T19:34:01Z","title":"VIP: Visual Information Protection through Adversarial Attacks on Vision-Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T18:16:29.523026Z"},"links":{"cited_paper":"/paper/2306.04387","citing_paper":"/paper/2507.08982"},"observation_digest":"sha256:06d6c7974daad90b76b16a81a2303378c26e55d2a37dadcf6490fdb226e35844","observation_id":"c26c49ee-07bd-446b-9729-c1ceebb6150b","resolution":{"observed_at":"2026-08-06T18:16:29.523026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06500","last_updated":"2023-06-15T08:00:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-11T00:38:10Z","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06500","snapshot_observed_at":"2026-08-06T18:16:29.579029Z","title":"Instructblip: Towards general-purpose vision-language models with instruction tuning. arxiv 2023,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08982","last_updated":"2025-07-11T19:34:01Z","snapshot_observed_at":"2026-08-06T18:05:15.934788Z","submitted_at":"2025-07-11T19:34:01Z","title":"VIP: Visual Information Protection through Adversarial Attacks on Vision-Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T18:16:29.579029Z"},"links":{"cited_paper":"/paper/2305.06500","citing_paper":"/paper/2507.08982"},"observation_digest":"sha256:604cde8d36229b1dd8b36732cbc8960460ce6ee5ab43015edfd41d2d705e4d42","observation_id":"d7cb831e-7465-437f-b74a-76bbaf1944ff","resolution":{"observed_at":"2026-08-06T18:16:29.579029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:16:29.654419Z","title":"Blip-2: Bootstrapping language- image pre-training with frozen image encoders and large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08982","last_updated":"2025-07-11T19:34:01Z","snapshot_observed_at":"2026-08-06T18:05:15.934788Z","submitted_at":"2025-07-11T19:34:01Z","title":"VIP: Visual Information Protection through Adversarial Attacks on Vision-Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T18:16:29.654419Z"},"links":{"citing_paper":"/paper/2507.08982"},"observation_digest":"sha256:b929cb885647f89c542ade818e822432ebdcd993d1abf7e88038d62b7837ee22","observation_id":"c299d28a-fd1a-4a15-a0af-c4492c474355","resolution":{"observed_at":"2026-08-06T18:16:29.654419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-06T18:16:29.743840Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08982","last_updated":"2025-07-11T19:34:01Z","snapshot_observed_at":"2026-08-06T18:05:15.934788Z","submitted_at":"2025-07-11T19:34:01Z","title":"VIP: Visual Information Protection through Adversarial Attacks on Vision-Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T18:16:29.743840Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2507.08982"},"observation_digest":"sha256:a0db8d32a9ef1a89ada54fdb085be1e3113e46db070c630a05413a1b42a8ec9f","observation_id":"4667c84a-d20b-4ce5-9d97-70a7715ffa1d","resolution":{"observed_at":"2026-08-06T18:16:29.743840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:16:29.803032Z","title":"Language models are unsupervised multitask learners,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.08982","last_updated":"2025-07-11T19:34:01Z","snapshot_observed_at":"2026-08-06T18:05:15.934788Z","submitted_at":"2025-07-11T19:34:01Z","title":"VIP: Visual Information Protection through Adversarial Attacks on Vision-Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T18:16:29.803032Z"},"links":{"citing_paper":"/paper/2507.08982"},"observation_digest":"sha256:3287737a1b7b423f733cf0939651961e74d0e831201c42181c077ed1d67ea2e2","observation_id":"b5f28faf-7cbe-46be-9b07-d17b2140f5af","resolution":{"observed_at":"2026-08-06T18:16:29.803032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:16:29.899551Z","title":"Vicuna: An open-source chatbot impressing gpt-4 with 90%* chatgpt quality,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08982","last_updated":"2025-07-11T19:34:01Z","snapshot_observed_at":"2026-08-06T18:05:15.934788Z","submitted_at":"2025-07-11T19:34:01Z","title":"VIP: Visual Information Protection through Adversarial Attacks on Vision-Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T18:16:29.899551Z"},"links":{"citing_paper":"/paper/2507.08982"},"observation_digest":"sha256:65f94aa77ba9f135aeb00c138d673da20c1a4dc5ad70743f984abc8bb3726976","observation_id":"614d5c50-ce62-4adb-97b8-bee3e6172aee","resolution":{"observed_at":"2026-08-06T18:16:29.899551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:16:33.568978Z","title":"Eva: Exploring the limits of masked visual representation learning at scale,","venue":null,"work_id":"8a6dcf3b-a259-42e8-9d9a-1273aeda366d","year":2023},"citing_paper":{"arxiv_id":"2507.08982","last_updated":"2025-07-11T19:34:01Z","snapshot_observed_at":"2026-08-06T18:05:15.934788Z","submitted_at":"2025-07-11T19:34:01Z","title":"VIP: Visual Information Protection through Adversarial Attacks on Vision-Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T18:16:29.964559Z"},"links":{"citing_paper":"/paper/2507.08982"},"observation_digest":"sha256:7ead1f9ebe7cd5914b21b98f9ce46cf30996b74348fa8aaff0273b8817e96cd4","observation_id":"6a9d4257-814e-493d-b8d0-0f53a8cf49d2","resolution":{"observed_at":"2026-08-06T18:16:33.746434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:16:30.031158Z","title":"Scaling instruction-finetuned language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08982","last_updated":"2025-07-11T19:34:01Z","snapshot_observed_at":"2026-08-06T18:05:15.934788Z","submitted_at":"2025-07-11T19:34:01Z","title":"VIP: Visual Information Protection through Adversarial Attacks on Vision-Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T18:16:30.031158Z"},"links":{"citing_paper":"/paper/2507.08982"},"observation_digest":"sha256:4ee9f906cd585f2bc89a84526923af0f6020eb0b474f32f7c810072cc9e9162c","observation_id":"76ffd6b0-6ace-4319-ac56-16600f5ec538","resolution":{"observed_at":"2026-08-06T18:16:30.031158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-06T18:16:30.081693Z","title":"Deepseek-v3 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08982","last_updated":"2025-07-11T19:34:01Z","snapshot_observed_at":"2026-08-06T18:05:15.934788Z","submitted_at":"2025-07-11T19:34:01Z","title":"VIP: Visual Information Protection through Adversarial Attacks on Vision-Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T18:16:30.081693Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2507.08982"},"observation_digest":"sha256:e11026f15f3546de965c84fc95ab42740ada6d8480a4d5f937a5dfa5afe2b8c9","observation_id":"52696ab0-b564-4103-90bb-5906b1637637","resolution":{"observed_at":"2026-08-06T18:16:30.081693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T18:16:30.177401Z","title":"The llama 3 herd of models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08982","last_updated":"2025-07-11T19:34:01Z","snapshot_observed_at":"2026-08-06T18:05:15.934788Z","submitted_at":"2025-07-11T19:34:01Z","title":"VIP: Visual Information Protection through Adversarial Attacks on Vision-Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T18:16:30.177401Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2507.08982"},"observation_digest":"sha256:eb5bdca32d287c4bba90d5d1f87ea9782ed79b2ae0732ec070cf5ca620509573","observation_id":"b8170ba0-2e2b-4ad5-92b7-e7c490d77d28","resolution":{"observed_at":"2026-08-06T18:16:30.177401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-06T18:16:30.236877Z","title":"Molmo and pixmo: Open weights and open data for state-of-the-art multimodal models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08982","last_updated":"2025-07-11T19:34:01Z","snapshot_observed_at":"2026-08-06T18:05:15.934788Z","submitted_at":"2025-07-11T19:34:01Z","title":"VIP: Visual Information Protection through Adversarial Attacks on Vision-Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T18:16:30.236877Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2507.08982"},"observation_digest":"sha256:b7f8a6b5d5c17cb1f81da89e8420c3e61811973229f25d1f4fa2f007beaf25c5","observation_id":"a9d18ef2-6c16-4bb9-a918-b09ee3360529","resolution":{"observed_at":"2026-08-06T18:16:30.236877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11402","last_updated":"2024-10-22T23:13:34Z","snapshot_observed_at":"2026-07-06T19:17:02.745056Z","submitted_at":"2024-09-17T17:59:06Z","title":"NVLM: Open Frontier-Class Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.11402","snapshot_observed_at":"2026-08-06T18:16:30.308560Z","title":"Nvlm: Open frontier-class multimodal llms,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08982","last_updated":"2025-07-11T19:34:01Z","snapshot_observed_at":"2026-08-06T18:05:15.934788Z","submitted_at":"2025-07-11T19:34:01Z","title":"VIP: Visual Information Protection through Adversarial Attacks on Vision-Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T18:16:30.308560Z"},"links":{"cited_paper":"/paper/2409.11402","citing_paper":"/paper/2507.08982"},"observation_digest":"sha256:a80a3a4bc0563034c9d3b025164b88af6b50142b56481a2f726ad04ff3e453d2","observation_id":"48b84086-6767-4331-8b06-578b6a32aa09","resolution":{"observed_at":"2026-08-06T18:16:30.308560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.20566","last_updated":"2024-09-30T17:59:34Z","snapshot_observed_at":"2026-08-05T16:49:53.377557Z","submitted_at":"2024-09-30T17:59:34Z","title":"MM1.5: Methods, Analysis & Insights from Multimodal LLM Fine-tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.20566","snapshot_observed_at":"2026-08-06T18:16:30.360814Z","title":"Mm1. 5: Methods, analysis & insights from multimodal llm fine-tuning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08982","last_updated":"2025-07-11T19:34:01Z","snapshot_observed_at":"2026-08-06T18:05:15.934788Z","submitted_at":"2025-07-11T19:34:01Z","title":"VIP: Visual Information Protection through Adversarial Attacks on Vision-Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T18:16:30.360814Z"},"links":{"cited_paper":"/paper/2409.20566","citing_paper":"/paper/2507.08982"},"observation_digest":"sha256:dc73c6d34d796fe5e7ce9d977fecd954caa478e9940e69ca2c3c9587be1a754e","observation_id":"b61e8ae3-9bd5-4b4e-9b41-365bd10a469a","resolution":{"observed_at":"2026-08-06T18:16:30.360814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-06T18:16:30.444420Z","title":"Emu3: Next-token prediction is all you need,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08982","last_updated":"2025-07-11T19:34:01Z","snapshot_observed_at":"2026-08-06T18:05:15.934788Z","submitted_at":"2025-07-11T19:34:01Z","title":"VIP: Visual Information Protection through Adversarial Attacks on Vision-Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T18:16:30.444420Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2507.08982"},"observation_digest":"sha256:ccd9a560b96aad7fbb0a327d7ad3ce4821a2333d1928fad3ab56a9a773e705d7","observation_id":"f3cb9009-7e9f-4463-b75e-f9a13a447a0f","resolution":{"observed_at":"2026-08-06T18:16:30.444420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6199","last_updated":"2014-02-19T16:33:14Z","snapshot_observed_at":"2026-07-06T03:31:33.797310Z","submitted_at":"2013-12-21T03:36:08Z","title":"Intriguing properties of neural networks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6199","snapshot_observed_at":"2026-08-06T18:16:30.491722Z","title":"Intriguing properties of neural networks,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2507.08982","last_updated":"2025-07-11T19:34:01Z","snapshot_observed_at":"2026-08-06T18:05:15.934788Z","submitted_at":"2025-07-11T19:34:01Z","title":"VIP: Visual Information Protection through Adversarial Attacks on Vision-Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T18:16:30.491722Z"},"links":{"cited_paper":"/paper/1312.6199","citing_paper":"/paper/2507.08982"},"observation_digest":"sha256:383c5571406688f5c83bcdf57415b6949827b8fa1e2c98f4e833c68ab0a757cd","observation_id":"a64832e3-2ba0-4181-b03a-1ac47b88a05f","resolution":{"observed_at":"2026-08-06T18:16:30.491722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:16:33.355691Z","title":"Deep neural networks are easily fooled: High confidence predictions for unrecognizable images,","venue":null,"work_id":"022c537c-c6f7-4438-9115-bc8eed1b4d52","year":2015},"citing_paper":{"arxiv_id":"2507.08982","last_updated":"2025-07-11T19:34:01Z","snapshot_observed_at":"2026-08-06T18:05:15.934788Z","submitted_at":"2025-07-11T19:34:01Z","title":"VIP: Visual Information Protection through Adversarial Attacks on Vision-Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T18:16:30.584496Z"},"links":{"citing_paper":"/paper/2507.08982"},"observation_digest":"sha256:d0f191f630f0b8833c38c1ed6a2f86469f31290953d840ebc73fbcc295281a48","observation_id":"0b8b206d-695f-40c2-aef4-f1dd83b5538e","resolution":{"observed_at":"2026-08-06T18:16:33.436473Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6572","last_updated":"2015-03-20T20:19:16Z","snapshot_observed_at":"2026-07-06T04:04:16.777653Z","submitted_at":"2014-12-20T01:17:12Z","title":"Explaining and Harnessing Adversarial Examples","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6572","snapshot_observed_at":"2026-08-06T18:16:30.690815Z","title":"Explaining and harnessing adversarial examples,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.08982","last_updated":"2025-07-11T19:34:01Z","snapshot_observed_at":"2026-08-06T18:05:15.934788Z","submitted_at":"2025-07-11T19:34:01Z","title":"VIP: Visual Information Protection through Adversarial Attacks on Vision-Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T18:16:30.690815Z"},"links":{"cited_paper":"/paper/1412.6572","citing_paper":"/paper/2507.08982"},"observation_digest":"sha256:7a8a988c03c5560db6952fcafc3d5de6493577deb13cb7c478cdf81b6d3c3aff","observation_id":"50e77a7e-42ac-4e05-a533-121fb7ca451c","resolution":{"observed_at":"2026-08-06T18:16:30.690815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:16:30.745723Z","title":"A limited memory algo- rithm for bound constrained optimization,","venue":null,"work_id":null,"year":1995},"citing_paper":{"arxiv_id":"2507.08982","last_updated":"2025-07-11T19:34:01Z","snapshot_observed_at":"2026-08-06T18:05:15.934788Z","submitted_at":"2025-07-11T19:34:01Z","title":"VIP: Visual Information Protection through Adversarial Attacks on Vision-Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T18:16:30.745723Z"},"links":{"citing_paper":"/paper/2507.08982"},"observation_digest":"sha256:eaa52b58a1c8e170d7ace7f7ca01eaa760242d36e64e209c96920346017992a9","observation_id":"f790c834-5587-4aca-958b-ef57e24a3804","resolution":{"observed_at":"2026-08-06T18:16:30.745723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:16:30.822007Z","title":"Towards evaluating the robustness of neural networks,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.08982","last_updated":"2025-07-11T19:34:01Z","snapshot_observed_at":"2026-08-06T18:05:15.934788Z","submitted_at":"2025-07-11T19:34:01Z","title":"VIP: Visual Information Protection through Adversarial Attacks on Vision-Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T18:16:30.822007Z"},"links":{"citing_paper":"/paper/2507.08982"},"observation_digest":"sha256:3b4061ba4cbd861f880cda6e8ae10d0ec876eacdf2e09b74a45b5969c91afda0","observation_id":"a4db6ec5-e216-4378-8587-e7c7e974a15e","resolution":{"observed_at":"2026-08-06T18:16:30.822007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:16:33.201149Z","title":"Zoo: Zeroth order optimization based black-box attacks to deep neural networks without training substitute models,","venue":null,"work_id":"f66bbce9-3709-487f-9e5b-addff0559819","year":2017},"citing_paper":{"arxiv_id":"2507.08982","last_updated":"2025-07-11T19:34:01Z","snapshot_observed_at":"2026-08-06T18:05:15.934788Z","submitted_at":"2025-07-11T19:34:01Z","title":"VIP: Visual Information Protection through Adversarial Attacks on Vision-Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T18:16:30.886374Z"},"links":{"citing_paper":"/paper/2507.08982"},"observation_digest":"sha256:100a14cc3bf7a360793497df5535b8b8472ea80e3766a6bb6fe76e4416872f35","observation_id":"0692a410-89e6-4a48-ae58-ce70ce9e6c1f","resolution":{"observed_at":"2026-08-06T18:16:33.266545Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:16:33.035683Z","title":"Towards deep learning models resistant to adversarial attacks,","venue":null,"work_id":"7ba14f7e-7a4e-46c6-a43c-e92e97d45cf5","year":2018},"citing_paper":{"arxiv_id":"2507.08982","last_updated":"2025-07-11T19:34:01Z","snapshot_observed_at":"2026-08-06T18:05:15.934788Z","submitted_at":"2025-07-11T19:34:01Z","title":"VIP: Visual Information Protection through Adversarial Attacks on Vision-Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T18:16:30.979777Z"},"links":{"citing_paper":"/paper/2507.08982"},"observation_digest":"sha256:2de94c9134214861ebaa0d87f373785c87110befb6464c5b8f5f9c716d88900e","observation_id":"14078f29-cd0b-4a19-9ff0-77c86202e993","resolution":{"observed_at":"2026-08-06T18:16:33.091742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:16:32.946787Z","title":"Reliable evaluation of adversarial robustness with an ensemble of diverse parameter-free attacks,","venue":null,"work_id":"93ae868b-1e49-421d-ad43-53147146beec","year":2020},"citing_paper":{"arxiv_id":"2507.08982","last_updated":"2025-07-11T19:34:01Z","snapshot_observed_at":"2026-08-06T18:05:15.934788Z","submitted_at":"2025-07-11T19:34:01Z","title":"VIP: Visual Information Protection through Adversarial Attacks on Vision-Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T18:16:31.059396Z"},"links":{"citing_paper":"/paper/2507.08982"},"observation_digest":"sha256:c8ed412e16d5f4bd93927677d99cf6ce952d69537029fc8e56aae51d49235b72","observation_id":"84348b1e-8475-4e9c-ba86-3ddb08e1b3cf","resolution":{"observed_at":"2026-08-06T18:16:33.016948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:16:32.775879Z","title":"On evaluating adversarial robustness of large vision-language models,","venue":null,"work_id":"fc2298e6-e734-4f58-989a-0af493fcb4c3","year":2024},"citing_paper":{"arxiv_id":"2507.08982","last_updated":"2025-07-11T19:34:01Z","snapshot_observed_at":"2026-08-06T18:05:15.934788Z","submitted_at":"2025-07-11T19:34:01Z","title":"VIP: Visual Information Protection through Adversarial Attacks on Vision-Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T18:16:31.164153Z"},"links":{"citing_paper":"/paper/2507.08982"},"observation_digest":"sha256:1305c2206a70a4adcbcd92ff75cb9dad696c8dd5da884eaa243e5951d290733b","observation_id":"a212794e-1309-4fca-88e9-9af6303c0159","resolution":{"observed_at":"2026-08-06T18:16:32.827988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:16:32.546583Z","title":"Attacking attention of foundation models disrupts downstream tasks,","venue":null,"work_id":"02cc8867-02ab-451e-bb84-cab9f87cda5e","year":2025},"citing_paper":{"arxiv_id":"2507.08982","last_updated":"2025-07-11T19:34:01Z","snapshot_observed_at":"2026-08-06T18:05:15.934788Z","submitted_at":"2025-07-11T19:34:01Z","title":"VIP: Visual Information Protection through Adversarial Attacks on Vision-Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T18:16:31.216071Z"},"links":{"citing_paper":"/paper/2507.08982"},"observation_digest":"sha256:5bb626a81022247cdedb4562a90143f00155ebc9fe105c19383afc80004a2671","observation_id":"3db2ed7e-2742-4026-8957-8f8ee761eb7e","resolution":{"observed_at":"2026-08-06T18:16:32.629518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11038","last_updated":"2025-04-15T10:00:01Z","snapshot_observed_at":"2026-07-06T21:09:40.867591Z","submitted_at":"2025-04-15T10:00:01Z","title":"QAVA: Query-Agnostic Visual Attack to Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2504.11038","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.11038","snapshot_observed_at":"2026-08-06T18:16:32.052654Z","title":"QAVA: Query-Agnostic Visual Attack to Large Vision-Language Models","venue":"cs.CV","work_id":"44ecc118-90f3-4590-acaf-209964fb9139","year":2025},"citing_paper":{"arxiv_id":"2507.08982","last_updated":"2025-07-11T19:34:01Z","snapshot_observed_at":"2026-08-06T18:05:15.934788Z","submitted_at":"2025-07-11T19:34:01Z","title":"VIP: Visual Information Protection through Adversarial Attacks on Vision-Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T18:16:31.266454Z"},"links":{"cited_paper":"/paper/2504.11038","citing_paper":"/paper/2507.08982"},"observation_digest":"sha256:c75ef06415eba04898e6a9f543bc3b8a52c322111d38afed2e5432a1296f94fa","observation_id":"855a97b9-aaa8-4061-894a-dcb1915dafd6","resolution":{"observed_at":"2026-08-06T18:16:32.129974Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:16:31.361308Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.08982","last_updated":"2025-07-11T19:34:01Z","snapshot_observed_at":"2026-08-06T18:05:15.934788Z","submitted_at":"2025-07-11T19:34:01Z","title":"VIP: Visual Information Protection through Adversarial Attacks on Vision-Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T18:16:31.361308Z"},"links":{"citing_paper":"/paper/2507.08982"},"observation_digest":"sha256:8bb8c152e86c592c67adb04ced7b6638bfee99f94b2358f25feec711f3f0a50b","observation_id":"1f56de79-03f2-485f-8b22-1c4a4159ae84","resolution":{"observed_at":"2026-08-06T18:16:31.361308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:16:31.419667Z","title":"Imagenet large scale visual recognition challenge,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.08982","last_updated":"2025-07-11T19:34:01Z","snapshot_observed_at":"2026-08-06T18:05:15.934788Z","submitted_at":"2025-07-11T19:34:01Z","title":"VIP: Visual Information Protection through Adversarial Attacks on Vision-Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T18:16:31.419667Z"},"links":{"citing_paper":"/paper/2507.08982"},"observation_digest":"sha256:59c7de6e71066bd09d96f5ad38105de5bedfd377dac4cfcc15458d6eb548a770","observation_id":"421f392e-0dab-4877-91ac-5038169a3b41","resolution":{"observed_at":"2026-08-06T18:16:31.419667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.10084","last_updated":"2019-08-27T08:50:17Z","snapshot_observed_at":"2026-07-06T08:17:05.681370Z","submitted_at":"2019-08-27T08:50:17Z","title":"Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.10084","snapshot_observed_at":"2026-08-06T18:16:31.481468Z","title":"Sentence-bert: Sentence embeddings using siamese bert- networks,","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2507.08982","last_updated":"2025-07-11T19:34:01Z","snapshot_observed_at":"2026-08-06T18:05:15.934788Z","submitted_at":"2025-07-11T19:34:01Z","title":"VIP: Visual Information Protection through Adversarial Attacks on Vision-Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T18:16:31.481468Z"},"links":{"cited_paper":"/paper/1908.10084","citing_paper":"/paper/2507.08982"},"observation_digest":"sha256:40e8c028c7a44ffae51b5ce1059c5f2fd3cadb4df30eb3406d3ef12b73214e45","observation_id":"cd91ff20-91cc-438f-8ee9-99a8b772a70c","resolution":{"observed_at":"2026-08-06T18:16:31.481468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.11175","last_updated":"2018-04-12T17:03:44Z","snapshot_observed_at":"2026-07-06T06:30:55.970076Z","submitted_at":"2018-03-29T17:43:03Z","title":"Universal Sentence Encoder","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.11175","snapshot_observed_at":"2026-08-06T18:16:31.547114Z","title":"Universal sentence encoder,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.08982","last_updated":"2025-07-11T19:34:01Z","snapshot_observed_at":"2026-08-06T18:05:15.934788Z","submitted_at":"2025-07-11T19:34:01Z","title":"VIP: Visual Information Protection through Adversarial Attacks on Vision-Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T18:16:31.547114Z"},"links":{"cited_paper":"/paper/1803.11175","citing_paper":"/paper/2507.08982"},"observation_digest":"sha256:c157813c442a0699b86b905ec1635fd960ca16d379c4f02a05b45d8d66c57bb1","observation_id":"523e00f6-5b53-4253-85e5-06156e3178ca","resolution":{"observed_at":"2026-08-06T18:16:31.547114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:16:32.396356Z","title":"Mpnet: Masked and permuted pre-training for language understanding,","venue":null,"work_id":"a56cf21f-720b-4c50-a1aa-6b5353b7a923","year":2020},"citing_paper":{"arxiv_id":"2507.08982","last_updated":"2025-07-11T19:34:01Z","snapshot_observed_at":"2026-08-06T18:05:15.934788Z","submitted_at":"2025-07-11T19:34:01Z","title":"VIP: Visual Information Protection through Adversarial Attacks on Vision-Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T18:16:31.622076Z"},"links":{"citing_paper":"/paper/2507.08982"},"observation_digest":"sha256:8640435b0181386d1fa53a03b8460edc6144762c36c9104309572770835061d2","observation_id":"fce1d07d-6175-43a1-bc44-a9b1a2b1e587","resolution":{"observed_at":"2026-08-06T18:16:32.465736Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-06T18:16:31.703850Z","title":"Adam: A method for stochastic optimization,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2507.08982","last_updated":"2025-07-11T19:34:01Z","snapshot_observed_at":"2026-08-06T18:05:15.934788Z","submitted_at":"2025-07-11T19:34:01Z","title":"VIP: Visual Information Protection through Adversarial Attacks on Vision-Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T18:16:31.703850Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2507.08982"},"observation_digest":"sha256:22c2483945a806f7645f82d3c05f0a4b4cd675f2271602807325a63a4da9230c","observation_id":"dd0ca6f7-83e7-4b4c-9565-791e73502c3c","resolution":{"observed_at":"2026-08-06T18:16:31.703850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.00928","last_updated":"2020-05-31T16:59:40Z","snapshot_observed_at":"2026-07-06T09:17:07.789326Z","submitted_at":"2020-05-02T21:45:27Z","title":"Quantifying Attention Flow in Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.00928","snapshot_observed_at":"2026-08-06T18:16:31.806132Z","title":"Quantifying attention flow in transformers,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2507.08982","last_updated":"2025-07-11T19:34:01Z","snapshot_observed_at":"2026-08-06T18:05:15.934788Z","submitted_at":"2025-07-11T19:34:01Z","title":"VIP: Visual Information Protection through Adversarial Attacks on Vision-Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T18:16:31.806132Z"},"links":{"cited_paper":"/paper/2005.00928","citing_paper":"/paper/2507.08982"},"observation_digest":"sha256:3c2c3e6797e02d38412a0a2d6dee9d8e6500882e66f06d9b1973ff90519fc7bb","observation_id":"c726c330-bfe5-4691-807a-92c4078ef2cf","resolution":{"observed_at":"2026-08-06T18:16:31.806132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.08982","last_updated":"2025-07-11T19:34:01Z","latest_version":1,"primary_category":"eess.IV","snapshot_observed_at":"2026-08-06T18:05:15.934788Z","submitted_at":"2025-07-11T19:34:01Z","title":"VIP: Visual Information Protection through Adversarial Attacks on Vision-Language Models"},"reference_resolution":{"displayed":48,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":30,"verified_exact":2,"verified_fuzzy":15},"total_outbound_references":48},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 48 of 48 outbound references and 0 inbound Pith citation observations for arXiv:2507.08982."}