{"as_of":"2026-08-07T23:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3f6106b53d02d73fccf769eb60511e3122c879433fa0768770ab8e60fb1a0931","coverage":[{"denominator":50,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:40:49.610244Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T14:28:23.793963Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T14:28:25.701065Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.05429","last_updated":"2025-06-05T08:09:05Z","snapshot_observed_at":"2026-08-07T10:32:06.331613Z","submitted_at":"2025-06-05T08:09:05Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2506.05429","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.05429","snapshot_observed_at":"2026-08-06T14:28:25.701065Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models","venue":"cs.CV","work_id":"a518c283-89a6-4a2f-b673-3fdcc667e465","year":2025},"citing_paper":{"arxiv_id":"2608.04885","last_updated":"2026-08-05T14:09:55Z","snapshot_observed_at":"2026-08-07T23:16:46.740776Z","submitted_at":"2026-08-05T14:09:55Z","title":"Evaluating the Diagnostic Robustness of Vision-Language Models Under Visual and Textual Perturbations","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T14:28:23.793963Z"},"links":{"cited_paper":"/paper/2506.05429","citing_paper":"/paper/2608.04885"},"observation_digest":"sha256:bc43ed728ae3266929cb999b285f0fe0218aa4f947606e4c675da153f8eb334d","observation_id":"ffbaa1ea-698a-4b8d-9411-1e26d89989ee","resolution":{"observed_at":"2026-08-06T14:28:25.803833Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.05429/citation-record","integrity":"/paper/2506.05429/integrity","json":"/paper/2506.05429/citation-record.json","paper":"/paper/2506.05429"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:40:50.450292Z","title":"Advances in adversarial attacks and defenses in com- puter vision: A survey","venue":null,"work_id":"6cbd95a3-7aca-4749-b1f3-c0f619377b59","year":null},"citing_paper":{"arxiv_id":"2506.05429","last_updated":"2025-06-05T08:09:05Z","snapshot_observed_at":"2026-08-07T10:32:06.331613Z","submitted_at":"2025-06-05T08:09:05Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:49.355753Z"},"links":{"citing_paper":"/paper/2506.05429"},"observation_digest":"sha256:fa975ea375cb85a5147173a750ea0540d5a2c31df7a42de11c737f54bedf1aa3","observation_id":"5b569dc3-8a41-48d0-8a53-d040cac356dc","resolution":{"observed_at":"2026-08-07T10:40:50.456135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:40:50.435083Z","title":"Square attack: a query-efficient black-box adversarial attack via random search","venue":null,"work_id":"0c8b02d9-c0f5-4bc8-b443-cc7d0fb52221","year":null},"citing_paper":{"arxiv_id":"2506.05429","last_updated":"2025-06-05T08:09:05Z","snapshot_observed_at":"2026-08-07T10:32:06.331613Z","submitted_at":"2025-06-05T08:09:05Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:49.362026Z"},"links":{"citing_paper":"/paper/2506.05429"},"observation_digest":"sha256:4aedcfcaf44d411a65702bb5f616f07952cab4885e7f4a0bae899043653e7c4e","observation_id":"d5e36efc-678e-4039-ab39-d2f006be3073","resolution":{"observed_at":"2026-08-07T10:40:50.440501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:40:50.418420Z","title":"A survey on adversarial attacks and defences","venue":null,"work_id":"10de632d-e69e-4fe4-99e6-6ef99369bc63","year":2021},"citing_paper":{"arxiv_id":"2506.05429","last_updated":"2025-06-05T08:09:05Z","snapshot_observed_at":"2026-08-07T10:32:06.331613Z","submitted_at":"2025-06-05T08:09:05Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:49.368675Z"},"links":{"citing_paper":"/paper/2506.05429"},"observation_digest":"sha256:79d35e615994e7680f60a6eba42a3a71cd46c461143fc5a381c3bf07d897f73d","observation_id":"7e22fc29-1fd9-40da-9946-71b0a6b19b94","resolution":{"observed_at":"2026-08-07T10:40:50.423975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:40:50.403371Z","title":"Textguise: Adaptive adversarial example attacks on text classification model","venue":null,"work_id":"4874fb6c-0b15-46f9-9a8e-a55eda8b5200","year":null},"citing_paper":{"arxiv_id":"2506.05429","last_updated":"2025-06-05T08:09:05Z","snapshot_observed_at":"2026-08-07T10:32:06.331613Z","submitted_at":"2025-06-05T08:09:05Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:49.374177Z"},"links":{"citing_paper":"/paper/2506.05429"},"observation_digest":"sha256:cf79c4188234886baeb3cd68a7cfdbe8330fb4be3c52307a86c080a4dfbb8618","observation_id":"99310f2d-5c31-4867-91d4-c709f0079e0b","resolution":{"observed_at":"2026-08-07T10:40:50.408333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:40:50.388909Z","title":"Instructblip: Towards general-purpose vision-language models with instruction tuning","venue":null,"work_id":"4deff9e3-7b4e-4239-857c-e55d1a7157c1","year":2024},"citing_paper":{"arxiv_id":"2506.05429","last_updated":"2025-06-05T08:09:05Z","snapshot_observed_at":"2026-08-07T10:32:06.331613Z","submitted_at":"2025-06-05T08:09:05Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:49.380779Z"},"links":{"citing_paper":"/paper/2506.05429"},"observation_digest":"sha256:456714e03849dde97be0ddd645b1fbec1e03f5818f149d33b2dc4aaef859670c","observation_id":"e3384d94-2c18-4a75-846b-3e951464fb29","resolution":{"observed_at":"2026-08-07T10:40:50.393685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-07T10:40:49.386507Z","title":"An image is worth 16x16 words: Trans- formers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.05429","last_updated":"2025-06-05T08:09:05Z","snapshot_observed_at":"2026-08-07T10:32:06.331613Z","submitted_at":"2025-06-05T08:09:05Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:49.386507Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2506.05429"},"observation_digest":"sha256:0f15616c273a493b462ec79042160264e92de75f2f0da1f92a6fb69d9f50a7da","observation_id":"8a77fab5-a699-41ed-965e-18c4d01e4265","resolution":{"observed_at":"2026-08-07T10:40:49.386507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:40:50.373584Z","title":"Fda: Feature disruptive attack","venue":null,"work_id":"9122b5e0-b376-4093-8512-2b78ef279d2d","year":2019},"citing_paper":{"arxiv_id":"2506.05429","last_updated":"2025-06-05T08:09:05Z","snapshot_observed_at":"2026-08-07T10:32:06.331613Z","submitted_at":"2025-06-05T08:09:05Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:49.392074Z"},"links":{"citing_paper":"/paper/2506.05429"},"observation_digest":"sha256:14a5bb5106577de092ed646dfc1c280eaa10ce67e23cb15f801b209664481e26","observation_id":"443e5018-ddd0-4d5b-a0ea-30c25dc409c3","resolution":{"observed_at":"2026-08-07T10:40:50.378219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.01970","last_updated":"2020-10-08T00:41:43Z","snapshot_observed_at":"2026-07-06T09:09:54.587296Z","submitted_at":"2020-04-04T16:25:48Z","title":"BAE: BERT-based Adversarial Examples for Text Classification","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.01970","snapshot_observed_at":"2026-08-07T10:40:49.397598Z","title":"Bae: Bert-based adversarial examples for text classification","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2506.05429","last_updated":"2025-06-05T08:09:05Z","snapshot_observed_at":"2026-08-07T10:32:06.331613Z","submitted_at":"2025-06-05T08:09:05Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:49.397598Z"},"links":{"cited_paper":"/paper/2004.01970","citing_paper":"/paper/2506.05429"},"observation_digest":"sha256:c3f17a603502cc897d147b2a40641f40d691de3e676fb25eb29a19d9abbb267e","observation_id":"7813e8be-082b-4816-b1a6-f0afd2f5bdf7","resolution":{"observed_at":"2026-08-07T10:40:49.397598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:40:50.358755Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answering","venue":null,"work_id":"b937a17f-7f0e-47b9-a615-37a1adcfcbe9","year":2017},"citing_paper":{"arxiv_id":"2506.05429","last_updated":"2025-06-05T08:09:05Z","snapshot_observed_at":"2026-08-07T10:32:06.331613Z","submitted_at":"2025-06-05T08:09:05Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:49.402837Z"},"links":{"citing_paper":"/paper/2506.05429"},"observation_digest":"sha256:c7cd13a50899fc4763766b882b676eafdfa7ae48e79f597b4074074f1b05691e","observation_id":"1574f963-aa63-485f-86d3-978f90b78b8f","resolution":{"observed_at":"2026-08-07T10:40:50.363618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.01610","last_updated":"2020-10-18T09:39:58Z","snapshot_observed_at":"2026-07-06T10:01:20.609728Z","submitted_at":"2020-10-04T15:54:03Z","title":"Adversarial Attack and Defense of Structured Prediction Models","version":2},"cited_work":{"arxiv_id":"2010.01610","doi":null,"metadata_source":"pith","pith_arxiv_id":"2010.01610","snapshot_observed_at":"2026-08-07T10:40:49.961262Z","title":"Adversarial Attack and Defense of Structured Prediction Models","venue":"cs.CL","work_id":"041443e5-e14c-4c81-9388-c341e6eef7dd","year":2020},"citing_paper":{"arxiv_id":"2506.05429","last_updated":"2025-06-05T08:09:05Z","snapshot_observed_at":"2026-08-07T10:32:06.331613Z","submitted_at":"2025-06-05T08:09:05Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:49.408180Z"},"links":{"cited_paper":"/paper/2010.01610","citing_paper":"/paper/2506.05429"},"observation_digest":"sha256:a8ec9bc4c8cfe8db2de81d253bda70671448fe7c1bb6f33c45081b7f7042d21a","observation_id":"5d8fc5e9-149b-498d-b633-bf5933166c36","resolution":{"observed_at":"2026-08-07T10:40:49.967363Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.10013","last_updated":"2021-03-18T04:23:21Z","snapshot_observed_at":"2026-07-06T10:51:02.714384Z","submitted_at":"2021-03-18T04:23:21Z","title":"Model Extraction and Adversarial Transferability, Your BERT is Vulnerable!","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.10013","snapshot_observed_at":"2026-08-07T10:40:49.413305Z","title":"Model extraction and adversarial transferability, your bert is vulnerable! arXiv preprint arXiv:2103.10013, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.05429","last_updated":"2025-06-05T08:09:05Z","snapshot_observed_at":"2026-08-07T10:32:06.331613Z","submitted_at":"2025-06-05T08:09:05Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:49.413305Z"},"links":{"cited_paper":"/paper/2103.10013","citing_paper":"/paper/2506.05429"},"observation_digest":"sha256:4418285faa8d71c2a27edb3529bee52844049a7b4db4f1fa228e3ad1012d8423","observation_id":"dabdfb06-0705-4516-9683-3d0d7b3895ae","resolution":{"observed_at":"2026-08-07T10:40:49.413305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.10579","last_updated":"2021-01-26T06:13:52Z","snapshot_observed_at":"2026-08-04T11:31:58.604518Z","submitted_at":"2021-01-26T06:13:52Z","title":"Generating Syntactically Controlled Paraphrases without Using Annotated Parallel Pairs","version":1},"cited_work":{"arxiv_id":"2101.10579","doi":null,"metadata_source":"pith","pith_arxiv_id":"2101.10579","snapshot_observed_at":"2026-08-07T10:40:49.923030Z","title":"Generating Syntactically Controlled Paraphrases without Using Annotated Parallel Pairs","venue":"cs.CL","work_id":"60d718ac-5ab1-4d9b-9f32-96050a877772","year":2021},"citing_paper":{"arxiv_id":"2506.05429","last_updated":"2025-06-05T08:09:05Z","snapshot_observed_at":"2026-08-07T10:32:06.331613Z","submitted_at":"2025-06-05T08:09:05Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:49.418318Z"},"links":{"cited_paper":"/paper/2101.10579","citing_paper":"/paper/2506.05429"},"observation_digest":"sha256:2d3bf0546cf7d051feb89ea7a4f4a32db98dddc9941e922a869da2819310fb2a","observation_id":"28df7976-4bfe-4047-8a3a-38930fb45386","resolution":{"observed_at":"2026-08-07T10:40:49.928498Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1611.01144","last_updated":"2017-08-05T22:45:19Z","snapshot_observed_at":"2026-08-01T18:34:23.156273Z","submitted_at":"2016-11-03T19:48:08Z","title":"Categorical Reparameterization with Gumbel-Softmax","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.01144","snapshot_observed_at":"2026-08-07T10:40:49.423306Z","title":"Categorical reparameterization with gumbel-softmax","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.05429","last_updated":"2025-06-05T08:09:05Z","snapshot_observed_at":"2026-08-07T10:32:06.331613Z","submitted_at":"2025-06-05T08:09:05Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:49.423306Z"},"links":{"cited_paper":"/paper/1611.01144","citing_paper":"/paper/2506.05429"},"observation_digest":"sha256:8fd6f1dca24d15ebeeb922647c9723a1092c17bf0430dff2377fb143529ab649","observation_id":"702ffb37-ebe4-4cc0-94cd-57510549c0ff","resolution":{"observed_at":"2026-08-07T10:40:49.423306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:40:50.342805Z","title":"Is bert really robust? a strong baseline for natural language attack on text classification and entailment","venue":null,"work_id":"20a0f8d0-19f1-437a-997f-d013010b7141","year":2020},"citing_paper":{"arxiv_id":"2506.05429","last_updated":"2025-06-05T08:09:05Z","snapshot_observed_at":"2026-08-07T10:32:06.331613Z","submitted_at":"2025-06-05T08:09:05Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:49.430009Z"},"links":{"citing_paper":"/paper/2506.05429"},"observation_digest":"sha256:fc1b163660053df9c10dcd0169b173333e62d7f1a896911edfd00962478e08c6","observation_id":"91c0fb4d-7707-4bbd-aecb-d7d1c47102e4","resolution":{"observed_at":"2026-08-07T10:40:50.348436Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:40:50.326240Z","title":"Adversarial deep learning: A survey on adversarial attacks and defense mech- anisms on image classification","venue":null,"work_id":"2d8e429d-0400-4e8e-a492-5f9d9555ddae","year":2022},"citing_paper":{"arxiv_id":"2506.05429","last_updated":"2025-06-05T08:09:05Z","snapshot_observed_at":"2026-08-07T10:32:06.331613Z","submitted_at":"2025-06-05T08:09:05Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:49.435519Z"},"links":{"citing_paper":"/paper/2506.05429"},"observation_digest":"sha256:bcb102058e91e2ffb5d4bd3d0d1f7938bb5b278c702ee12bf4862481a63d3567","observation_id":"dcb91e86-a761-41d0-91d6-b325ed690eb4","resolution":{"observed_at":"2026-08-07T10:40:50.332145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:40:50.310424Z","title":"Vilt: Vision-and- language transformer without convolution or region supervi- sion","venue":null,"work_id":"27b3b70c-6d47-4170-938e-276eb222da79","year":2021},"citing_paper":{"arxiv_id":"2506.05429","last_updated":"2025-06-05T08:09:05Z","snapshot_observed_at":"2026-08-07T10:32:06.331613Z","submitted_at":"2025-06-05T08:09:05Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:49.440226Z"},"links":{"citing_paper":"/paper/2506.05429"},"observation_digest":"sha256:30ac42728e862cf3a15c3c9586d96ed610ed1ab93d54ef3cdcdd643bea84ade4","observation_id":"67f5a72e-63a8-4ecf-b471-ac9528398ef2","resolution":{"observed_at":"2026-08-07T10:40:50.315761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.07502","last_updated":"2021-03-15T04:56:31Z","snapshot_observed_at":"2026-07-06T09:56:03.214339Z","submitted_at":"2020-09-16T06:53:15Z","title":"Contextualized Perturbation for Textual Adversarial Attack","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.07502","snapshot_observed_at":"2026-08-07T10:40:49.444766Z","title":"Contextualized perturbation for textual adversarial attack","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.05429","last_updated":"2025-06-05T08:09:05Z","snapshot_observed_at":"2026-08-07T10:32:06.331613Z","submitted_at":"2025-06-05T08:09:05Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:49.444766Z"},"links":{"cited_paper":"/paper/2009.07502","citing_paper":"/paper/2506.05429"},"observation_digest":"sha256:db32e8aab8a4dc9bf517431e29e8dab37f925420ae8d29eb58cbfc6c1381011b","observation_id":"c4a4c9fe-1914-41ae-ad4a-78b1e5c97543","resolution":{"observed_at":"2026-08-07T10:40:49.444766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.09984","last_updated":"2020-10-02T03:08:04Z","snapshot_observed_at":"2026-07-06T09:14:04.157271Z","submitted_at":"2020-04-21T13:30:02Z","title":"BERT-ATTACK: Adversarial Attack Against BERT Using BERT","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.09984","snapshot_observed_at":"2026-08-07T10:40:49.449875Z","title":"Bert-attack: Adversarial attack against bert using bert","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2506.05429","last_updated":"2025-06-05T08:09:05Z","snapshot_observed_at":"2026-08-07T10:32:06.331613Z","submitted_at":"2025-06-05T08:09:05Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:49.449875Z"},"links":{"cited_paper":"/paper/2004.09984","citing_paper":"/paper/2506.05429"},"observation_digest":"sha256:783ea2b20d860e5dadf1aba1a5b8432cff502e5a681e3df5367e4e7bfddaeb33","observation_id":"61645836-3be7-432c-a1d3-b5d61603a0d0","resolution":{"observed_at":"2026-08-07T10:40:49.449875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.11136","last_updated":"2021-05-25T08:24:19Z","snapshot_observed_at":"2026-07-06T11:12:04.788175Z","submitted_at":"2021-05-24T07:35:56Z","title":"Using Adversarial Attacks to Reveal the Statistical Bias in Machine Reading Comprehension Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.11136","snapshot_observed_at":"2026-08-07T10:40:49.454924Z","title":"Using adversarial attacks to reveal the statistical bias in machine reading comprehension models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.05429","last_updated":"2025-06-05T08:09:05Z","snapshot_observed_at":"2026-08-07T10:32:06.331613Z","submitted_at":"2025-06-05T08:09:05Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:49.454924Z"},"links":{"cited_paper":"/paper/2105.11136","citing_paper":"/paper/2506.05429"},"observation_digest":"sha256:ce66f3bb2a8f40544063a311906e67d9746b07c7871309b65ef06098b755b49d","observation_id":"0005a546-b9b5-4d12-90d1-c2c27a91e0d7","resolution":{"observed_at":"2026-08-07T10:40:49.454924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03744","last_updated":"2024-05-15T19:22:44Z","snapshot_observed_at":"2026-07-06T16:28:22.350574Z","submitted_at":"2023-10-05T17:59:56Z","title":"Improved Baselines with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03744","snapshot_observed_at":"2026-08-07T10:40:49.459960Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05429","last_updated":"2025-06-05T08:09:05Z","snapshot_observed_at":"2026-08-07T10:32:06.331613Z","submitted_at":"2025-06-05T08:09:05Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:49.459960Z"},"links":{"cited_paper":"/paper/2310.03744","citing_paper":"/paper/2506.05429"},"observation_digest":"sha256:7f2c45b70c12852a88469b45b13b03d28c8c72e9e2c4c1f049ea07d246926418","observation_id":"a037c324-0687-46bc-b5b6-50c60817daf9","resolution":{"observed_at":"2026-08-07T10:40:49.459960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:40:50.294629Z","title":"Llava-next: Improved reason- ing, ocr, and world knowledge, 2024","venue":null,"work_id":"32b8a70d-62ed-4746-9d8e-7e49bddd415f","year":2024},"citing_paper":{"arxiv_id":"2506.05429","last_updated":"2025-06-05T08:09:05Z","snapshot_observed_at":"2026-08-07T10:32:06.331613Z","submitted_at":"2025-06-05T08:09:05Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:49.464875Z"},"links":{"citing_paper":"/paper/2506.05429"},"observation_digest":"sha256:2dc11076fe79b33b66947b02000ef08dacf671cf63b8f916877ac4724070c704","observation_id":"dabffa96-c21f-4730-8d11-5348bd73cf76","resolution":{"observed_at":"2026-08-07T10:40:50.299650Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:40:50.279873Z","title":"Deepfool: a simple and accurate method to fool deep neural networks","venue":null,"work_id":"ef9375ac-c222-47ad-bb5e-bc3870db4aee","year":2016},"citing_paper":{"arxiv_id":"2506.05429","last_updated":"2025-06-05T08:09:05Z","snapshot_observed_at":"2026-08-07T10:32:06.331613Z","submitted_at":"2025-06-05T08:09:05Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:49.469469Z"},"links":{"citing_paper":"/paper/2506.05429"},"observation_digest":"sha256:20a240c2ff4a47a80b26e8b395aaa963b3c4b59924b563744b806e2714cbc8ba","observation_id":"8defe554-c510-4f30-a260-195b91340559","resolution":{"observed_at":"2026-08-07T10:40:50.284663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:40:50.264618Z","title":"A self-supervised approach for adversarial robustness","venue":null,"work_id":"6ebd2359-7e6d-400a-a1c7-03ba6fb2d12d","year":2020},"citing_paper":{"arxiv_id":"2506.05429","last_updated":"2025-06-05T08:09:05Z","snapshot_observed_at":"2026-08-07T10:32:06.331613Z","submitted_at":"2025-06-05T08:09:05Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:49.474120Z"},"links":{"citing_paper":"/paper/2506.05429"},"observation_digest":"sha256:1fb80b33e3886b8726d712f5007567015739062cf5a0601abb8f3a38403c5008","observation_id":"d597ddd2-fddd-418d-884c-40f56852c692","resolution":{"observed_at":"2026-08-07T10:40:50.269469Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:40:50.248329Z","title":"Crafting adversarial input sequences for recurrent neural net- works","venue":null,"work_id":"58cd138f-e24e-4a89-a8a1-43f741a19d08","year":2016},"citing_paper":{"arxiv_id":"2506.05429","last_updated":"2025-06-05T08:09:05Z","snapshot_observed_at":"2026-08-07T10:32:06.331613Z","submitted_at":"2025-06-05T08:09:05Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:49.479099Z"},"links":{"citing_paper":"/paper/2506.05429"},"observation_digest":"sha256:54984fabb6c34b1b696fc87201a7569c31bb455679706110014350dbca9c394b","observation_id":"3617bb40-c3d1-4291-aeb8-6b778f65ee26","resolution":{"observed_at":"2026-08-07T10:40:50.253644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:40:50.232867Z","title":"Measuring robustness with black-box adversarial attack using reinforcement learning","venue":null,"work_id":"96f18fac-1d5a-4c4b-998b-7b3a6ff2beab","year":2022},"citing_paper":{"arxiv_id":"2506.05429","last_updated":"2025-06-05T08:09:05Z","snapshot_observed_at":"2026-08-07T10:32:06.331613Z","submitted_at":"2025-06-05T08:09:05Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:49.483879Z"},"links":{"citing_paper":"/paper/2506.05429"},"observation_digest":"sha256:b5708e417b3a713995eb6263eeaef28514aef9ddf8ebb68193ee48af095507e3","observation_id":"832ec756-f042-4180-808b-efc0f84d2362","resolution":{"observed_at":"2026-08-07T10:40:50.237827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:40:49.488568Z","title":"Rl-cam: Visual explana- tions for convolutional networks using reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05429","last_updated":"2025-06-05T08:09:05Z","snapshot_observed_at":"2026-08-07T10:32:06.331613Z","submitted_at":"2025-06-05T08:09:05Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:49.488568Z"},"links":{"citing_paper":"/paper/2506.05429"},"observation_digest":"sha256:372794158f5651fa7146c188f6c409d03a8f6b9cff6d9f99202b79636dfc2a44","observation_id":"c8b6c48b-877f-4489-a355-2251c4d1dc3d","resolution":{"observed_at":"2026-08-07T10:40:49.488568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:40:50.202662Z","title":"Robustness with query- efficient adversarial attack using reinforcement learning","venue":null,"work_id":"d820f50a-6d45-4b67-8fbc-58c90d8ec334","year":2023},"citing_paper":{"arxiv_id":"2506.05429","last_updated":"2025-06-05T08:09:05Z","snapshot_observed_at":"2026-08-07T10:32:06.331613Z","submitted_at":"2025-06-05T08:09:05Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:49.493660Z"},"links":{"citing_paper":"/paper/2506.05429"},"observation_digest":"sha256:f8dcdae50000f7127b4363469de56831d2c2c56e7645af68a5d49bac4f13fb7e","observation_id":"432b199b-dcee-4ac0-9e85-d0ef9703e567","resolution":{"observed_at":"2026-08-07T10:40:50.207280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:40:50.187718Z","title":"Reinforcement learning based black-box adversarial attack for robustness improvement","venue":null,"work_id":"59707c18-5285-42bc-b0ff-dda959e3d6fe","year":2023},"citing_paper":{"arxiv_id":"2506.05429","last_updated":"2025-06-05T08:09:05Z","snapshot_observed_at":"2026-08-07T10:32:06.331613Z","submitted_at":"2025-06-05T08:09:05Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:49.498363Z"},"links":{"citing_paper":"/paper/2506.05429"},"observation_digest":"sha256:be7e537ee0e88a5681af41a5074b4fc3e4595fa5dd1216951defad921ce97330","observation_id":"564b400a-e897-4123-a009-decc6ce6eb94","resolution":{"observed_at":"2026-08-07T10:40:50.192988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:40:50.171972Z","title":"Robustness with black-box adversarial attack using reinforce- ment learning","venue":null,"work_id":"c3aa3fdc-b0fa-4ccf-8776-3fdb7e2302f6","year":2023},"citing_paper":{"arxiv_id":"2506.05429","last_updated":"2025-06-05T08:09:05Z","snapshot_observed_at":"2026-08-07T10:32:06.331613Z","submitted_at":"2025-06-05T08:09:05Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:49.503486Z"},"links":{"citing_paper":"/paper/2506.05429"},"observation_digest":"sha256:824b432f52c6f63f7214c1333543f76f43910f3cee6c07813389dd9b965acc5d","observation_id":"a310cd5a-f58d-40b1-a555-864f2eddb475","resolution":{"observed_at":"2026-08-07T10:40:50.177399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:40:50.156638Z","title":"Benchmark generation framework with customizable distortions for image classifier robustness","venue":null,"work_id":"9659335b-e87d-4975-acbc-1e346cde7d4b","year":2024},"citing_paper":{"arxiv_id":"2506.05429","last_updated":"2025-06-05T08:09:05Z","snapshot_observed_at":"2026-08-07T10:32:06.331613Z","submitted_at":"2025-06-05T08:09:05Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:49.508711Z"},"links":{"citing_paper":"/paper/2506.05429"},"observation_digest":"sha256:74e11c5e8dcc0003986a8865c4e4b3c773c4b09805e585deda071e7608172ce0","observation_id":"d010a191-03f8-4571-8420-13dfbeeedfa1","resolution":{"observed_at":"2026-08-07T10:40:50.161654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:40:50.140316Z","title":"Robustness and visual explanation for black box image, video, and ecg signal classification with reinforcement learning","venue":null,"work_id":"7afd814b-afd5-43ce-8045-0334d787a8be","year":2024},"citing_paper":{"arxiv_id":"2506.05429","last_updated":"2025-06-05T08:09:05Z","snapshot_observed_at":"2026-08-07T10:32:06.331613Z","submitted_at":"2025-06-05T08:09:05Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:49.513208Z"},"links":{"citing_paper":"/paper/2506.05429"},"observation_digest":"sha256:01ce7302a03dbf206046fe34260fa81f4182f6782dbd1472c3b917af05018d9f","observation_id":"458db8fb-ebe6-40e1-8eef-9b510c60f266","resolution":{"observed_at":"2026-08-07T10:40:50.145499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:40:50.122917Z","title":"Reinforcement learning platform for adversarial black- box attacks with custom distortion filters","venue":null,"work_id":"4b1af6ae-dd94-4b3a-a8fc-6a82589e21e0","year":2025},"citing_paper":{"arxiv_id":"2506.05429","last_updated":"2025-06-05T08:09:05Z","snapshot_observed_at":"2026-08-07T10:32:06.331613Z","submitted_at":"2025-06-05T08:09:05Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:49.517863Z"},"links":{"citing_paper":"/paper/2506.05429"},"observation_digest":"sha256:c1ee7d9de7dc58139e5351266e3f038e036674b2752621b2280d66e19b15a3cd","observation_id":"ce97da1b-905e-4ba0-a033-23f0e821ac07","resolution":{"observed_at":"2026-08-07T10:40:50.128705Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.00491","last_updated":"2019-07-21T05:26:36Z","snapshot_observed_at":"2026-08-01T22:56:26.162617Z","submitted_at":"2018-11-01T16:47:44Z","title":"A Corpus for Reasoning About Natural Language Grounded in Photographs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.00491","snapshot_observed_at":"2026-08-07T10:40:49.523244Z","title":"A corpus for reasoning about natural language grounded in photographs","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.05429","last_updated":"2025-06-05T08:09:05Z","snapshot_observed_at":"2026-08-07T10:32:06.331613Z","submitted_at":"2025-06-05T08:09:05Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:49.523244Z"},"links":{"cited_paper":"/paper/1811.00491","citing_paper":"/paper/2506.05429"},"observation_digest":"sha256:e013962bebb9cab0c696b5ffdb841e5614f2d3a504d056397054b6fba35035cd","observation_id":"a283d790-865a-465f-b349-8c7f6727801c","resolution":{"observed_at":"2026-08-07T10:40:49.523244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2003.04985","last_updated":"2020-02-27T22:07:11Z","snapshot_observed_at":"2026-07-06T09:03:46.923530Z","submitted_at":"2020-02-27T22:07:11Z","title":"Adv-BERT: BERT is not robust on misspellings! Generating nature adversarial samples on BERT","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.04985","snapshot_observed_at":"2026-08-07T10:40:49.529540Z","title":"Adv-bert: Bert is not robust on misspellings! generating nature adversarial samples on bert","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2506.05429","last_updated":"2025-06-05T08:09:05Z","snapshot_observed_at":"2026-08-07T10:32:06.331613Z","submitted_at":"2025-06-05T08:09:05Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:49.529540Z"},"links":{"cited_paper":"/paper/2003.04985","citing_paper":"/paper/2506.05429"},"observation_digest":"sha256:6589ddfbd74b5fd67b1afac492b16ce94b985ffa7f8393d07eea00ea03ab7b3a","observation_id":"a7efc97c-ebbd-4828-9943-b6dd509bf935","resolution":{"observed_at":"2026-08-07T10:40:49.529540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6199","last_updated":"2014-02-19T16:33:14Z","snapshot_observed_at":"2026-07-06T03:31:33.797310Z","submitted_at":"2013-12-21T03:36:08Z","title":"Intriguing properties of neural networks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6199","snapshot_observed_at":"2026-08-07T10:40:49.534898Z","title":"Intriguing properties of neural networks","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2506.05429","last_updated":"2025-06-05T08:09:05Z","snapshot_observed_at":"2026-08-07T10:32:06.331613Z","submitted_at":"2025-06-05T08:09:05Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:49.534898Z"},"links":{"cited_paper":"/paper/1312.6199","citing_paper":"/paper/2506.05429"},"observation_digest":"sha256:37fe271cdebe70735bd70bec23232c2f7aa3399e4c3d6116e8fbfaab6607994d","observation_id":"440d3c0c-67fd-4e2a-bb7f-11e5e06f3fad","resolution":{"observed_at":"2026-08-07T10:40:49.534898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:40:50.106938Z","title":"Autoattacker: A reinforcement learning approach for black- box adversarial attacks","venue":null,"work_id":"d33a2b5e-cb42-4db2-81ec-086883ab15a7","year":2019},"citing_paper":{"arxiv_id":"2506.05429","last_updated":"2025-06-05T08:09:05Z","snapshot_observed_at":"2026-08-07T10:32:06.331613Z","submitted_at":"2025-06-05T08:09:05Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:49.539625Z"},"links":{"citing_paper":"/paper/2506.05429"},"observation_digest":"sha256:141e848cf11d0e0fb804f15e155c8484fd22652a43a0a712e06b3367c84887f2","observation_id":"2942d313-f870-4612-88b7-92239c4ef58b","resolution":{"observed_at":"2026-08-07T10:40:50.111839Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.14100","last_updated":"2022-12-15T19:21:35Z","snapshot_observed_at":"2026-08-04T09:31:34.784365Z","submitted_at":"2022-05-27T17:03:38Z","title":"GIT: A Generative Image-to-text Transformer for Vision and Language","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.14100","snapshot_observed_at":"2026-08-07T10:40:49.544208Z","title":"Git: A generative image-to-text transformer for vision and language","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.05429","last_updated":"2025-06-05T08:09:05Z","snapshot_observed_at":"2026-08-07T10:32:06.331613Z","submitted_at":"2025-06-05T08:09:05Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:49.544208Z"},"links":{"cited_paper":"/paper/2205.14100","citing_paper":"/paper/2506.05429"},"observation_digest":"sha256:d4957eb5973df20ad8370da420a7f411c1cc113c1afc8a2604f3fd7849530d46","observation_id":"ce50ea18-4424-4be7-b824-0fd9ed4e1f58","resolution":{"observed_at":"2026-08-07T10:40:49.544208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02338","last_updated":"2020-10-05T21:07:45Z","snapshot_observed_at":"2026-08-02T16:46:22.596583Z","submitted_at":"2020-10-05T21:07:45Z","title":"CAT-Gen: Improving Robustness in NLP Models via Controlled Adversarial Text Generation","version":1},"cited_work":{"arxiv_id":"2010.02338","doi":null,"metadata_source":"pith","pith_arxiv_id":"2010.02338","snapshot_observed_at":"2026-08-07T10:40:49.757006Z","title":"CAT-Gen: Improving Robustness in NLP Models via Controlled Adversarial Text Generation","venue":"cs.CL","work_id":"7c1038a7-a4af-4434-8938-9445ce80c1af","year":2020},"citing_paper":{"arxiv_id":"2506.05429","last_updated":"2025-06-05T08:09:05Z","snapshot_observed_at":"2026-08-07T10:32:06.331613Z","submitted_at":"2025-06-05T08:09:05Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:49.549106Z"},"links":{"cited_paper":"/paper/2010.02338","citing_paper":"/paper/2506.05429"},"observation_digest":"sha256:0b5ef86208fa2e0a197e46574b146758bf670405510deb00ef475206a8ffbadc","observation_id":"7154e275-9040-4a28-ac29-18e7ee591dcf","resolution":{"observed_at":"2026-08-07T10:40:49.763265Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1902.07285","last_updated":"2021-04-21T10:14:36Z","snapshot_observed_at":"2026-07-06T07:34:10.374415Z","submitted_at":"2019-02-12T02:42:54Z","title":"Towards a Robust Deep Neural Network in Texts: A Survey","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1902.07285","snapshot_observed_at":"2026-08-07T10:40:49.553681Z","title":"Towards a robust deep neural network in texts: A survey","venue":null,"work_id":null,"year":1902},"citing_paper":{"arxiv_id":"2506.05429","last_updated":"2025-06-05T08:09:05Z","snapshot_observed_at":"2026-08-07T10:32:06.331613Z","submitted_at":"2025-06-05T08:09:05Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:49.553681Z"},"links":{"cited_paper":"/paper/1902.07285","citing_paper":"/paper/2506.05429"},"observation_digest":"sha256:45fe632e9840b25b10257a713cebdb075e8edac4129b94ecb78ba7317a3955da","observation_id":"94407776-c898-4ffd-992f-22c739462512","resolution":{"observed_at":"2026-08-07T10:40:49.553681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.08313","last_updated":"2022-05-09T21:36:47Z","snapshot_observed_at":"2026-07-06T12:19:11.280873Z","submitted_at":"2021-12-15T18:02:04Z","title":"Measure and Improve Robustness in NLP Models: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.08313","snapshot_observed_at":"2026-08-07T10:40:49.559495Z","title":"Measure and improve robustness in nlp models: A survey","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.05429","last_updated":"2025-06-05T08:09:05Z","snapshot_observed_at":"2026-08-07T10:32:06.331613Z","submitted_at":"2025-06-05T08:09:05Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:49.559495Z"},"links":{"cited_paper":"/paper/2112.08313","citing_paper":"/paper/2506.05429"},"observation_digest":"sha256:ceb79756a293206c72e2b794a96fc796e388369023168cba4a55b6f08e8ad960","observation_id":"e2800bca-5293-40f3-a564-438c7123ced4","resolution":{"observed_at":"2026-08-07T10:40:49.559495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:40:50.090010Z","title":"Adversarial attacks and defenses in images, graphs and text: A review","venue":null,"work_id":"859122e4-bfb8-421b-99b3-1279cfd6a0fa","year":2020},"citing_paper":{"arxiv_id":"2506.05429","last_updated":"2025-06-05T08:09:05Z","snapshot_observed_at":"2026-08-07T10:32:06.331613Z","submitted_at":"2025-06-05T08:09:05Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:49.564491Z"},"links":{"citing_paper":"/paper/2506.05429"},"observation_digest":"sha256:debc283593ea3a0f886851edbdac74fc51f1fccc4da6670659321f07ef086c32","observation_id":"87b0d916-9759-4574-a83c-e2be20ed4081","resolution":{"observed_at":"2026-08-07T10:40:50.095546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08453","last_updated":"2022-10-19T21:31:34Z","snapshot_observed_at":"2026-07-06T11:00:50.937337Z","submitted_at":"2021-04-17T05:21:35Z","title":"R&R: Metric-guided Adversarial Sentence Generation","version":3},"cited_work":{"arxiv_id":"2104.08453","doi":null,"metadata_source":"pith","pith_arxiv_id":"2104.08453","snapshot_observed_at":"2026-08-07T10:40:49.701126Z","title":"R&R: Metric-guided Adversarial Sentence Generation","venue":"cs.CL","work_id":"fda7bfcf-e072-42ec-bc5e-443eb79e7d61","year":2021},"citing_paper":{"arxiv_id":"2506.05429","last_updated":"2025-06-05T08:09:05Z","snapshot_observed_at":"2026-08-07T10:32:06.331613Z","submitted_at":"2025-06-05T08:09:05Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:49.569253Z"},"links":{"cited_paper":"/paper/2104.08453","citing_paper":"/paper/2506.05429"},"observation_digest":"sha256:2a5169487cced8bd60b5708e0ec4b030529aca6378b07f94a7d38dd4b92578b2","observation_id":"da3b8e3c-c324-42f7-a169-978c23826c09","resolution":{"observed_at":"2026-08-07T10:40:49.708501Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:40:50.073252Z","title":"Natural attack for pre-trained models of code","venue":null,"work_id":"76580fbc-f0bd-42b9-a233-7ab2fa814cfc","year":2022},"citing_paper":{"arxiv_id":"2506.05429","last_updated":"2025-06-05T08:09:05Z","snapshot_observed_at":"2026-08-07T10:32:06.331613Z","submitted_at":"2025-06-05T08:09:05Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:49.574806Z"},"links":{"citing_paper":"/paper/2506.05429"},"observation_digest":"sha256:83153fdba48237e74b9b235eb69fd2430cde2a8e890b405451fc1a1eaa401435","observation_id":"f6bad0c4-e62b-49f8-b5ef-c788044ece9a","resolution":{"observed_at":"2026-08-07T10:40:50.078175Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:40:50.057682Z","title":"Texthoaxer: Budgeted hard-label adversarial attacks on text","venue":null,"work_id":"bbdb0b9e-ff13-49da-b118-24ac75f0a351","year":2022},"citing_paper":{"arxiv_id":"2506.05429","last_updated":"2025-06-05T08:09:05Z","snapshot_observed_at":"2026-08-07T10:32:06.331613Z","submitted_at":"2025-06-05T08:09:05Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:49.580523Z"},"links":{"citing_paper":"/paper/2506.05429"},"observation_digest":"sha256:49cc52b14adb0eda1e2b409fdd5a20c780f149b068724f4b27c65f8f1246d9d0","observation_id":"b293655f-ac96-44f4-8a49-c1f5b23f8d4b","resolution":{"observed_at":"2026-08-07T10:40:50.062586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04655","last_updated":"2024-02-05T19:33:53Z","snapshot_observed_at":"2026-07-06T16:29:03.404736Z","submitted_at":"2023-10-07T02:18:52Z","title":"VLATTACK: Multimodal Adversarial Attacks on Vision-Language Tasks via Pre-trained Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.04655","snapshot_observed_at":"2026-08-07T10:40:49.586440Z","title":"Vlattack: Multimodal adversarial attacks on vision-language tasks via pre-trained models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05429","last_updated":"2025-06-05T08:09:05Z","snapshot_observed_at":"2026-08-07T10:32:06.331613Z","submitted_at":"2025-06-05T08:09:05Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:49.586440Z"},"links":{"cited_paper":"/paper/2310.04655","citing_paper":"/paper/2506.05429"},"observation_digest":"sha256:a9ffad1068c812a316ff54590573a974f710e8db6472252665ae1181f8aa6d07","observation_id":"822854fb-9404-499a-98e9-3e294edda496","resolution":{"observed_at":"2026-08-07T10:40:49.586440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:40:50.042375Z","title":"Towards adversarial at- tack on vision-language pre-training models","venue":null,"work_id":"45b071d2-d457-4f49-8d5d-fa9ecfaebffe","year":2022},"citing_paper":{"arxiv_id":"2506.05429","last_updated":"2025-06-05T08:09:05Z","snapshot_observed_at":"2026-08-07T10:32:06.331613Z","submitted_at":"2025-06-05T08:09:05Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:49.591675Z"},"links":{"citing_paper":"/paper/2506.05429"},"observation_digest":"sha256:c1cd283aaec026575d464686748da15930f9a989d7aa1d89bce22a0a6672b8b9","observation_id":"6c503f17-372a-435e-b7c6-d6e83489f1a8","resolution":{"observed_at":"2026-08-07T10:40:50.047585Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09675","last_updated":"2020-02-24T18:59:28Z","snapshot_observed_at":"2026-07-29T15:42:51.774083Z","submitted_at":"2019-04-21T23:08:53Z","title":"BERTScore: Evaluating Text Generation with BERT","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09675","snapshot_observed_at":"2026-08-07T10:40:49.596096Z","title":"Bertscore: Evaluating text generation with bert","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2506.05429","last_updated":"2025-06-05T08:09:05Z","snapshot_observed_at":"2026-08-07T10:32:06.331613Z","submitted_at":"2025-06-05T08:09:05Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:49.596096Z"},"links":{"cited_paper":"/paper/1904.09675","citing_paper":"/paper/2506.05429"},"observation_digest":"sha256:028ecad5ef8367a367ca3b2a1122173cc776fe9ae1bca0e1b8016016532277b4","observation_id":"0473d5c1-5c95-4baa-acf4-23caab34ef95","resolution":{"observed_at":"2026-08-07T10:40:49.596096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:40:50.027056Z","title":"Adversarial attacks on deep-learning models in nat- ural language processing: A survey","venue":null,"work_id":"86495609-00d1-49dc-b1e7-3af0f94bd3b7","year":2020},"citing_paper":{"arxiv_id":"2506.05429","last_updated":"2025-06-05T08:09:05Z","snapshot_observed_at":"2026-08-07T10:32:06.331613Z","submitted_at":"2025-06-05T08:09:05Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:49.601063Z"},"links":{"citing_paper":"/paper/2506.05429"},"observation_digest":"sha256:3b6c30d5cc8c02e5308afea837a483a18f7ab97d6c8627196fd7f1498a992f6a","observation_id":"c3a7d398-2124-4beb-b60b-668d4dbe07c8","resolution":{"observed_at":"2026-08-07T10:40:50.031996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:40:50.011375Z","title":"On evaluating adversarial robustness of large vision-language models","venue":null,"work_id":"30f44144-d514-4c11-8f04-4e45307cff6a","year":2024},"citing_paper":{"arxiv_id":"2506.05429","last_updated":"2025-06-05T08:09:05Z","snapshot_observed_at":"2026-08-07T10:32:06.331613Z","submitted_at":"2025-06-05T08:09:05Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:49.605673Z"},"links":{"citing_paper":"/paper/2506.05429"},"observation_digest":"sha256:957a1dcd11921f6b5bd49310a2cd0bc8db4e2c003ec7871fa3c6d3751ee90712","observation_id":"9b2af941-c6c7-4cc0-9de3-0f2e91ebb556","resolution":{"observed_at":"2026-08-07T10:40:50.016136Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.19287","last_updated":"2024-11-12T10:48:21Z","snapshot_observed_at":"2026-07-06T18:07:27.432252Z","submitted_at":"2024-04-30T06:34:21Z","title":"Revisiting the Adversarial Robustness of Vision Language Models: a Multimodal Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.19287","snapshot_observed_at":"2026-08-07T10:40:49.610244Z","title":"Revisiting the adversarial robustness of vision lan- guage models: a multimodal perspective","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05429","last_updated":"2025-06-05T08:09:05Z","snapshot_observed_at":"2026-08-07T10:32:06.331613Z","submitted_at":"2025-06-05T08:09:05Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:49.610244Z"},"links":{"cited_paper":"/paper/2404.19287","citing_paper":"/paper/2506.05429"},"observation_digest":"sha256:8027627f200f664e227e353a914815dba635f1d64210c16fedb4f06ad102213e","observation_id":"48fb0b46-4211-47e3-ade7-8dedcfe9dfa8","resolution":{"observed_at":"2026-08-07T10:40:49.610244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.05429","last_updated":"2025-06-05T08:09:05Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T10:32:06.331613Z","submitted_at":"2025-06-05T08:09:05Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models"},"reference_resolution":{"displayed":50,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":18,"verified_exact":4,"verified_fuzzy":28},"total_outbound_references":50},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 1 inbound Pith citation observation for arXiv:2506.05429."}