{"as_of":"2026-08-10T18:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9d10a8c56b50858b622d97a8c927f556dce0112efaf4898c86d58cc805e8879b","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T16:23:13.730247Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2604.16499/citation-record","integrity":"/paper/2604.16499/integrity","json":"/paper/2604.16499/citation-record.json","paper":"/paper/2604.16499"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Image captioning with novel topics guidance and retrieval-based topics re-weighting.IEEE Transactions on Multimedia (TMM), 25:5984–5999","venue":null,"work_id":"ca0452d5-31f1-4433-a874-a0a457428353","year":2023},"citing_paper":{"arxiv_id":"2604.16499","last_updated":"2026-04-14T07:16:52Z","snapshot_observed_at":"2026-07-06T23:03:48.168078Z","submitted_at":"2026-04-14T07:16:52Z","title":"HQA-VLAttack: Towards High Quality Adversarial Attack on Vision-Language Pre-Trained Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T16:23:13.730247Z"},"links":{"citing_paper":"/paper/2604.16499"},"observation_digest":"sha256:4198b6861059b2b6e58f6c5cc7d7268ffc941e26cd7238882fd22ff1f7c19743","observation_id":"8c6f84a5-84a8-46b0-a235-0b4bdab82e16","resolution":{"observed_at":"2026-05-17T15:39:54.195817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"SPICE: semantic propositional image caption evaluation","venue":null,"work_id":"ba2c842c-bd31-48e1-b28e-eb759e9dae07","year":2016},"citing_paper":{"arxiv_id":"2604.16499","last_updated":"2026-04-14T07:16:52Z","snapshot_observed_at":"2026-07-06T23:03:48.168078Z","submitted_at":"2026-04-14T07:16:52Z","title":"HQA-VLAttack: Towards High Quality Adversarial Attack on Vision-Language Pre-Trained Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T16:23:13.730247Z"},"links":{"citing_paper":"/paper/2604.16499"},"observation_digest":"sha256:d6b51ec4246fbc506cdeacc72ef30486f267e67997918bc5a50daf75e5150672","observation_id":"784eb8f1-1d72-46c8-bdb4-f34aecc0cf66","resolution":{"observed_at":"2026-05-17T15:39:54.159462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"METEOR: an automatic metric for MT evaluation with improved correlation with human judgments","venue":null,"work_id":"2c725d36-9f30-494f-9767-0d7d07716599","year":2005},"citing_paper":{"arxiv_id":"2604.16499","last_updated":"2026-04-14T07:16:52Z","snapshot_observed_at":"2026-07-06T23:03:48.168078Z","submitted_at":"2026-04-14T07:16:52Z","title":"HQA-VLAttack: Towards High Quality Adversarial Attack on Vision-Language Pre-Trained Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T16:23:13.730247Z"},"links":{"citing_paper":"/paper/2604.16499"},"observation_digest":"sha256:456c9e5df315d5504b2c79219dc601877f4c821527b7130a724718101785bd59","observation_id":"71bd2170-bff8-49c5-89fe-46f78d46830a","resolution":{"observed_at":"2026-05-17T15:39:54.186653Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Image-text retrieval: A survey on recent research and development","venue":null,"work_id":"d43a1a6a-8d5e-4c33-8a50-a32fe3e5f692","year":2022},"citing_paper":{"arxiv_id":"2604.16499","last_updated":"2026-04-14T07:16:52Z","snapshot_observed_at":"2026-07-06T23:03:48.168078Z","submitted_at":"2026-04-14T07:16:52Z","title":"HQA-VLAttack: Towards High Quality Adversarial Attack on Vision-Language Pre-Trained Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T16:23:13.730247Z"},"links":{"citing_paper":"/paper/2604.16499"},"observation_digest":"sha256:d337b6ccc3768729e3ee20937668ec1f30a996977213b21570ae5fa419538818","observation_id":"7097ea62-30ee-40f5-a7a2-62aa3e1d6af8","resolution":{"observed_at":"2026-05-17T15:39:54.166533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Query-efficient decision-based black-box patch attack.IEEE Transactions on Information Forensics and Security, 18:5522–5536","venue":null,"work_id":"74dc632d-63de-4f62-8fcd-f4ef3485dc45","year":2023},"citing_paper":{"arxiv_id":"2604.16499","last_updated":"2026-04-14T07:16:52Z","snapshot_observed_at":"2026-07-06T23:03:48.168078Z","submitted_at":"2026-04-14T07:16:52Z","title":"HQA-VLAttack: Towards High Quality Adversarial Attack on Vision-Language Pre-Trained Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T16:23:13.730247Z"},"links":{"citing_paper":"/paper/2604.16499"},"observation_digest":"sha256:cee6015bf2728728f8d0be37e72363d7100520e87182c482b56f3fe2513ab5ac","observation_id":"a679c783-7d4d-46be-abb8-aedf373f53c4","resolution":{"observed_at":"2026-05-17T15:39:54.181531Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20090","last_updated":"2025-07-21T08:41:47Z","snapshot_observed_at":"2026-08-09T04:31:41.282578Z","submitted_at":"2024-05-30T14:27:20Z","title":"Transfer Attack for Bad and Good: Explain and Boost Adversarial Transferability across Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":"2405.20090","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.20090","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Typography leads semantic diversifying: Amplifying adversarial transferability across multimodal large language models","venue":null,"work_id":"6cc4dee7-ef92-4c59-8361-02ff261dde19","year":2024},"citing_paper":{"arxiv_id":"2604.16499","last_updated":"2026-04-14T07:16:52Z","snapshot_observed_at":"2026-07-06T23:03:48.168078Z","submitted_at":"2026-04-14T07:16:52Z","title":"HQA-VLAttack: Towards High Quality Adversarial Attack on Vision-Language Pre-Trained Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T16:23:13.730247Z"},"links":{"cited_paper":"/paper/2405.20090","citing_paper":"/paper/2604.16499"},"observation_digest":"sha256:b289761e6412dec660990d657d8e6fb6448d353ba207d9b7342ae9f391d7827c","observation_id":"7ea89b6e-9c41-4ecb-931b-dd8b7a1f251b","resolution":{"observed_at":"2026-05-11T08:56:03.256500Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cross-modal alignment with graph reasoning for image-text retrieval.Multimedia Tools and Applications, 81(17):23615–23632","venue":null,"work_id":"0327267f-b9d9-422b-b438-227a7440481e","year":2022},"citing_paper":{"arxiv_id":"2604.16499","last_updated":"2026-04-14T07:16:52Z","snapshot_observed_at":"2026-07-06T23:03:48.168078Z","submitted_at":"2026-04-14T07:16:52Z","title":"HQA-VLAttack: Towards High Quality Adversarial Attack on Vision-Language Pre-Trained Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T16:23:13.730247Z"},"links":{"citing_paper":"/paper/2604.16499"},"observation_digest":"sha256:fa878bd269a3f80f4c64116a0422f4f4abe03db1e4f0c2a11931a093ecd20190","observation_id":"fcc84b80-7820-44c2-9750-45cd8a0effe6","resolution":{"observed_at":"2026-05-17T15:39:54.193063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"BERT: pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":"41606d15-fae8-42d3-a2f3-f072badc3697","year":2019},"citing_paper":{"arxiv_id":"2604.16499","last_updated":"2026-04-14T07:16:52Z","snapshot_observed_at":"2026-07-06T23:03:48.168078Z","submitted_at":"2026-04-14T07:16:52Z","title":"HQA-VLAttack: Towards High Quality Adversarial Attack on Vision-Language Pre-Trained Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T16:23:13.730247Z"},"links":{"citing_paper":"/paper/2604.16499"},"observation_digest":"sha256:1dbe6e66338683ea9aaea00684e71ab0822db1c7270645290c622170cf4cfcc8","observation_id":"246cb788-110f-4e8a-9035-f3eda1ef8022","resolution":{"observed_at":"2026-05-17T15:39:54.201428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T15:43:54.446377Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":"9cd816ae-a60f-4613-ad01-1e43bca51610","year":2021},"citing_paper":{"arxiv_id":"2604.16499","last_updated":"2026-04-14T07:16:52Z","snapshot_observed_at":"2026-07-06T23:03:48.168078Z","submitted_at":"2026-04-14T07:16:52Z","title":"HQA-VLAttack: Towards High Quality Adversarial Attack on Vision-Language Pre-Trained Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T16:23:13.730247Z"},"links":{"citing_paper":"/paper/2604.16499"},"observation_digest":"sha256:4dc91d904572c4878c9f61d6ddf553a92d5e0da171315d51e70e1dfff5e49534","observation_id":"30878d32-a314-48ae-8684-a11b697035a8","resolution":{"observed_at":"2026-05-17T15:39:54.155733Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tsang, and Qing Guo","venue":null,"work_id":"fbd193e9-c0d9-46f6-a4ae-b712fa5bd84e","year":2024},"citing_paper":{"arxiv_id":"2604.16499","last_updated":"2026-04-14T07:16:52Z","snapshot_observed_at":"2026-07-06T23:03:48.168078Z","submitted_at":"2026-04-14T07:16:52Z","title":"HQA-VLAttack: Towards High Quality Adversarial Attack on Vision-Language Pre-Trained Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T16:23:13.730247Z"},"links":{"citing_paper":"/paper/2604.16499"},"observation_digest":"sha256:06e9184bee6d8b8b560c86ed29395f9e08c55ee39267b34ba06fd03118677043","observation_id":"3eb3d9a8-ab3e-47f4-b885-84e86f7d2110","resolution":{"observed_at":"2026-05-17T15:39:54.204417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Adversarial neural collaborative filtering with embedding dimension correlations.Data Intelligence, 5(3):786–806","venue":null,"work_id":"c40fe4da-d441-473c-a5f1-44d23a678eb7","year":2023},"citing_paper":{"arxiv_id":"2604.16499","last_updated":"2026-04-14T07:16:52Z","snapshot_observed_at":"2026-07-06T23:03:48.168078Z","submitted_at":"2026-04-14T07:16:52Z","title":"HQA-VLAttack: Towards High Quality Adversarial Attack on Vision-Language Pre-Trained Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T16:23:13.730247Z"},"links":{"citing_paper":"/paper/2604.16499"},"observation_digest":"sha256:2219b2abb39eacebd9fd7c7a2cee041f2f45794ba3d961e99e94959c8f96bf1b","observation_id":"601632cf-57e3-4cd6-9fc6-796d146ca731","resolution":{"observed_at":"2026-05-17T15:39:54.207236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deep residual learning for image recognition","venue":null,"work_id":"bbcb7007-85c7-488f-a2d1-7e051a4af6c7","year":2016},"citing_paper":{"arxiv_id":"2604.16499","last_updated":"2026-04-14T07:16:52Z","snapshot_observed_at":"2026-07-06T23:03:48.168078Z","submitted_at":"2026-04-14T07:16:52Z","title":"HQA-VLAttack: Towards High Quality Adversarial Attack on Vision-Language Pre-Trained Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T16:23:13.730247Z"},"links":{"citing_paper":"/paper/2604.16499"},"observation_digest":"sha256:c440aeac06014ed4429c86ee6b4f2d3762c28292f179ebdf4678545a705f63c6","observation_id":"8ce35eb7-f5ff-40a8-9091-9909f3431d73","resolution":{"observed_at":"2026-05-17T15:39:54.151652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Selvaraju, Akhilesh Gotmare, Shafiq R","venue":null,"work_id":"742248b1-1e1e-4357-aaaa-f72911ab3604","year":2021},"citing_paper":{"arxiv_id":"2604.16499","last_updated":"2026-04-14T07:16:52Z","snapshot_observed_at":"2026-07-06T23:03:48.168078Z","submitted_at":"2026-04-14T07:16:52Z","title":"HQA-VLAttack: Towards High Quality Adversarial Attack on Vision-Language Pre-Trained Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T16:23:13.730247Z"},"links":{"citing_paper":"/paper/2604.16499"},"observation_digest":"sha256:00adf91b0079c4375f6738ce9d34396ce0d6de585b73d805345e6c194c9b2d38","observation_id":"913dae38-cfe5-4f58-930d-aff0a6e706ff","resolution":{"observed_at":"2026-05-17T15:39:54.276692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"BERT-ATTACK: adversarial attack against BERT using BERT","venue":null,"work_id":"f1322dad-5017-4618-9c86-e1c7374f3bc5","year":2020},"citing_paper":{"arxiv_id":"2604.16499","last_updated":"2026-04-14T07:16:52Z","snapshot_observed_at":"2026-07-06T23:03:48.168078Z","submitted_at":"2026-04-14T07:16:52Z","title":"HQA-VLAttack: Towards High Quality Adversarial Attack on Vision-Language Pre-Trained Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T16:23:13.730247Z"},"links":{"citing_paper":"/paper/2604.16499"},"observation_digest":"sha256:ab160d9f4c6577a5ade098fcc7c107c4fdb5a0aa31471a7fa5040f4a9177cb26","observation_id":"ab3525f5-27ef-4237-ae4a-fb4e1a443a8e","resolution":{"observed_at":"2026-05-17T15:39:54.189812Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rouge: A package for automatic evaluation of summaries","venue":null,"work_id":"33ce370e-81e0-420c-9461-6e412f5bc648","year":2004},"citing_paper":{"arxiv_id":"2604.16499","last_updated":"2026-04-14T07:16:52Z","snapshot_observed_at":"2026-07-06T23:03:48.168078Z","submitted_at":"2026-04-14T07:16:52Z","title":"HQA-VLAttack: Towards High Quality Adversarial Attack on Vision-Language Pre-Trained Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T16:23:13.730247Z"},"links":{"citing_paper":"/paper/2604.16499"},"observation_digest":"sha256:f90449633267ab706eddc44887d33cd0ea4481fdf70ab8be3c05357704b2efe2","observation_id":"7e629167-ce92-4960-8f88-d8a3e4cffd10","resolution":{"observed_at":"2026-05-17T15:39:54.225911Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Belongie, James Hays, Pietro Perona, Deva Ramanan, Piotr Dollár, and C","venue":null,"work_id":"b291c273-e0b9-43be-bce1-f1ae17dd2358","year":2014},"citing_paper":{"arxiv_id":"2604.16499","last_updated":"2026-04-14T07:16:52Z","snapshot_observed_at":"2026-07-06T23:03:48.168078Z","submitted_at":"2026-04-14T07:16:52Z","title":"HQA-VLAttack: Towards High Quality Adversarial Attack on Vision-Language Pre-Trained Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T16:23:13.730247Z"},"links":{"citing_paper":"/paper/2604.16499"},"observation_digest":"sha256:bc3eaa7932bf3148a817a7ccd20120592f1e0c0c9da3a5d54e023a51a875ac23","observation_id":"f9d80d22-9495-4bed-916b-501fda11a69a","resolution":{"observed_at":"2026-05-17T15:39:54.177727Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sspattack: A simple and sweet paradigm for black-box hard-label textual adversarial attack","venue":null,"work_id":"2ae21c71-2824-46ab-ad8e-30c99ba8b7d7","year":2023},"citing_paper":{"arxiv_id":"2604.16499","last_updated":"2026-04-14T07:16:52Z","snapshot_observed_at":"2026-07-06T23:03:48.168078Z","submitted_at":"2026-04-14T07:16:52Z","title":"HQA-VLAttack: Towards High Quality Adversarial Attack on Vision-Language Pre-Trained Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T16:23:13.730247Z"},"links":{"citing_paper":"/paper/2604.16499"},"observation_digest":"sha256:9a0e9d68eeb97c813bcefb99cb0eb2ec037238eb8f433e14f7f4e58ce5aa9bf4","observation_id":"a007ae65-fb50-437b-8ad7-c1308dca825f","resolution":{"observed_at":"2026-05-17T15:39:54.243922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hqa-attack: Toward high quality black-box hard-label adversarial attack on text","venue":null,"work_id":"f5605d9e-f8bf-4846-bb3b-edd5883b6d80","year":2023},"citing_paper":{"arxiv_id":"2604.16499","last_updated":"2026-04-14T07:16:52Z","snapshot_observed_at":"2026-07-06T23:03:48.168078Z","submitted_at":"2026-04-14T07:16:52Z","title":"HQA-VLAttack: Towards High Quality Adversarial Attack on Vision-Language Pre-Trained Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T16:23:13.730247Z"},"links":{"citing_paper":"/paper/2604.16499"},"observation_digest":"sha256:f55ea0b2647fe494013aaa1b118a0b999e9934e0bd8bc455a8ffd56d5a21a6d7","observation_id":"f0a3181a-c493-4a30-92a3-620b1f5801af","resolution":{"observed_at":"2026-05-17T15:39:54.144112Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Set-level guidance attack: Boosting adversarial transferability of vision-language pre-training models","venue":null,"work_id":"86c21e3a-db36-4ba2-be3a-d42ad3c0b2fd","year":2023},"citing_paper":{"arxiv_id":"2604.16499","last_updated":"2026-04-14T07:16:52Z","snapshot_observed_at":"2026-07-06T23:03:48.168078Z","submitted_at":"2026-04-14T07:16:52Z","title":"HQA-VLAttack: Towards High Quality Adversarial Attack on Vision-Language Pre-Trained Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T16:23:13.730247Z"},"links":{"citing_paper":"/paper/2604.16499"},"observation_digest":"sha256:69baba6c322cc1b303d00e2215493d191959228d4b6193f6cced7854a03dd182","observation_id":"abbd5615-8b8e-4ea0-9e2a-79ca81cefed4","resolution":{"observed_at":"2026-05-17T15:39:54.147971Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Groma: Localized visual tokenization for grounding multimodal large language models","venue":null,"work_id":"4fbb3461-57dc-4ccc-98b2-d6ac1c9fd257","year":2024},"citing_paper":{"arxiv_id":"2604.16499","last_updated":"2026-04-14T07:16:52Z","snapshot_observed_at":"2026-07-06T23:03:48.168078Z","submitted_at":"2026-04-14T07:16:52Z","title":"HQA-VLAttack: Towards High Quality Adversarial Attack on Vision-Language Pre-Trained Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T16:23:13.730247Z"},"links":{"citing_paper":"/paper/2604.16499"},"observation_digest":"sha256:7ee187e66295677915bf133dbaca6cf79c39b39fb67caf80957eb82e3c7d1a74","observation_id":"dae1e8cd-7e61-4045-af85-4d07b5491a6a","resolution":{"observed_at":"2026-05-17T15:39:54.140605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"To- wards deep learning models resistant to adversarial attacks","venue":null,"work_id":"ec42c236-13c7-40e8-a35c-453bb1c0aeda","year":2018},"citing_paper":{"arxiv_id":"2604.16499","last_updated":"2026-04-14T07:16:52Z","snapshot_observed_at":"2026-07-06T23:03:48.168078Z","submitted_at":"2026-04-14T07:16:52Z","title":"HQA-VLAttack: Towards High Quality Adversarial Attack on Vision-Language Pre-Trained Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T16:23:13.730247Z"},"links":{"citing_paper":"/paper/2604.16499"},"observation_digest":"sha256:0fa1a06275c443c1a7bded0e28cd6ccabfb0abfdfeecf9a6254954f6ec01cf6e","observation_id":"92f1c702-e448-4d3b-9b57-534050b803a0","resolution":{"observed_at":"2026-05-17T15:39:54.222425Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ab22b4c3-114d-4752-9458-41236819bcbc","year":2016},"citing_paper":{"arxiv_id":"2604.16499","last_updated":"2026-04-14T07:16:52Z","snapshot_observed_at":"2026-07-06T23:03:48.168078Z","submitted_at":"2026-04-14T07:16:52Z","title":"HQA-VLAttack: Towards High Quality Adversarial Attack on Vision-Language Pre-Trained Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T16:23:13.730247Z"},"links":{"citing_paper":"/paper/2604.16499"},"observation_digest":"sha256:dbd31030a0f23263c1ac45d3928ae385b228332200f0a506a70389334ee87cc6","observation_id":"7bf0bd3d-8a38-478c-b65d-eed6e3cb4967","resolution":{"observed_at":"2026-05-17T15:39:54.136566Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2604.16499","last_updated":"2026-04-14T07:16:52Z","snapshot_observed_at":"2026-07-06T23:03:48.168078Z","submitted_at":"2026-04-14T07:16:52Z","title":"HQA-VLAttack: Towards High Quality Adversarial Attack on Vision-Language Pre-Trained Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-10T16:23:13.730247Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2604.16499"},"observation_digest":"sha256:d42d5b70c689ccdf23d62e88973328c93a420a482589691f5b2ff12e69463847","observation_id":"9736906d-1960-441c-8c16-e47c8ef5bffb","resolution":{"observed_at":"2026-05-11T08:56:03.263191Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bleu: a method for automatic evaluation of machine translation","venue":null,"work_id":"c4833d46-400b-4c35-9956-e987432b210e","year":2002},"citing_paper":{"arxiv_id":"2604.16499","last_updated":"2026-04-14T07:16:52Z","snapshot_observed_at":"2026-07-06T23:03:48.168078Z","submitted_at":"2026-04-14T07:16:52Z","title":"HQA-VLAttack: Towards High Quality Adversarial Attack on Vision-Language Pre-Trained Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T16:23:13.730247Z"},"links":{"citing_paper":"/paper/2604.16499"},"observation_digest":"sha256:cc14fe66e1de6dc7b7f37ad9cd12fd6fb46778cd5a8a5f1014f5aa32b5d8aa44","observation_id":"d17e091c-001c-47ee-b561-da14279fe799","resolution":{"observed_at":"2026-05-17T15:39:54.210181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Plummer, Liwei Wang, Chris M","venue":null,"work_id":"4bf49477-6887-44de-ae37-a90b4a9ae924","year":2015},"citing_paper":{"arxiv_id":"2604.16499","last_updated":"2026-04-14T07:16:52Z","snapshot_observed_at":"2026-07-06T23:03:48.168078Z","submitted_at":"2026-04-14T07:16:52Z","title":"HQA-VLAttack: Towards High Quality Adversarial Attack on Vision-Language Pre-Trained Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T16:23:13.730247Z"},"links":{"citing_paper":"/paper/2604.16499"},"observation_digest":"sha256:334db03076a67c9b85d3971e4c8d714c284aec31d6d7d5bd80d13eb88c920a49","observation_id":"70823cc6-109a-488b-b644-a673bc6ed547","resolution":{"observed_at":"2026-05-17T15:39:54.128736Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"5b042336-e4de-4c1c-8011-fba2d61fe270","year":2021},"citing_paper":{"arxiv_id":"2604.16499","last_updated":"2026-04-14T07:16:52Z","snapshot_observed_at":"2026-07-06T23:03:48.168078Z","submitted_at":"2026-04-14T07:16:52Z","title":"HQA-VLAttack: Towards High Quality Adversarial Attack on Vision-Language Pre-Trained Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T16:23:13.730247Z"},"links":{"citing_paper":"/paper/2604.16499"},"observation_digest":"sha256:fb3252140945cec832e5c4b2f481488f06d1f0f889f1a62300f7e4751421d8b7","observation_id":"1e81c976-6ede-4d20-83a6-36b184b8dcbe","resolution":{"observed_at":"2026-05-17T15:39:54.133408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"From show to tell: A survey on deep learning-based image captioning.IEEE Trans","venue":null,"work_id":"23c7f915-2ec8-4af5-b4b6-3d622ecf3d55","year":2023},"citing_paper":{"arxiv_id":"2604.16499","last_updated":"2026-04-14T07:16:52Z","snapshot_observed_at":"2026-07-06T23:03:48.168078Z","submitted_at":"2026-04-14T07:16:52Z","title":"HQA-VLAttack: Towards High Quality Adversarial Attack on Vision-Language Pre-Trained Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T16:23:13.730247Z"},"links":{"citing_paper":"/paper/2604.16499"},"observation_digest":"sha256:14106360f9dd5304251abb80e5bc3362961a29698a82825acb89a57595efc467","observation_id":"7ebd3c3f-abe2-4943-804c-0818474a38bd","resolution":{"observed_at":"2026-05-17T15:39:54.240289Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lawrence Zitnick, and Devi Parikh","venue":null,"work_id":"26cd1865-d158-49d5-b11f-ae71d7ac77d9","year":2015},"citing_paper":{"arxiv_id":"2604.16499","last_updated":"2026-04-14T07:16:52Z","snapshot_observed_at":"2026-07-06T23:03:48.168078Z","submitted_at":"2026-04-14T07:16:52Z","title":"HQA-VLAttack: Towards High Quality Adversarial Attack on Vision-Language Pre-Trained Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T16:23:13.730247Z"},"links":{"citing_paper":"/paper/2604.16499"},"observation_digest":"sha256:7a707fdf452c036bea26834533bb9222b376540acc818866a320c7ac4a3e64f5","observation_id":"a319177b-cea7-4d7f-9ed8-34ef8866a077","resolution":{"observed_at":"2026-05-17T15:39:54.198519Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A text-guided generation and refinement model for image captioning.IEEE Transactions on Multimedia (TMM), 25:2966–2977","venue":null,"work_id":"17930724-688c-4eeb-9db7-05ced5b02b9d","year":2023},"citing_paper":{"arxiv_id":"2604.16499","last_updated":"2026-04-14T07:16:52Z","snapshot_observed_at":"2026-07-06T23:03:48.168078Z","submitted_at":"2026-04-14T07:16:52Z","title":"HQA-VLAttack: Towards High Quality Adversarial Attack on Vision-Language Pre-Trained Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T16:23:13.730247Z"},"links":{"citing_paper":"/paper/2604.16499"},"observation_digest":"sha256:35bd886a58c88553232381e922c23f2a246bb75e1bb7a47683fd9d97a686f56d","observation_id":"6ac3cafb-e1b0-45f9-b06b-47e35b36e3df","resolution":{"observed_at":"2026-05-17T15:39:54.170669Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fine-grained image captioning with global-local discriminative objective.IEEE Transactions on Multimedia (TMM), 23:2413– 2427","venue":null,"work_id":"0d77f2bc-5f55-4372-976c-60809e2f3a91","year":2021},"citing_paper":{"arxiv_id":"2604.16499","last_updated":"2026-04-14T07:16:52Z","snapshot_observed_at":"2026-07-06T23:03:48.168078Z","submitted_at":"2026-04-14T07:16:52Z","title":"HQA-VLAttack: Towards High Quality Adversarial Attack on Vision-Language Pre-Trained Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-10T16:23:13.730247Z"},"links":{"citing_paper":"/paper/2604.16499"},"observation_digest":"sha256:14e81fbc203ced640ba345447b43bf011ad6266e77ff86afd49ed23440c4c563","observation_id":"3d94bd66-0f1c-47a9-b6a9-876bc094d5d4","resolution":{"observed_at":"2026-05-17T15:39:54.174331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"e6b47f12-959c-4489-a9c3-66a35d6206fd","year":2019},"citing_paper":{"arxiv_id":"2604.16499","last_updated":"2026-04-14T07:16:52Z","snapshot_observed_at":"2026-07-06T23:03:48.168078Z","submitted_at":"2026-04-14T07:16:52Z","title":"HQA-VLAttack: Towards High Quality Adversarial Attack on Vision-Language Pre-Trained Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-10T16:23:13.730247Z"},"links":{"citing_paper":"/paper/2604.16499"},"observation_digest":"sha256:f0948a4b3450d87518ce69e1f0587dfcea83052512705047c4df5374db37980d","observation_id":"8bf95c04-e51a-40bb-b445-0bc6271d7774","resolution":{"observed_at":"2026-05-17T15:39:54.273202Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fooling vision and language models despite localization and attention mechanism","venue":null,"work_id":"f45a5fca-d498-45a3-89bc-ee44a56d289d","year":2018},"citing_paper":{"arxiv_id":"2604.16499","last_updated":"2026-04-14T07:16:52Z","snapshot_observed_at":"2026-07-06T23:03:48.168078Z","submitted_at":"2026-04-14T07:16:52Z","title":"HQA-VLAttack: Towards High Quality Adversarial Attack on Vision-Language Pre-Trained Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-10T16:23:13.730247Z"},"links":{"citing_paper":"/paper/2604.16499"},"observation_digest":"sha256:92fa06027efb336467b2196f92909fc005f82e7331ec8469e819816ee286c82a","observation_id":"a9e3fb60-c71c-4966-b21d-a80692e5ca6b","resolution":{"observed_at":"2026-05-17T15:39:54.261255Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vision-language pre-training with triple contrastive learning","venue":null,"work_id":"0bd40410-83bf-4e44-b573-7b3a342865d9","year":2022},"citing_paper":{"arxiv_id":"2604.16499","last_updated":"2026-04-14T07:16:52Z","snapshot_observed_at":"2026-07-06T23:03:48.168078Z","submitted_at":"2026-04-14T07:16:52Z","title":"HQA-VLAttack: Towards High Quality Adversarial Attack on Vision-Language Pre-Trained Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-10T16:23:13.730247Z"},"links":{"citing_paper":"/paper/2604.16499"},"observation_digest":"sha256:6ea558fc0d64af262395fef893e62be744993006f0a00c3f37ef2b2bc2aca4d7","observation_id":"12471d53-5070-4641-99e7-bea6be92944d","resolution":{"observed_at":"2026-05-17T15:39:54.267594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"VLATTACK: multimodal adversarial attacks on vision-language tasks via pre-trained models","venue":null,"work_id":"3485d9f6-0205-471c-88f5-eeb4960c7376","year":2023},"citing_paper":{"arxiv_id":"2604.16499","last_updated":"2026-04-14T07:16:52Z","snapshot_observed_at":"2026-07-06T23:03:48.168078Z","submitted_at":"2026-04-14T07:16:52Z","title":"HQA-VLAttack: Towards High Quality Adversarial Attack on Vision-Language Pre-Trained Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-10T16:23:13.730247Z"},"links":{"citing_paper":"/paper/2604.16499"},"observation_digest":"sha256:81dce24e5d704fa7e86dbf1ced29ea9b0094a295bf5a90c96702f845707e1372","observation_id":"f3c0c5d7-cb8a-4577-bc6e-c104302231e5","resolution":{"observed_at":"2026-05-17T15:39:54.264434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vqattack: Transferable adversarial attacks on visual question answering via pre-trained models","venue":null,"work_id":"7c65b71e-cf51-4641-b8d9-16c79ce11ece","year":2024},"citing_paper":{"arxiv_id":"2604.16499","last_updated":"2026-04-14T07:16:52Z","snapshot_observed_at":"2026-07-06T23:03:48.168078Z","submitted_at":"2026-04-14T07:16:52Z","title":"HQA-VLAttack: Towards High Quality Adversarial Attack on Vision-Language Pre-Trained Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-10T16:23:13.730247Z"},"links":{"citing_paper":"/paper/2604.16499"},"observation_digest":"sha256:4f470ad6f069d6d46406bbc9c8d1599090c272445520d6c6aa0fb36479f03a27","observation_id":"6aa4a777-2578-41f6-bc3d-54bdc062dcc6","resolution":{"observed_at":"2026-05-17T15:39:54.251414Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Berg, and Tamara L","venue":null,"work_id":"32354ff0-60bb-4195-b05d-e373f7e4a8bf","year":2016},"citing_paper":{"arxiv_id":"2604.16499","last_updated":"2026-04-14T07:16:52Z","snapshot_observed_at":"2026-07-06T23:03:48.168078Z","submitted_at":"2026-04-14T07:16:52Z","title":"HQA-VLAttack: Towards High Quality Adversarial Attack on Vision-Language Pre-Trained Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-10T16:23:13.730247Z"},"links":{"citing_paper":"/paper/2604.16499"},"observation_digest":"sha256:7baa904cac27491b95da7ce0fff50d34e5141370617be5085c6184210378ac83","observation_id":"a437e208-3cb7-46cd-b586-2a2256604ef7","resolution":{"observed_at":"2026-05-17T15:39:54.258333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards adversarial attack on vision-language pre-training models","venue":null,"work_id":"19137592-76f3-4f7a-bc06-65e31beea7a5","year":2022},"citing_paper":{"arxiv_id":"2604.16499","last_updated":"2026-04-14T07:16:52Z","snapshot_observed_at":"2026-07-06T23:03:48.168078Z","submitted_at":"2026-04-14T07:16:52Z","title":"HQA-VLAttack: Towards High Quality Adversarial Attack on Vision-Language Pre-Trained Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-10T16:23:13.730247Z"},"links":{"citing_paper":"/paper/2604.16499"},"observation_digest":"sha256:24cd6e656a02238b80b5e7571d9b44e2c0e7b9e6f2f5b2ad7bdcdedb8c9df182","observation_id":"585f7f51-9e45-4d00-bda0-d4589a056079","resolution":{"observed_at":"2026-05-17T15:39:54.163199Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Universal adversarial perturbations for vision-language pre-trained models","venue":null,"work_id":"4f875bc7-b764-4c41-8c7d-129c5c493ddd","year":2024},"citing_paper":{"arxiv_id":"2604.16499","last_updated":"2026-04-14T07:16:52Z","snapshot_observed_at":"2026-07-06T23:03:48.168078Z","submitted_at":"2026-04-14T07:16:52Z","title":"HQA-VLAttack: Towards High Quality Adversarial Attack on Vision-Language Pre-Trained Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-10T16:23:13.730247Z"},"links":{"citing_paper":"/paper/2604.16499"},"observation_digest":"sha256:40375b9a0d18dad94ca90b752b6e5205e86ac782880750c1f2d2f3a2be3894f3","observation_id":"a37d03ac-236b-49bc-ae8c-e7beffa3c92f","resolution":{"observed_at":"2026-05-17T15:39:54.247761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Limitations","venue":null,"work_id":"17ac1d5c-6a5b-45e2-baf1-6aad0df3dfa1","year":2024},"citing_paper":{"arxiv_id":"2604.16499","last_updated":"2026-04-14T07:16:52Z","snapshot_observed_at":"2026-07-06T23:03:48.168078Z","submitted_at":"2026-04-14T07:16:52Z","title":"HQA-VLAttack: Towards High Quality Adversarial Attack on Vision-Language Pre-Trained Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-10T16:23:13.730247Z"},"links":{"citing_paper":"/paper/2604.16499"},"observation_digest":"sha256:0e6a42cdb76eaddbe150a3a55ad621af6442211b47302767943adf51ab98db0d","observation_id":"cabc2bc9-1df8-4534-acae-65499310f670","resolution":{"observed_at":"2026-05-17T15:39:54.270585Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Guidelines: • The answer NA means that the paper does not involve crowdsourcing nor research with human subjects","venue":null,"work_id":"a9e3910c-01e0-43a2-b995-6ac72c03bba1","year":2025},"citing_paper":{"arxiv_id":"2604.16499","last_updated":"2026-04-14T07:16:52Z","snapshot_observed_at":"2026-07-06T23:03:48.168078Z","submitted_at":"2026-04-14T07:16:52Z","title":"HQA-VLAttack: Towards High Quality Adversarial Attack on Vision-Language Pre-Trained Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-10T16:23:13.730247Z"},"links":{"citing_paper":"/paper/2604.16499"},"observation_digest":"sha256:c5acd63c122a8aa84a2aaeff6ea73d6caaedd172ee11de7abf4b799c429b46b0","observation_id":"643e9994-5e7b-4059-a8ba-d436eaed617c","resolution":{"observed_at":"2026-05-17T15:39:54.255177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.16499","last_updated":"2026-04-14T07:16:52Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T23:03:48.168078Z","submitted_at":"2026-04-14T07:16:52Z","title":"HQA-VLAttack: Towards High Quality Adversarial Attack on Vision-Language Pre-Trained Models"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":2,"verified_exact":2,"verified_fuzzy":35},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 0 inbound Pith citation observations for arXiv:2604.16499."}