{"as_of":"2026-08-09T05:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c5e64f260ffa238eb9fe7e98e69082d750ce02950d1391b15acc78779f083fee","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T10:56:49.365745Z","state":"measured"},{"denominator":59,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":59,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T04:46:56.552601Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T15:09:54.631580Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T01:54:36.955555Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"cited_work":{"arxiv_id":"2502.08079","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.08079","snapshot_observed_at":"2026-07-04T15:09:54.631580Z","title":"Zhang, G","venue":null,"work_id":"7ded35dc-9994-46a4-b622-9230ff2e69b6","year":2025},"citing_paper":{"arxiv_id":"2606.26199","last_updated":"2026-06-26T02:47:28Z","snapshot_observed_at":"2026-07-07T00:00:31.981360Z","submitted_at":"2026-06-24T16:23:10Z","title":"MIRAGE: Protecting against Malicious Image Editing via False Moderation","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-06-26T01:52:12.291420Z"},"links":{"cited_paper":"/paper/2502.08079","citing_paper":"/paper/2606.26199"},"observation_digest":"sha256:009699b0d13bcf3970eb0bf2cdcef8165d5f2c62c4ec9ccdf90d75071e64c80f","observation_id":"bba5a8e3-a9f4-4f1b-be03-28d2c46f2d24","resolution":{"observed_at":"2026-07-04T15:09:54.633145Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T01:54:36.955555Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"cited_work":{"arxiv_id":"2502.08079","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.08079","snapshot_observed_at":"2026-07-04T15:09:54.631580Z","title":"Zhang, G","venue":null,"work_id":"7ded35dc-9994-46a4-b622-9230ff2e69b6","year":2025},"citing_paper":{"arxiv_id":"2606.26199","last_updated":"2026-06-26T02:47:28Z","snapshot_observed_at":"2026-07-07T00:00:31.981360Z","submitted_at":"2026-06-24T16:23:10Z","title":"MIRAGE: Protecting against Malicious Image Editing via False Moderation","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-06-29T04:46:56.552601Z"},"links":{"cited_paper":"/paper/2502.08079","citing_paper":"/paper/2606.26199"},"observation_digest":"sha256:fff5ec5262072393ce75cc8aa92742012e01ca8ebd80fe52603ba6f40a273e50","observation_id":"6bcb7d15-d7b4-44d2-8247-8bed0bdeee45","resolution":{"observed_at":"2026-06-29T19:13:53.539382Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.08079/citation-record","integrity":"/paper/2502.08079/integrity","json":"/paper/2502.08079/citation-record.json","paper":"/paper/2502.08079"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:49.144767Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T01:54:36.955555Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.144767Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:93cee8f94e93c23be76539a7963c6a1ef4bb73ec9c53db2151957984ed88fb97","observation_id":"2848a6b5-2686-47f3-ad3e-61d93108a717","resolution":{"observed_at":"2026-08-08T10:56:49.144767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:50.094974Z","title":"Boosting adversarial attacks with momentum","venue":null,"work_id":"76240ba2-71d9-4eef-bd44-94d27ed86b4e","year":2018},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T01:54:36.955555Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.149865Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:ac5d24581e0dfbc1c8cea82e0d34c5a7656f5c5c72ec92cb940bff9a084c5b91","observation_id":"76f46599-2a57-41ca-bd95-a020862e55f9","resolution":{"observed_at":"2026-08-08T10:56:50.099287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:50.082908Z","title":"Evading defenses to transferable adversarial examples by translation-invariant attacks","venue":null,"work_id":"808627c3-0f06-4422-a64f-c6e63f89d366","year":2019},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T01:54:36.955555Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.153482Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:49b5b6e0fbcac9b12d2f45d858d674f03990c244277442b2ce841b7c46003f1e","observation_id":"3edb9ccf-bf08-4d55-83a1-453dfe52578a","resolution":{"observed_at":"2026-08-08T10:56:50.086956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:50.070483Z","title":"An image is worth 16x16 words: transformers for image recognition at scale","venue":null,"work_id":"c0252d9d-861c-47e4-b193-6a48e604bb7b","year":2020},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T01:54:36.955555Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.156934Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:4004aa211076634a03a972dfdc371946ed7e53fadc5bffdd8136ebd10fddff08","observation_id":"9d141539-66d4-401c-8c42-678e10a0322e","resolution":{"observed_at":"2026-08-08T10:56:50.074681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:50.058210Z","title":"Learning to learn transferable attack","venue":null,"work_id":"f4d85aa5-b4af-4fc2-a69c-ded085deda33","year":2022},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T01:54:36.955555Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.160519Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:f61ce0fc23fa518e6c8dc7227fecdead68f42192b9e382166dd0cd3dbf1bd283","observation_id":"d5e299df-70ec-4438-b0f5-929f071f641e","resolution":{"observed_at":"2026-08-08T10:56:50.062432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:50.047851Z","title":"Fda: Feature disruptive attack","venue":null,"work_id":"852b3377-b50e-4715-9e9a-9c5605935967","year":2019},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T01:54:36.955555Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.164184Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:68533901f72179528c0bcf99ea23b9e3bc7300223f6116d0fcfd9199400cd31b","observation_id":"36cd5bca-108d-4491-850f-53b6302c1030","resolution":{"observed_at":"2026-08-08T10:56:50.051470Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:50.037132Z","title":"Boosting transferability in vision-language attacks via diversification along the intersection region of adversarial trajectory","venue":null,"work_id":"8b09d82a-3346-46a3-9ff5-611a1a6fd68c","year":2024},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T01:54:36.955555Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.167768Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:ba3f150d3436819da772b51c0f280f589d7b69c76a817dbc3715e0aa3e6d89dc","observation_id":"288e6807-85af-41c0-a910-1b0424aa098e","resolution":{"observed_at":"2026-08-08T10:56:50.040881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.04913","last_updated":"2023-12-08T09:08:50Z","snapshot_observed_at":"2026-08-07T21:16:58.470052Z","submitted_at":"2023-12-08T09:08:50Z","title":"SA-Attack: Improving Adversarial Transferability of Vision-Language Pre-training Models via Self-Augmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.04913","snapshot_observed_at":"2026-08-08T10:56:49.171617Z","title":"Sa-attack: improving adversarial transferability of vision-language pre-training models via self-augmentation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T01:54:36.955555Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.171617Z"},"links":{"cited_paper":"/paper/2312.04913","citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:037a0db06e04e847671dce5dacfc82ef3ae82858277c76ebc3a601c8510263d6","observation_id":"24c044c8-0174-49a2-9003-9321ec9c3ba3","resolution":{"observed_at":"2026-08-08T10:56:49.171617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:49.178806Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T01:54:36.955555Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.178806Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:849658ccacda43c8d6d8aa23e5acdaf26400d85b1c70b7fa308833c7ef7dc5e0","observation_id":"77f04d8d-c1b9-4a9a-b5b2-a3b4531b8e0c","resolution":{"observed_at":"2026-08-08T10:56:49.178806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:50.019516Z","title":"Natural adversarial examples","venue":null,"work_id":"ffe6b5d1-5de1-4295-abc4-5639153739f6","year":2021},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T01:54:36.955555Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.182988Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:af624a5907ae53ad83726a9c5dceb26ce2465134ea4481adadfac96ec1eb9ff8","observation_id":"9c5a7f62-3d21-4168-af6f-e7ec28333298","resolution":{"observed_at":"2026-08-08T10:56:50.023038Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:50.009267Z","title":"Adversarial examples are not bugs, they are features","venue":null,"work_id":"cf55d28a-8ceb-47a0-95ae-17dbb4825d86","year":2019},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T01:54:36.955555Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.186596Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:8e6218624da1414e821658fca6b41a891364cdfd20ad93331cd9c62125be16ed","observation_id":"5687506a-7ff1-465e-80ed-32af63044224","resolution":{"observed_at":"2026-08-08T10:56:50.012858Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:49.998531Z","title":"Transferable perturbations of deep feature distributions","venue":null,"work_id":"ce9b824d-56c7-4982-9abc-652d63038941","year":2019},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T01:54:36.955555Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.190201Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:0e4ae5aed9d0a7114c0113b49cae6a294538382a5aa151fbb1a8b187028f14ca","observation_id":"68ea14f5-97d5-4610-9d01-39bc5c29721e","resolution":{"observed_at":"2026-08-08T10:56:50.002161Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:49.987646Z","title":"Adversarial example generation with syntactically controlled paraphrase networks","venue":null,"work_id":"59e663ba-03ad-4230-99ef-e21aa84ce891","year":2018},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T01:54:36.955555Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.193816Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:b4f02a2690a95706fa7be042372a2478be6046f5f391be1c497e34f531d642da","observation_id":"12e84fee-c2ff-4bb3-8560-c5ff50b30d21","resolution":{"observed_at":"2026-08-08T10:56:49.991529Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:49.976905Z","title":"Is bert really robust? a strong baseline for natural language attack on text classification and entailment","venue":null,"work_id":"bb5432e6-c9e5-458d-aec9-060f802a5509","year":2020},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T01:54:36.955555Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.197464Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:a24eac9b313502d5c916737ea23be8c56cd9edde4550808136d654dd46ee3ec0","observation_id":"312c34c4-0b5b-4120-9b73-341d470be727","resolution":{"observed_at":"2026-08-08T10:56:49.980878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:49.966558Z","title":"Align before fuse: vision and language representation learning with momentum distillation","venue":null,"work_id":"4a80df8a-7f8b-46b3-bffb-cffe491ef2bf","year":2021},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T01:54:36.955555Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.201301Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:0e96f0efa1a1b90b7a258d20d3da4790f44af62e4ac2cb797156102d7b254c10","observation_id":"55e61711-0a94-4f6f-b8d7-c31189dba137","resolution":{"observed_at":"2026-08-08T10:56:49.970142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:49.956110Z","title":"Blip: bootstrapping language-image pre-training for unified vision-language understanding and generation","venue":null,"work_id":"9a0d6bff-fec0-4169-8fcf-99100e601b04","year":2022},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T01:54:36.955555Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.204924Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:c5ed3db5dcaeaadde83af21786f6054526ab586a8f8658c5b1d451586548b3e5","observation_id":"7f54841a-a7dd-4520-9282-d6993664ae9a","resolution":{"observed_at":"2026-08-08T10:56:49.959748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:49.945034Z","title":"Bert-attack: adversarial attack against bert using bert","venue":null,"work_id":"1a247ee2-dc85-41f5-9700-bcab9cd4f2d7","year":2020},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T01:54:36.955555Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.208859Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:c5edd895de89877e9e3d2e70b18f1c70ce86e982a593f344f8bbd44caf1e9107","observation_id":"c6da15fc-6387-4357-96ab-0d3676caba3a","resolution":{"observed_at":"2026-08-08T10:56:49.948862Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:49.934956Z","title":"Nesterov accelerated gradient and scale invariance for adversarial attacks","venue":null,"work_id":"ef6ab8cf-28ca-4d6b-9330-0f3e8b1f8377","year":2019},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T01:54:36.955555Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.212623Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:d82aa807fa32005d4eca6d3081470fdef5fd3ced270de728e9bd3b359081d5bf","observation_id":"b002cfa9-840a-4733-829a-0ace8b9445d9","resolution":{"observed_at":"2026-08-08T10:56:49.938578Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:49.924112Z","title":"Microsoft coco: common objects in context","venue":null,"work_id":"d3faefdd-75cc-4d16-a4fa-66cf9995f712","year":2014},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T01:54:36.955555Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.216344Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:95e5061097ce078aa03d630d43264c11cca2261e70790e6a9afc4305d73bb440","observation_id":"96d0fde0-55d5-427e-ae05-dfda1b557751","resolution":{"observed_at":"2026-08-08T10:56:49.927870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:49.913352Z","title":"Delving into transferable adversarial examples and black-box attacks","venue":null,"work_id":"620a0ac2-e162-4e53-8949-bcec1f06fe24","year":2016},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T01:54:36.955555Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.220185Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:2e261bfa63d11202f01313afc38d3c5276e3b467a35d79160d56a95674fa28ac","observation_id":"bafd4ac0-2912-40bb-8aa9-b61eeb839ada","resolution":{"observed_at":"2026-08-08T10:56:49.917282Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:49.903218Z","title":"On the convergence of an adaptive momentum method for adversarial attacks","venue":null,"work_id":"f66f1a03-71ba-4be8-97f5-2230badf799a","year":2024},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T01:54:36.955555Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.223900Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:d3abd4c7ed0956476e452e9a8ab79490deb11688f05c2fabe49606942f18e335","observation_id":"c7ed4afb-0228-4fd4-b9bf-fecdff89fe51","resolution":{"observed_at":"2026-08-08T10:56:49.906829Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:49.891906Z","title":"Set-level guidance attack: boosting adversarial transferability of vision-language pre-training models","venue":null,"work_id":"9fd9831c-e14c-4db1-82ac-3f962c7d0a3c","year":2023},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T01:54:36.955555Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.227524Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:bd7ae9aa59560c62bc9ebced4bf06539b122c1b649b5897fb651b176d88a8a79","observation_id":"2775cb01-e92c-45b8-8866-48197dd8f866","resolution":{"observed_at":"2026-08-08T10:56:49.895976Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:49.881424Z","title":"Towards deep learning models resistant to adversarial attacks","venue":null,"work_id":"155c7d6a-9c78-4a24-bd56-86f967dd400d","year":2018},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T01:54:36.955555Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.231249Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:8fc615849420e86584ae4294c4152f3e6e12759804e343350e575b320c16da13","observation_id":"81c48614-8602-4201-9922-5568b37eb5b3","resolution":{"observed_at":"2026-08-08T10:56:49.885014Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:49.871256Z","title":"Universal adversarial perturbations","venue":null,"work_id":"ae010ce9-1ba6-45e2-964e-440433548b87","year":2017},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T01:54:36.955555Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.234966Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:46dfa4a5e19af9098fe77421272b6cbae2d238b4088d3a65be3921cb645ae80d","observation_id":"fb12cd51-67f1-46e8-9db7-3cdead3ca969","resolution":{"observed_at":"2026-08-08T10:56:49.874609Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:49.861346Z","title":"Stress test evaluation for natural language inference","venue":null,"work_id":"7096441a-e737-4430-bff6-6ff9dc161300","year":2018},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T01:54:36.955555Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.238884Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:c90b5cdc49da7e123fc0f826485c356a367190971519ff3300358bb517e40d18","observation_id":"3025e76c-7f95-483e-9469-4e98aad4bfa6","resolution":{"observed_at":"2026-08-08T10:56:49.864898Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:49.851727Z","title":"Cross-domain transferability of adversarial perturbations","venue":null,"work_id":"26645bc0-285d-4ab5-8778-e656bc76c85d","year":2019},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T01:54:36.955555Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.242552Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:b60b7b673d448812ded56b343b943ef4c046a185dcd046b9ee47bfafe1404793","observation_id":"3405c873-a85c-4cde-b3a3-b079bb87c7b1","resolution":{"observed_at":"2026-08-08T10:56:49.855199Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:49.841304Z","title":"Flickr30k entities: collecting region-to-phrase correspondences for richer image-to-sentence models","venue":null,"work_id":"ddf61e9e-b8bc-4c8d-89a3-fdfeded89e97","year":2015},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T01:54:36.955555Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.246426Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:8d4c080d627a508d6127a41870b9579b0efe7a5997664f789efbcd27b56b0dad","observation_id":"cb289f9d-d767-47b5-a6f3-8ee47f037b98","resolution":{"observed_at":"2026-08-08T10:56:49.845430Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:49.830589Z","title":"Generative adversarial perturbations","venue":null,"work_id":"eced1c65-10f0-47df-ac2b-8c62e8951083","year":2018},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T01:54:36.955555Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.250073Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:456dd8941c211ba74864c7dbeefb87b3f96457c569f12d5509817b05a0246373","observation_id":"4085db41-a8eb-4c4e-b4c2-4bea601d55bd","resolution":{"observed_at":"2026-08-08T10:56:49.834367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:49.819313Z","title":"Understanding and improving robustness of vision transformers through patch-based negative augmentation","venue":null,"work_id":"36ac83f8-4684-4e7e-8368-271f8c1c0531","year":2022},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T01:54:36.955555Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.253570Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:a0d4cd1414f365c298dff2a5b08ac269049568d40011dc6f392638e47d50da70","observation_id":"5f0dcf48-10b8-4ac6-9699-b9382ae7a729","resolution":{"observed_at":"2026-08-08T10:56:49.823406Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:49.809150Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"a8e4fa27-6de7-46ab-9b19-22f0fecd8bac","year":2021},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T01:54:36.955555Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.256879Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:b5ea3dc4ccdf9c83fd569892d9f02a3a7b1061363a27a7809b8c5b49c9be3557","observation_id":"d4be6507-252e-4405-98c6-e8350b275e75","resolution":{"observed_at":"2026-08-08T10:56:49.812991Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:49.799308Z","title":"Generating natural language adversarial examples through probability weighted word saliency","venue":null,"work_id":"901fd0ab-ccc0-488d-bb94-817a6b551bf5","year":2019},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T01:54:36.955555Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.260070Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:7c3d80b481a2d2386058d95d5f7a7d1c5ba9b394ca7f79287efdf6d7bf529fcb","observation_id":"8f8fd580-1f33-4bfc-8a26-56f4e252420e","resolution":{"observed_at":"2026-08-08T10:56:49.803054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:49.789074Z","title":"Grad-cam: visual explanations from deep networks via gradient-based localization","venue":null,"work_id":"a15365f1-7ea0-46bf-9bfb-ecb7a844ffb7","year":2017},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T01:54:36.955555Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.263253Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:491df4409e7917a6613b5eda3d848cc136d9c939826dffa1fbb31cf9f6afe971","observation_id":"bd1b5807-5191-4beb-be5e-f9a78cdd4fef","resolution":{"observed_at":"2026-08-08T10:56:49.792921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:49.778297Z","title":"Intriguing properties of neural networks","venue":null,"work_id":"6397cd83-62b3-422e-a569-2745dc583d6c","year":2014},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T01:54:36.955555Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.266705Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:b53550c91601d669ca1d5f8eb2d9f04c4d7dd33d4bf7e9b8660148a1b865e4d4","observation_id":"c4439e56-3763-4940-a524-df6aa052b7f8","resolution":{"observed_at":"2026-08-08T10:56:49.781913Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-08T10:56:49.270016Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T01:54:36.955555Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.270016Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:90cb8a5e959c53142b2642e2c36766dc2ee7305b1a8a60de230e0b48ae92796c","observation_id":"99c6b732-090c-4084-b246-8f5da860144b","resolution":{"observed_at":"2026-08-08T10:56:49.270016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:49.768194Z","title":"Boosting adversarial transferability by block shuffle and rotation","venue":null,"work_id":"f34dbc34-7b97-408c-93c6-0c5e28c9a573","year":2024},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T01:54:36.955555Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.273636Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:6345a31b44f8f4b03cda2bc0acae3df0ed9f83e4d609020e91b994430d9600c2","observation_id":"0d3b3747-ed78-406a-9fd0-566f9406bb24","resolution":{"observed_at":"2026-08-08T10:56:49.771753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:49.757905Z","title":"Admix: enhancing the transferability of adversarial attacks","venue":null,"work_id":"500bebc5-ba08-4628-8d6e-b69b362a4bf8","year":2021},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T01:54:36.955555Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.277115Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:a765c343c982283e764c2b7683eadddb1ea06db30b4ef1aeaa14eed2771db246","observation_id":"96a9a253-6bc9-4c96-aa3a-e1499b4b2917","resolution":{"observed_at":"2026-08-08T10:56:49.761626Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:49.747931Z","title":"Structure invariant transformation for better adversarial transferability","venue":null,"work_id":"e791a86c-319c-4b2d-b7d4-5dcf2fece94b","year":2023},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T01:54:36.955555Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.281062Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:aad023ab6000645a2f69db198799d1624c19bedcadbc031e461552955f3a91ee","observation_id":"f5d7deaa-4086-4c1a-b6a6-f07606e4263c","resolution":{"observed_at":"2026-08-08T10:56:49.751441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:49.737904Z","title":"Prototype-supervised adversarial network for targeted attack of deep hashing","venue":null,"work_id":"26a6200d-197b-49ab-983b-d1f6b78ccbe9","year":2021},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T01:54:36.955555Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.284908Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:2ebd35045f1ab4513bdcb724a94dd5f0fef160a8aee65f72a4d37e936af755ca","observation_id":"6aa0cbd8-4caa-4d11-b329-16a74158483d","resolution":{"observed_at":"2026-08-08T10:56:49.741500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:49.727873Z","title":"Enhancing the self-universality for transferable targeted attacks","venue":null,"work_id":"42bf35f9-0b33-41e6-a5ae-b187867b0964","year":2023},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T01:54:36.955555Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.288931Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:5b8950633b53c7b4c1c7856405d959fa50a185c5cf7b77e6c049688b64700e1f","observation_id":"f6dbda94-6773-481f-bdc3-e92eb54b30bd","resolution":{"observed_at":"2026-08-08T10:56:49.731545Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:49.717831Z","title":"Improving transferability of adversarial examples with input diversity","venue":null,"work_id":"cea0cde4-be73-48e6-ac2b-c63bc4070eb9","year":2019},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T01:54:36.955555Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.293250Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:5428d8bb46246fdbb1d1fb905fa13ae87885b17b306d275768fdbe1872ef5784","observation_id":"fda6f140-8c2e-4852-b375-094502d72b81","resolution":{"observed_at":"2026-08-08T10:56:49.721517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:49.707251Z","title":"Stochastic variance reduced ensemble adversarial attack for boosting the adversarial transferability","venue":null,"work_id":"18919565-dbae-4d6c-8458-a6f73db40db8","year":2022},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T01:54:36.955555Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.297758Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:1c3800f7f932e0181b570164c7b015dcad44cc759e2a33da54508296840b62c1","observation_id":"5e71f3d3-3b59-457b-967e-1be82a75409c","resolution":{"observed_at":"2026-08-08T10:56:49.711242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:49.696822Z","title":"Fooling vision and language models despite localization and attention mechanism","venue":null,"work_id":"28f67bf9-54a8-4e1f-b7c6-f3bd2fe15b34","year":2018},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T01:54:36.955555Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.301868Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:bf6dda8b1b9a2d5ed26ef2754cee337c82ecc8d1492036c8af2ebf51dd93928d","observation_id":"ecaaa87b-9ffa-4209-9822-279fc5beb2d9","resolution":{"observed_at":"2026-08-08T10:56:49.700452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:49.686670Z","title":"Vision-language pre-training with triple contrastive learning","venue":null,"work_id":"ba5ffb8c-f38c-4148-a565-6bba1a3d4491","year":2022},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T01:54:36.955555Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.305951Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:8da816260f1e20dad06ba1ba46fe1b2da6a19a50f082644551720c9dc797fbdd","observation_id":"888fc5f3-6fb5-42b2-b3d7-5ee2e8dc7c6c","resolution":{"observed_at":"2026-08-08T10:56:49.690292Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:49.675166Z","title":"Vlattack: multimodal adversarial attacks on vision-language tasks via pre-trained models","venue":null,"work_id":"67f0fede-7866-4420-829d-69ee60707be5","year":2023},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T01:54:36.955555Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.310171Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:12784e2c1c1afd31a2e0dd5b91bae1f4d283a04781f80f594ab2fb4c6d35e636","observation_id":"c2dfbaf8-318c-4e0f-b4aa-67d4b4a51b9c","resolution":{"observed_at":"2026-08-08T10:56:49.678987Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:49.663962Z","title":"Modeling context in referring expressions","venue":null,"work_id":"d6801aba-7f93-4ccf-b199-320cd104ec93","year":2016},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T01:54:36.955555Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.314387Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:046b66cf1a1b8b0a0cfc92928a10d91b7cbf4ac8b7e12e7bc28a02b96c07e6e5","observation_id":"edf623ac-c007-4737-944f-190f137a897b","resolution":{"observed_at":"2026-08-08T10:56:49.667614Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:49.653633Z","title":"Towards adversarial attack on vision-language pre-training models","venue":null,"work_id":"11157f0a-f019-4b2e-be2a-c175453bf41f","year":2022},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T01:54:36.955555Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.318253Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:d9456d99ceab26a0e2f832c4b6719c2bbed6cd790ad5c2b22d98eb836f8278d7","observation_id":"5741ff4e-e0cb-4eab-90a1-71231416a415","resolution":{"observed_at":"2026-08-08T10:56:49.657490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:49.640896Z","title":"A survey on image perturbations for model robustness: Attacks and defenses","venue":null,"work_id":"db85db02-235f-4b4d-b29b-a60fc93ab79e","year":2024},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T01:54:36.955555Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.322097Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:bba373a4fbe05102d6fe9a9d718af44e8cd53a70624ca1878161bedb20d97340","observation_id":"cb8b687b-c41a-4492-97b3-78c5506068f3","resolution":{"observed_at":"2026-08-08T10:56:49.645257Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:49.628382Z","title":"Privacy protection in deep multi-modal retrieval","venue":null,"work_id":"5f584f73-e334-4b8b-955b-6409c86afc4f","year":2021},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T01:54:36.955555Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.326098Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:ba047f0b5a67e0fc9c66a7db30f2fe5cea62abdf56c1a02cb66b1061a67b2963","observation_id":"f07c36e4-e152-4c8c-b78b-ac0dca51c499","resolution":{"observed_at":"2026-08-08T10:56:49.632590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:49.616065Z","title":"Proactive privacy-preserving learning for cross-modal retrieval","venue":null,"work_id":"ae9201b7-6412-42dc-8250-a729ff0cc545","year":2023},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T01:54:36.955555Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.329990Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:9fe42cd2ed1b87b23f5d208aec6ebb975936cede718a2752bc73fae305b86016","observation_id":"9b302deb-489f-498b-8e52-090aacccef3a","resolution":{"observed_at":"2026-08-08T10:56:49.619918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:49.604324Z","title":"Universal adversarial perturbations for vision-language pre-trained models","venue":null,"work_id":"874ecac8-7326-40c0-984f-098017e8fc40","year":2024},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T01:54:36.955555Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.334234Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:b0610541cab17a80c125168b11366fd4453da8171681f05eb4497026700aa2d8","observation_id":"8a5a04e2-34a2-4d74-a815-8a09114ab739","resolution":{"observed_at":"2026-08-08T10:56:49.607854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:49.593299Z","title":"Adversarial robustness through the lens of causality","venue":null,"work_id":"b6730feb-0f04-4a3e-b190-7a2829ec3863","year":2021},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T01:54:36.955555Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.338614Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:a6fe72d8d19b71f5ec7efc81daff2dfa051f4cf0a109ac911edd4a7dec60ad2c","observation_id":"76631142-aaed-4cdb-94b7-66bc0c74de0f","resolution":{"observed_at":"2026-08-08T10:56:49.597241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:49.581076Z","title":"On evaluating adversarial robustness of large vision-language models","venue":null,"work_id":"f35ac53e-9167-4489-a78a-270ce1378da5","year":2023},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T01:54:36.955555Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.343173Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:bc6b8dd9843ffbacb2e70c4695c606d4c09a83b2a8430708e7696e8482b0a8b2","observation_id":"cc264f0a-8933-4f94-8e33-f196550a1a5e","resolution":{"observed_at":"2026-08-08T10:56:49.585539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-08T10:56:49.347950Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T01:54:36.955555Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.347950Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:95782c15d3e83f9e14bb3964dadc3e7c7421e2f77cab77251ec9fb7366ef2de4","observation_id":"fbc2d895-c296-4e22-a100-2e5f2d1a991c","resolution":{"observed_at":"2026-08-08T10:56:49.347950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:49.569021Z","title":"Efficient query-based black-box attack against cross-modal hashing retrieval","venue":null,"work_id":"9d4d44f7-0e90-44f5-98e3-02ac01ac0dea","year":2023},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T01:54:36.955555Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.352420Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:7c6700d6ba40d8f81e38d3364f38e012cd4699c88c14d0f9bc67f01c982b6324","observation_id":"673301c2-5dba-4ba0-a2f9-88789fb754b6","resolution":{"observed_at":"2026-08-08T10:56:49.572974Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:49.356705Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T01:54:36.955555Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.356705Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:55515f564e3f7917e30fd50223813d8b691aa05779a9d8ebcd3d750bbd086dcd","observation_id":"15c5ac08-355d-4e85-870c-cd0bfcb83864","resolution":{"observed_at":"2026-08-08T10:56:49.356705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:49.361124Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T01:54:36.955555Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.361124Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:7c484eba892125cd513a44ad64143ad5e8ec91f647d2a04f31259faa85a20a94","observation_id":"53e65c87-201d-4ac7-9b45-ebd2575f6f8c","resolution":{"observed_at":"2026-08-08T10:56:49.361124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:49.540465Z","title":"X\"bDls= L9 l֡33*!ںj@vp?3m endstream endobj 26 0 obj << /Filter /FlateDecode /Length 249 >> stream xMQI 0 @!^CC 9 X 1 ,=!s7 ٻYz","venue":null,"work_id":"7e8b2c80-cba2-4cfd-be39-670fe905eac5","year":null},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T01:54:36.955555Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.365745Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:aa9c291978e23e3daaa991691382bdb69e310aaf482e8ff35fff14f299468da6","observation_id":"6ee93ebd-370d-4942-9946-b4ea05a46028","resolution":{"observed_at":"2026-08-08T10:56:49.546357Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T01:54:36.955555Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":7,"verified_exact":0,"verified_fuzzy":49},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 2 inbound Pith citation observations for arXiv:2502.08079."}