{"as_of":"2026-08-19T20:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a535a10192e9b9b7c5a69cb8be2fb1c70182f49a518104f69eabd1e94c7251f4","coverage":[{"denominator":61,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":61,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T13:51:21.314012Z","state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.18958/citation-record","integrity":"/paper/2607.18958/integrity","json":"/paper/2607.18958/citation-record.json","paper":"/paper/2607.18958"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:51:20.846210Z","title":"Improved baselines with visual instruction tuning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18958","last_updated":"2026-07-21T10:49:29Z","snapshot_observed_at":"2026-08-16T13:21:59.428143Z","submitted_at":"2026-07-21T10:49:29Z","title":"Dual Adversarial Fine-tuning for Enhancing Robustness of Large Vision Language Model","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T13:51:20.846210Z"},"links":{"citing_paper":"/paper/2607.18958"},"observation_digest":"sha256:6de0e00636f217e1aa7fee1b8c302d57ed018b06aa229ccf9e890f4aec26e0d9","observation_id":"e86f5ceb-6d13-4cb1-9b96-99e66cbdf918","resolution":{"observed_at":"2026-08-01T13:51:20.846210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:51:20.954281Z","title":"Visual instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18958","last_updated":"2026-07-21T10:49:29Z","snapshot_observed_at":"2026-08-16T13:21:59.428143Z","submitted_at":"2026-07-21T10:49:29Z","title":"Dual Adversarial Fine-tuning for Enhancing Robustness of Large Vision Language Model","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T13:51:20.954281Z"},"links":{"citing_paper":"/paper/2607.18958"},"observation_digest":"sha256:f2dbbe39cdd9db7415c39c0532541229e7abdee98799cb9596e49052bd1edc3c","observation_id":"897f254f-9060-4897-ad67-134a5d0204f3","resolution":{"observed_at":"2026-08-01T13:51:20.954281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:51:21.079625Z","title":"MiniGPT-4: Enhancing vision-language understanding with advanced large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18958","last_updated":"2026-07-21T10:49:29Z","snapshot_observed_at":"2026-08-16T13:21:59.428143Z","submitted_at":"2026-07-21T10:49:29Z","title":"Dual Adversarial Fine-tuning for Enhancing Robustness of Large Vision Language Model","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T13:51:21.079625Z"},"links":{"citing_paper":"/paper/2607.18958"},"observation_digest":"sha256:ef9c6443b7265b70495213e60aa8ae6987832c792f360579f9ad2513420bf59d","observation_id":"15320d7f-2bef-416e-8d67-50b98ea64558","resolution":{"observed_at":"2026-08-01T13:51:21.079625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:51:21.082241Z","title":"VisualGPT: Data- efficient adaptation of pretrained language models for image captioning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.18958","last_updated":"2026-07-21T10:49:29Z","snapshot_observed_at":"2026-08-16T13:21:59.428143Z","submitted_at":"2026-07-21T10:49:29Z","title":"Dual Adversarial Fine-tuning for Enhancing Robustness of Large Vision Language Model","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T13:51:21.082241Z"},"links":{"citing_paper":"/paper/2607.18958"},"observation_digest":"sha256:360bc0fa47b4870225f34c94162fe0d6b77203ac8b65575f838f91f98b4b2965","observation_id":"3eddf7f0-7c4b-4664-9b82-e80b160f1bd0","resolution":{"observed_at":"2026-08-01T13:51:21.082241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:51:21.102612Z","title":"Scaling up visual and vision-language representation learning with noisy text supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.18958","last_updated":"2026-07-21T10:49:29Z","snapshot_observed_at":"2026-08-16T13:21:59.428143Z","submitted_at":"2026-07-21T10:49:29Z","title":"Dual Adversarial Fine-tuning for Enhancing Robustness of Large Vision Language Model","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T13:51:21.102612Z"},"links":{"citing_paper":"/paper/2607.18958"},"observation_digest":"sha256:a91076ed8c186fa69c35d9788595a6818f8a01f713d7c130aa5768e24cea6de5","observation_id":"90d9ecca-f7a3-4bd2-9e78-0c91846239c2","resolution":{"observed_at":"2026-08-01T13:51:21.102612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:51:21.155200Z","title":"Adapting multimodal large language models for video question answering by capturing question-critical and coherent moments,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18958","last_updated":"2026-07-21T10:49:29Z","snapshot_observed_at":"2026-08-16T13:21:59.428143Z","submitted_at":"2026-07-21T10:49:29Z","title":"Dual Adversarial Fine-tuning for Enhancing Robustness of Large Vision Language Model","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T13:51:21.155200Z"},"links":{"citing_paper":"/paper/2607.18958"},"observation_digest":"sha256:a23a1c651d9b778e7cca235e35f97b3f649b7c7e733cf21f2d375fd168092886","observation_id":"a1a3d2eb-2bed-4b1b-be52-73b7730b9fe2","resolution":{"observed_at":"2026-08-01T13:51:21.155200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:51:21.165079Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.18958","last_updated":"2026-07-21T10:49:29Z","snapshot_observed_at":"2026-08-16T13:21:59.428143Z","submitted_at":"2026-07-21T10:49:29Z","title":"Dual Adversarial Fine-tuning for Enhancing Robustness of Large Vision Language Model","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T13:51:21.165079Z"},"links":{"citing_paper":"/paper/2607.18958"},"observation_digest":"sha256:9fe1c431e5a411a0672000eb21623eefee3be5d287db34546ca235f10c61a9fc","observation_id":"2a06d98d-0fda-4d04-9756-cd6cc847735b","resolution":{"observed_at":"2026-08-01T13:51:21.165079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:51:21.207587Z","title":"MoE-LLaV A: Mixture of experts for large vision- language models,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18958","last_updated":"2026-07-21T10:49:29Z","snapshot_observed_at":"2026-08-16T13:21:59.428143Z","submitted_at":"2026-07-21T10:49:29Z","title":"Dual Adversarial Fine-tuning for Enhancing Robustness of Large Vision Language Model","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T13:51:21.207587Z"},"links":{"citing_paper":"/paper/2607.18958"},"observation_digest":"sha256:940b4433302963e11655903ff1a87f28663c3db82a44fda0bb077178ef355d68","observation_id":"12f40afe-1631-4417-88a1-f3c86fb2b1de","resolution":{"observed_at":"2026-08-01T13:51:21.207587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:51:21.210096Z","title":"Vicuna: An open-source chatbot impressing GPT-4 with 90%* ChatGPT quality,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18958","last_updated":"2026-07-21T10:49:29Z","snapshot_observed_at":"2026-08-16T13:21:59.428143Z","submitted_at":"2026-07-21T10:49:29Z","title":"Dual Adversarial Fine-tuning for Enhancing Robustness of Large Vision Language Model","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T13:51:21.210096Z"},"links":{"citing_paper":"/paper/2607.18958"},"observation_digest":"sha256:232abb7bc40af20ca74479e00216bf1dcb7a988782b6bb939d66b1c0e8f62e8e","observation_id":"cdd7ed22-bb76-4011-8970-3fa67b92f0e3","resolution":{"observed_at":"2026-08-01T13:51:21.210096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:51:21.212170Z","title":"On evaluating adversarial robustness of large vision-language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18958","last_updated":"2026-07-21T10:49:29Z","snapshot_observed_at":"2026-08-16T13:21:59.428143Z","submitted_at":"2026-07-21T10:49:29Z","title":"Dual Adversarial Fine-tuning for Enhancing Robustness of Large Vision Language Model","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T13:51:21.212170Z"},"links":{"citing_paper":"/paper/2607.18958"},"observation_digest":"sha256:4174985d500368bbbd84f60c159a2b6bb605f73acbcdf1085ed6e52420e03ea8","observation_id":"079c2e7c-ef68-4a16-815e-4989f1412047","resolution":{"observed_at":"2026-08-01T13:51:21.212170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:51:21.214143Z","title":"On the adversarial robustness of multi- modal foundation models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18958","last_updated":"2026-07-21T10:49:29Z","snapshot_observed_at":"2026-08-16T13:21:59.428143Z","submitted_at":"2026-07-21T10:49:29Z","title":"Dual Adversarial Fine-tuning for Enhancing Robustness of Large Vision Language Model","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T13:51:21.214143Z"},"links":{"citing_paper":"/paper/2607.18958"},"observation_digest":"sha256:29a6acc521d8fdbc12417004615d16831db3e9267378f84d1595fdc0be597d46","observation_id":"164b444f-0f0e-4263-b9c4-37456b8f61f3","resolution":{"observed_at":"2026-08-01T13:51:21.214143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:51:21.216390Z","title":"Are aligned neural networks adversarially aligned?","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18958","last_updated":"2026-07-21T10:49:29Z","snapshot_observed_at":"2026-08-16T13:21:59.428143Z","submitted_at":"2026-07-21T10:49:29Z","title":"Dual Adversarial Fine-tuning for Enhancing Robustness of Large Vision Language Model","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T13:51:21.216390Z"},"links":{"citing_paper":"/paper/2607.18958"},"observation_digest":"sha256:93f64d282c5a5f2c112ab26b8f6b167b1b994ea93fe678fb3719a0896899c57b","observation_id":"785c7e2a-7414-4a7a-ac3a-a8273b4dc8c5","resolution":{"observed_at":"2026-08-01T13:51:21.216390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11751","last_updated":"2023-10-14T12:56:13Z","snapshot_observed_at":"2026-08-16T14:58:55.951885Z","submitted_at":"2023-09-21T03:24:30Z","title":"How Robust is Google's Bard to Adversarial Image Attacks?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11751","snapshot_observed_at":"2026-08-01T13:51:21.218412Z","title":"How robust is Google’s Bard to adversarial image attacks?","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18958","last_updated":"2026-07-21T10:49:29Z","snapshot_observed_at":"2026-08-16T13:21:59.428143Z","submitted_at":"2026-07-21T10:49:29Z","title":"Dual Adversarial Fine-tuning for Enhancing Robustness of Large Vision Language Model","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T13:51:21.218412Z"},"links":{"cited_paper":"/paper/2309.11751","citing_paper":"/paper/2607.18958"},"observation_digest":"sha256:b545825477bca06c8bc1b086e9d6e64795bd55af4a5940fbdb04c82b88250a63","observation_id":"72348382-e4f1-4b55-a73a-4db267e12b10","resolution":{"observed_at":"2026-08-01T13:51:21.218412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:51:21.220735Z","title":"Towards evaluating the robustness of neural networks,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.18958","last_updated":"2026-07-21T10:49:29Z","snapshot_observed_at":"2026-08-16T13:21:59.428143Z","submitted_at":"2026-07-21T10:49:29Z","title":"Dual Adversarial Fine-tuning for Enhancing Robustness of Large Vision Language Model","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T13:51:21.220735Z"},"links":{"citing_paper":"/paper/2607.18958"},"observation_digest":"sha256:bbaa2704a03475a42fead72c2eea2368af8c6750dc6d71bf7cedf25aab863744","observation_id":"4bd9fb85-c43b-47ea-9daa-c1afa33c5326","resolution":{"observed_at":"2026-08-01T13:51:21.220735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:51:21.222634Z","title":"Explaining and harnessing adversarial examples,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.18958","last_updated":"2026-07-21T10:49:29Z","snapshot_observed_at":"2026-08-16T13:21:59.428143Z","submitted_at":"2026-07-21T10:49:29Z","title":"Dual Adversarial Fine-tuning for Enhancing Robustness of Large Vision Language Model","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T13:51:21.222634Z"},"links":{"citing_paper":"/paper/2607.18958"},"observation_digest":"sha256:a054137ab82a4c4470d1c73945c19873ecda17085b3b813b3a7fa6ae4fb3ea2c","observation_id":"ffa632ac-88ec-48a0-93df-d93c3be202cf","resolution":{"observed_at":"2026-08-01T13:51:21.222634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:51:21.224568Z","title":"Towards deep learning models resistant to adversarial attacks,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.18958","last_updated":"2026-07-21T10:49:29Z","snapshot_observed_at":"2026-08-16T13:21:59.428143Z","submitted_at":"2026-07-21T10:49:29Z","title":"Dual Adversarial Fine-tuning for Enhancing Robustness of Large Vision Language Model","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T13:51:21.224568Z"},"links":{"citing_paper":"/paper/2607.18958"},"observation_digest":"sha256:6e11fb6607efbf09a7d771faf90900b40a3279bfbf53509dd948d569abf1a4d9","observation_id":"4fa229c6-6026-4ee2-891c-704b46e46fce","resolution":{"observed_at":"2026-08-01T13:51:21.224568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-08-12T09:06:50.363435Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-01T13:51:21.226782Z","title":"Universal and transferable adversarial attacks on aligned language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18958","last_updated":"2026-07-21T10:49:29Z","snapshot_observed_at":"2026-08-16T13:21:59.428143Z","submitted_at":"2026-07-21T10:49:29Z","title":"Dual Adversarial Fine-tuning for Enhancing Robustness of Large Vision Language Model","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T13:51:21.226782Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2607.18958"},"observation_digest":"sha256:e3ba30aac3891ae005035eeb5e460c0a198c5194173f2efc630dafbec7c359b9","observation_id":"75a916ce-a1d8-4b91-a118-c19cb3c23b8b","resolution":{"observed_at":"2026-08-01T13:51:21.226782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:51:21.229212Z","title":"Understanding zero-shot adversarial robustness for large-scale models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18958","last_updated":"2026-07-21T10:49:29Z","snapshot_observed_at":"2026-08-16T13:21:59.428143Z","submitted_at":"2026-07-21T10:49:29Z","title":"Dual Adversarial Fine-tuning for Enhancing Robustness of Large Vision Language Model","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T13:51:21.229212Z"},"links":{"citing_paper":"/paper/2607.18958"},"observation_digest":"sha256:20182d4308f04d51154e9400f1635efa602eac5c65750efe686949ce67ef550f","observation_id":"849e3567-a82f-4a47-b1cb-c2343356189e","resolution":{"observed_at":"2026-08-01T13:51:21.229212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:51:21.231133Z","title":"Robust CLIP: Unsupervised adversarial fine-tuning of vision embeddings for robust large vision-language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18958","last_updated":"2026-07-21T10:49:29Z","snapshot_observed_at":"2026-08-16T13:21:59.428143Z","submitted_at":"2026-07-21T10:49:29Z","title":"Dual Adversarial Fine-tuning for Enhancing Robustness of Large Vision Language Model","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T13:51:21.231133Z"},"links":{"citing_paper":"/paper/2607.18958"},"observation_digest":"sha256:83f088787bb307cb6d76f45718d5db5816415cacf67788b102c6c2a7f5e14beb","observation_id":"4328eecf-ad24-4a47-b5c9-3fdf1193fda9","resolution":{"observed_at":"2026-08-01T13:51:21.231133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:51:21.233131Z","title":"Bag of tricks for adversarial training,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.18958","last_updated":"2026-07-21T10:49:29Z","snapshot_observed_at":"2026-08-16T13:21:59.428143Z","submitted_at":"2026-07-21T10:49:29Z","title":"Dual Adversarial Fine-tuning for Enhancing Robustness of Large Vision Language Model","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T13:51:21.233131Z"},"links":{"citing_paper":"/paper/2607.18958"},"observation_digest":"sha256:256effd85dd85623e64b67497dec34b708cf9e557a5420828fbb4ab167f3c0b3","observation_id":"6cd7e1b4-bb88-46c3-a360-6608dc9e870c","resolution":{"observed_at":"2026-08-01T13:51:21.233131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:51:21.235295Z","title":"Adversarial training for free!","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.18958","last_updated":"2026-07-21T10:49:29Z","snapshot_observed_at":"2026-08-16T13:21:59.428143Z","submitted_at":"2026-07-21T10:49:29Z","title":"Dual Adversarial Fine-tuning for Enhancing Robustness of Large Vision Language Model","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T13:51:21.235295Z"},"links":{"citing_paper":"/paper/2607.18958"},"observation_digest":"sha256:63d20245ac13d386847fcb821235575f42a56dc96d735bb2f10638a03d7f888c","observation_id":"b174008f-4cb3-4ac9-b7bb-5d2ac8f574f9","resolution":{"observed_at":"2026-08-01T13:51:21.235295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:51:21.237202Z","title":"Theoretically principled trade-off between robustness and accuracy,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.18958","last_updated":"2026-07-21T10:49:29Z","snapshot_observed_at":"2026-08-16T13:21:59.428143Z","submitted_at":"2026-07-21T10:49:29Z","title":"Dual Adversarial Fine-tuning for Enhancing Robustness of Large Vision Language Model","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T13:51:21.237202Z"},"links":{"citing_paper":"/paper/2607.18958"},"observation_digest":"sha256:25e25f670c6abfae46427c4fc97f3d56ea92f0b4c4b20a76f1b36ef7ef6c9b2c","observation_id":"20c5e6e6-4567-4061-a160-74ca507d6143","resolution":{"observed_at":"2026-08-01T13:51:21.237202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:51:21.239124Z","title":"Pre-trained model guided fine-tuning for zero-shot adversarial robustness,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18958","last_updated":"2026-07-21T10:49:29Z","snapshot_observed_at":"2026-08-16T13:21:59.428143Z","submitted_at":"2026-07-21T10:49:29Z","title":"Dual Adversarial Fine-tuning for Enhancing Robustness of Large Vision Language Model","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T13:51:21.239124Z"},"links":{"citing_paper":"/paper/2607.18958"},"observation_digest":"sha256:90dee52193d67c45c5a700841ffe1d4df71bf9ae4197d1bbe7794ef297a5453e","observation_id":"5bdd8266-a573-4b17-9166-46a704cc9ccd","resolution":{"observed_at":"2026-08-01T13:51:21.239124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:51:21.240991Z","title":"ImageNet: A large-scale hierarchical image database,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2607.18958","last_updated":"2026-07-21T10:49:29Z","snapshot_observed_at":"2026-08-16T13:21:59.428143Z","submitted_at":"2026-07-21T10:49:29Z","title":"Dual Adversarial Fine-tuning for Enhancing Robustness of Large Vision Language Model","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T13:51:21.240991Z"},"links":{"citing_paper":"/paper/2607.18958"},"observation_digest":"sha256:f6854c4ae0c080c34df07d3c2a632b8701fc306efd2109ad9c4f62cfa9c27f3b","observation_id":"49de1d72-1176-486f-89e8-100d5f5e0885","resolution":{"observed_at":"2026-08-01T13:51:21.240991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:51:21.242871Z","title":"Towards adversarial attack on vision- language pre-training models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.18958","last_updated":"2026-07-21T10:49:29Z","snapshot_observed_at":"2026-08-16T13:21:59.428143Z","submitted_at":"2026-07-21T10:49:29Z","title":"Dual Adversarial Fine-tuning for Enhancing Robustness of Large Vision Language Model","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T13:51:21.242871Z"},"links":{"citing_paper":"/paper/2607.18958"},"observation_digest":"sha256:f16ce936260738dd79dc39c7c18e7adef11438cb29b66f92e851f2ec3885478e","observation_id":"32cd3904-0de6-4cbe-8e6f-c6f71b99ab99","resolution":{"observed_at":"2026-08-01T13:51:21.242871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:51:21.244883Z","title":"Exploring transferability of multimodal adversarial samples for vision-language pre-training models with contrastive learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18958","last_updated":"2026-07-21T10:49:29Z","snapshot_observed_at":"2026-08-16T13:21:59.428143Z","submitted_at":"2026-07-21T10:49:29Z","title":"Dual Adversarial Fine-tuning for Enhancing Robustness of Large Vision Language Model","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T13:51:21.244883Z"},"links":{"citing_paper":"/paper/2607.18958"},"observation_digest":"sha256:9800cbb15f39172b1201ef0db773a73448f9cf963c67063ed29d9b312fb66aea","observation_id":"ccb3e61f-3fc7-46fd-9aa7-636a73e0981e","resolution":{"observed_at":"2026-08-01T13:51:21.244883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:51:21.246779Z","title":"Enhancing descriptive captions with visual attributes for multimodal perception,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18958","last_updated":"2026-07-21T10:49:29Z","snapshot_observed_at":"2026-08-16T13:21:59.428143Z","submitted_at":"2026-07-21T10:49:29Z","title":"Dual Adversarial Fine-tuning for Enhancing Robustness of Large Vision Language Model","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T13:51:21.246779Z"},"links":{"citing_paper":"/paper/2607.18958"},"observation_digest":"sha256:b5bcc0a42b4ee06e87bf50a7c07547ae759457a8e4afa0f10ca07a290799614b","observation_id":"b6da57d6-9435-4598-a48d-6f2cdc9e8780","resolution":{"observed_at":"2026-08-01T13:51:21.246779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:51:21.248770Z","title":"Prefix conditioning unifies language and label supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18958","last_updated":"2026-07-21T10:49:29Z","snapshot_observed_at":"2026-08-16T13:21:59.428143Z","submitted_at":"2026-07-21T10:49:29Z","title":"Dual Adversarial Fine-tuning for Enhancing Robustness of Large Vision Language Model","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T13:51:21.248770Z"},"links":{"citing_paper":"/paper/2607.18958"},"observation_digest":"sha256:5cb68562718f4d960b6b326349a514bef4d200c8c803b5b8bccd3e393dbcae9f","observation_id":"0aa53f28-0843-4a2b-81ea-09f6898e4d00","resolution":{"observed_at":"2026-08-01T13:51:21.248770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:51:21.250604Z","title":"Quality text, robust vision: The role of language in enhancing visual robustness of vision-language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18958","last_updated":"2026-07-21T10:49:29Z","snapshot_observed_at":"2026-08-16T13:21:59.428143Z","submitted_at":"2026-07-21T10:49:29Z","title":"Dual Adversarial Fine-tuning for Enhancing Robustness of Large Vision Language Model","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T13:51:21.250604Z"},"links":{"citing_paper":"/paper/2607.18958"},"observation_digest":"sha256:c8127c5d568ad80e71d4d4c5141e16b6f37b88cae74519d2ce80d7be5195dbef","observation_id":"9be87bc1-f9ba-4a73-9ec2-be007d6aa00c","resolution":{"observed_at":"2026-08-01T13:51:21.250604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:51:21.252494Z","title":"BLIP-2: Bootstrapping language- image pre-training with frozen image encoders and large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18958","last_updated":"2026-07-21T10:49:29Z","snapshot_observed_at":"2026-08-16T13:21:59.428143Z","submitted_at":"2026-07-21T10:49:29Z","title":"Dual Adversarial Fine-tuning for Enhancing Robustness of Large Vision Language Model","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T13:51:21.252494Z"},"links":{"citing_paper":"/paper/2607.18958"},"observation_digest":"sha256:021cc85dfdba67e5711963cc84269b6f4a2c8bda603bb6923ecf345b06ff7994","observation_id":"90dbbe90-0803-4b5c-9aea-3737d1d56409","resolution":{"observed_at":"2026-08-01T13:51:21.252494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:51:21.254486Z","title":"Otter: A multi-modal model with in-context instruction tuning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18958","last_updated":"2026-07-21T10:49:29Z","snapshot_observed_at":"2026-08-16T13:21:59.428143Z","submitted_at":"2026-07-21T10:49:29Z","title":"Dual Adversarial Fine-tuning for Enhancing Robustness of Large Vision Language Model","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T13:51:21.254486Z"},"links":{"citing_paper":"/paper/2607.18958"},"observation_digest":"sha256:ea05adfea27459a83a5f2c430a7082076df3f7ef751b33a76217ef4f20ba146d","observation_id":"ecf0c513-34b1-4932-8e69-2313202c473d","resolution":{"observed_at":"2026-08-01T13:51:21.254486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-08-17T05:14:27.567959Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15112","snapshot_observed_at":"2026-08-01T13:51:21.256489Z","title":"InternLM-XComposer: A vision- language large model for advanced text-image comprehension and composition,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18958","last_updated":"2026-07-21T10:49:29Z","snapshot_observed_at":"2026-08-16T13:21:59.428143Z","submitted_at":"2026-07-21T10:49:29Z","title":"Dual Adversarial Fine-tuning for Enhancing Robustness of Large Vision Language Model","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T13:51:21.256489Z"},"links":{"cited_paper":"/paper/2309.15112","citing_paper":"/paper/2607.18958"},"observation_digest":"sha256:c87217a48e238d860f9c6afcca1ed21b4bb0eda36569ed8b69dcbc1516a78b08","observation_id":"dd65781c-dcdf-4400-a77b-36a2da1576d7","resolution":{"observed_at":"2026-08-01T13:51:21.256489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-01T13:51:21.258744Z","title":"Gemini: A family of highly capable multimodal models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18958","last_updated":"2026-07-21T10:49:29Z","snapshot_observed_at":"2026-08-16T13:21:59.428143Z","submitted_at":"2026-07-21T10:49:29Z","title":"Dual Adversarial Fine-tuning for Enhancing Robustness of Large Vision Language Model","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T13:51:21.258744Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2607.18958"},"observation_digest":"sha256:308f51203aeab18f58a78654e0d43296477c5e35f8e0cbbec294a9d1560a896f","observation_id":"5539a0b1-15b5-4bab-a136-37a54ec2b7f0","resolution":{"observed_at":"2026-08-01T13:51:21.258744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-01T13:51:21.260890Z","title":"GPT-4 technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18958","last_updated":"2026-07-21T10:49:29Z","snapshot_observed_at":"2026-08-16T13:21:59.428143Z","submitted_at":"2026-07-21T10:49:29Z","title":"Dual Adversarial Fine-tuning for Enhancing Robustness of Large Vision Language Model","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T13:51:21.260890Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2607.18958"},"observation_digest":"sha256:2b0df067ae95fadf95bd4998106b29fafc84642e68a3fd8fce73038079fb4042","observation_id":"e2dfd162-b414-430d-bed1-c63469ec5ee3","resolution":{"observed_at":"2026-08-01T13:51:21.260890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:51:21.263083Z","title":"Obfuscated gradients give a false sense of security: Circumventing defenses to adversarial examples,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.18958","last_updated":"2026-07-21T10:49:29Z","snapshot_observed_at":"2026-08-16T13:21:59.428143Z","submitted_at":"2026-07-21T10:49:29Z","title":"Dual Adversarial Fine-tuning for Enhancing Robustness of Large Vision Language Model","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-01T13:51:21.263083Z"},"links":{"citing_paper":"/paper/2607.18958"},"observation_digest":"sha256:c05c439bc64948eb3dd8051dd688c91ea652c1fc2b354e4bc976b3e1373807ca","observation_id":"5af38794-86d0-4bc6-a910-4b58e1f54520","resolution":{"observed_at":"2026-08-01T13:51:21.263083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:51:21.265081Z","title":"Boosting adversarial attacks with momentum,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.18958","last_updated":"2026-07-21T10:49:29Z","snapshot_observed_at":"2026-08-16T13:21:59.428143Z","submitted_at":"2026-07-21T10:49:29Z","title":"Dual Adversarial Fine-tuning for Enhancing Robustness of Large Vision Language Model","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-01T13:51:21.265081Z"},"links":{"citing_paper":"/paper/2607.18958"},"observation_digest":"sha256:65f04e559dd4179d57e85ad5cc1a182b7f550a1f24000208d1f8c13e3da03c47","observation_id":"3497252a-9d99-4b5e-9638-8658816c26fa","resolution":{"observed_at":"2026-08-01T13:51:21.265081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:51:21.267133Z","title":"Reliable evaluation of adversarial robustness with an ensemble of diverse parameter-free attacks,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.18958","last_updated":"2026-07-21T10:49:29Z","snapshot_observed_at":"2026-08-16T13:21:59.428143Z","submitted_at":"2026-07-21T10:49:29Z","title":"Dual Adversarial Fine-tuning for Enhancing Robustness of Large Vision Language Model","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-01T13:51:21.267133Z"},"links":{"citing_paper":"/paper/2607.18958"},"observation_digest":"sha256:2f507a1efe68b83674042f4ce83fa03dae6623eb4be8eeb69a76f01fb784d487","observation_id":"5ea4499d-bbde-4970-b841-75dccd85dd7a","resolution":{"observed_at":"2026-08-01T13:51:21.267133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:51:21.269016Z","title":"Adversarial weight perturbation helps robust generalization,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.18958","last_updated":"2026-07-21T10:49:29Z","snapshot_observed_at":"2026-08-16T13:21:59.428143Z","submitted_at":"2026-07-21T10:49:29Z","title":"Dual Adversarial Fine-tuning for Enhancing Robustness of Large Vision Language Model","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-01T13:51:21.269016Z"},"links":{"citing_paper":"/paper/2607.18958"},"observation_digest":"sha256:877278e44ee6f3c34f51b6d6200311d41d689a6259e92fe6d16fc3ac2281c1d3","observation_id":"b97703fc-03cc-4e40-9a8c-403f700d5fb6","resolution":{"observed_at":"2026-08-01T13:51:21.269016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.14597","last_updated":"2023-08-28T14:09:02Z","snapshot_observed_at":"2026-08-18T12:18:26.171550Z","submitted_at":"2023-08-28T14:09:02Z","title":"Adversarial Attacks on Foundational Vision Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.14597","snapshot_observed_at":"2026-08-01T13:51:21.271018Z","title":"Adversarial attacks on foundational vision models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18958","last_updated":"2026-07-21T10:49:29Z","snapshot_observed_at":"2026-08-16T13:21:59.428143Z","submitted_at":"2026-07-21T10:49:29Z","title":"Dual Adversarial Fine-tuning for Enhancing Robustness of Large Vision Language Model","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-01T13:51:21.271018Z"},"links":{"cited_paper":"/paper/2308.14597","citing_paper":"/paper/2607.18958"},"observation_digest":"sha256:832fec5da858ed6aedb1f1e48f35dacf8b6f782aef6ca0ef8af2bf7ad3132683","observation_id":"05368e7a-9800-4c62-9fae-4beace0ce52a","resolution":{"observed_at":"2026-08-01T13:51:21.271018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:51:21.273214Z","title":"Set-level guidance attack: Boosting adversarial transferability of vision-language pre-training models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18958","last_updated":"2026-07-21T10:49:29Z","snapshot_observed_at":"2026-08-16T13:21:59.428143Z","submitted_at":"2026-07-21T10:49:29Z","title":"Dual Adversarial Fine-tuning for Enhancing Robustness of Large Vision Language Model","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-01T13:51:21.273214Z"},"links":{"citing_paper":"/paper/2607.18958"},"observation_digest":"sha256:3994348291a39fc1ede9bd6e83ecb8c86d21ed9e48f359df5671b98b01704097","observation_id":"ef66119d-2b47-4c3f-8df4-a6957283afd8","resolution":{"observed_at":"2026-08-01T13:51:21.273214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:51:21.275083Z","title":"Revisiting the ad- versarial transferability:towards a perspective of semantic preservation,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18958","last_updated":"2026-07-21T10:49:29Z","snapshot_observed_at":"2026-08-16T13:21:59.428143Z","submitted_at":"2026-07-21T10:49:29Z","title":"Dual Adversarial Fine-tuning for Enhancing Robustness of Large Vision Language Model","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-01T13:51:21.275083Z"},"links":{"citing_paper":"/paper/2607.18958"},"observation_digest":"sha256:1dc1f9e5b79b177d9e30f8c1eb7d8141b219ea7ee93a34a59ff59cfff5e6a2ed","observation_id":"21912b4f-882a-4f82-8400-3afd375389e4","resolution":{"observed_at":"2026-08-01T13:51:21.275083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:51:21.277166Z","title":"Microsoft COCO: Common objects in context,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.18958","last_updated":"2026-07-21T10:49:29Z","snapshot_observed_at":"2026-08-16T13:21:59.428143Z","submitted_at":"2026-07-21T10:49:29Z","title":"Dual Adversarial Fine-tuning for Enhancing Robustness of Large Vision Language Model","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-01T13:51:21.277166Z"},"links":{"citing_paper":"/paper/2607.18958"},"observation_digest":"sha256:d23c29e045a7f7044f6f4ac452b37cf7f6d5234c47f59914f2b163f25cd813c5","observation_id":"19492f05-b244-4f67-b1fd-093e0a3c3fa3","resolution":{"observed_at":"2026-08-01T13:51:21.277166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:51:21.279402Z","title":"Caltech-256 object category dataset,","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2607.18958","last_updated":"2026-07-21T10:49:29Z","snapshot_observed_at":"2026-08-16T13:21:59.428143Z","submitted_at":"2026-07-21T10:49:29Z","title":"Dual Adversarial Fine-tuning for Enhancing Robustness of Large Vision Language Model","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-01T13:51:21.279402Z"},"links":{"citing_paper":"/paper/2607.18958"},"observation_digest":"sha256:35c51ddaf5d20bd41f5fcf3f69c4b989742903c418e1eb57e14f0ac0b11bca3f","observation_id":"a8b96f19-5bc3-4d89-951e-66e83c621ac2","resolution":{"observed_at":"2026-08-01T13:51:21.279402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:51:21.281691Z","title":"3D object representations for fine-grained categorization,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2607.18958","last_updated":"2026-07-21T10:49:29Z","snapshot_observed_at":"2026-08-16T13:21:59.428143Z","submitted_at":"2026-07-21T10:49:29Z","title":"Dual Adversarial Fine-tuning for Enhancing Robustness of Large Vision Language Model","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-01T13:51:21.281691Z"},"links":{"citing_paper":"/paper/2607.18958"},"observation_digest":"sha256:b603221510de1e67a7de259f46832fded60426054f0b24e080e0a5cafaf1962f","observation_id":"7d8529e6-bf05-4b25-bdda-355fb14e24dd","resolution":{"observed_at":"2026-08-01T13:51:21.281691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:51:21.283691Z","title":"Learning multiple layers of features from tiny images,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2607.18958","last_updated":"2026-07-21T10:49:29Z","snapshot_observed_at":"2026-08-16T13:21:59.428143Z","submitted_at":"2026-07-21T10:49:29Z","title":"Dual Adversarial Fine-tuning for Enhancing Robustness of Large Vision Language Model","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-01T13:51:21.283691Z"},"links":{"citing_paper":"/paper/2607.18958"},"observation_digest":"sha256:16f3ce6edb678ef61aa76b234278aa83cfac29c744fd111088d5cacbba9a63dd","observation_id":"c09a6feb-2e37-4222-9735-4a0f44a6a66f","resolution":{"observed_at":"2026-08-01T13:51:21.283691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:51:21.285506Z","title":"Describing textures in the wild,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.18958","last_updated":"2026-07-21T10:49:29Z","snapshot_observed_at":"2026-08-16T13:21:59.428143Z","submitted_at":"2026-07-21T10:49:29Z","title":"Dual Adversarial Fine-tuning for Enhancing Robustness of Large Vision Language Model","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-01T13:51:21.285506Z"},"links":{"citing_paper":"/paper/2607.18958"},"observation_digest":"sha256:e5a249efcd760349bbb986d27303dcae9acf2cb6a2869db8c55a52ea1740c8f9","observation_id":"ff9ea5cd-6845-49aa-bb34-6b489380ae58","resolution":{"observed_at":"2026-08-01T13:51:21.285506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:51:21.287436Z","title":"EuroSAT: A novel dataset and deep learning benchmark for land use and land cover classification,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.18958","last_updated":"2026-07-21T10:49:29Z","snapshot_observed_at":"2026-08-16T13:21:59.428143Z","submitted_at":"2026-07-21T10:49:29Z","title":"Dual Adversarial Fine-tuning for Enhancing Robustness of Large Vision Language Model","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-01T13:51:21.287436Z"},"links":{"citing_paper":"/paper/2607.18958"},"observation_digest":"sha256:7cecf13b958d2ff747948a21c43efbc1709890e8f13d47f12ebbd9e7aa9fa5ef","observation_id":"2954b5a2-6e0f-49f0-841a-0dfc7cda9b77","resolution":{"observed_at":"2026-08-01T13:51:21.287436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1306.5151","last_updated":"2013-06-21T14:31:57Z","snapshot_observed_at":"2026-08-12T17:35:23.022229Z","submitted_at":"2013-06-21T14:31:57Z","title":"Fine-Grained Visual Classification of Aircraft","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1306.5151","snapshot_observed_at":"2026-08-01T13:51:21.289077Z","title":"Fine- grained visual classification of aircraft,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2607.18958","last_updated":"2026-07-21T10:49:29Z","snapshot_observed_at":"2026-08-16T13:21:59.428143Z","submitted_at":"2026-07-21T10:49:29Z","title":"Dual Adversarial Fine-tuning for Enhancing Robustness of Large Vision Language Model","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-01T13:51:21.289077Z"},"links":{"cited_paper":"/paper/1306.5151","citing_paper":"/paper/2607.18958"},"observation_digest":"sha256:a6adf327de42dbb23583218dd2a1bbdd96eae7b5735dbc7a507c53259295aba6","observation_id":"744d8a30-8b0f-4f36-b9ed-6d5f7de84b40","resolution":{"observed_at":"2026-08-01T13:51:21.289077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:51:21.291226Z","title":"Automated flower classification over a large number of classes,","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2607.18958","last_updated":"2026-07-21T10:49:29Z","snapshot_observed_at":"2026-08-16T13:21:59.428143Z","submitted_at":"2026-07-21T10:49:29Z","title":"Dual Adversarial Fine-tuning for Enhancing Robustness of Large Vision Language Model","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-01T13:51:21.291226Z"},"links":{"citing_paper":"/paper/2607.18958"},"observation_digest":"sha256:3cefc2337c3ba3ac8f1b6b989a0baf32a72a1f1a9f22a573300598bc5ff2d5cb","observation_id":"cf98fb2b-1ea7-4509-a2d1-6fafddd819f4","resolution":{"observed_at":"2026-08-01T13:51:21.291226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:51:21.293158Z","title":"Cats and dogs,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2607.18958","last_updated":"2026-07-21T10:49:29Z","snapshot_observed_at":"2026-08-16T13:21:59.428143Z","submitted_at":"2026-07-21T10:49:29Z","title":"Dual Adversarial Fine-tuning for Enhancing Robustness of Large Vision Language Model","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-01T13:51:21.293158Z"},"links":{"citing_paper":"/paper/2607.18958"},"observation_digest":"sha256:607bdba5c8899003043d7dbd6dff5e3ca4d4c9a6ce85d205cae600fa84c3a9f9","observation_id":"afb71323-be0d-4882-9b98-6ab6ddb2b23c","resolution":{"observed_at":"2026-08-01T13:51:21.293158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:51:21.294973Z","title":"An analysis of single-layer networks in unsupervised feature learning,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2607.18958","last_updated":"2026-07-21T10:49:29Z","snapshot_observed_at":"2026-08-16T13:21:59.428143Z","submitted_at":"2026-07-21T10:49:29Z","title":"Dual Adversarial Fine-tuning for Enhancing Robustness of Large Vision Language Model","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-01T13:51:21.294973Z"},"links":{"citing_paper":"/paper/2607.18958"},"observation_digest":"sha256:22c7d6c4c76529f6937187d9649b7f9a16e4f6c0df80dcf332c1f062979213b1","observation_id":"38298e7b-6290-4350-bf3f-4e581cd0ae95","resolution":{"observed_at":"2026-08-01T13:51:21.294973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:51:21.296999Z","title":"The many faces of robustness: A critical analysis of out-of-distribution generalization,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.18958","last_updated":"2026-07-21T10:49:29Z","snapshot_observed_at":"2026-08-16T13:21:59.428143Z","submitted_at":"2026-07-21T10:49:29Z","title":"Dual Adversarial Fine-tuning for Enhancing Robustness of Large Vision Language Model","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-01T13:51:21.296999Z"},"links":{"citing_paper":"/paper/2607.18958"},"observation_digest":"sha256:42e8ffa8e343e0e77eb41f1a7d9a569b2bfe03320f986f3bfd552ab12413e173","observation_id":"9fe61ef1-7f32-4f0f-bb48-ce0d3abce91e","resolution":{"observed_at":"2026-08-01T13:51:21.296999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:51:21.298853Z","title":"Flickr30k entities: Collecting region-to-phrase correspondences for richer image-to-sentence models,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.18958","last_updated":"2026-07-21T10:49:29Z","snapshot_observed_at":"2026-08-16T13:21:59.428143Z","submitted_at":"2026-07-21T10:49:29Z","title":"Dual Adversarial Fine-tuning for Enhancing Robustness of Large Vision Language Model","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-01T13:51:21.298853Z"},"links":{"citing_paper":"/paper/2607.18958"},"observation_digest":"sha256:856bdb5970b440bf194cba81eb9d0999b4b610564f8d94320b2e9ec1b4d481a3","observation_id":"b98562db-2313-4990-8358-cb311364fae8","resolution":{"observed_at":"2026-08-01T13:51:21.298853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:51:21.300723Z","title":"Making the V in VQA matter: Elevating the role of image understanding in visual question answering,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.18958","last_updated":"2026-07-21T10:49:29Z","snapshot_observed_at":"2026-08-16T13:21:59.428143Z","submitted_at":"2026-07-21T10:49:29Z","title":"Dual Adversarial Fine-tuning for Enhancing Robustness of Large Vision Language Model","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-01T13:51:21.300723Z"},"links":{"citing_paper":"/paper/2607.18958"},"observation_digest":"sha256:379ae5aca672dcc9ab3b660df26445c9fdfb5d98f637afee2073c39720980350","observation_id":"ee51344f-d89a-41ed-8cca-358b6a8812f5","resolution":{"observed_at":"2026-08-01T13:51:21.300723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:51:21.302816Z","title":"Towards VQA models that can read,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.18958","last_updated":"2026-07-21T10:49:29Z","snapshot_observed_at":"2026-08-16T13:21:59.428143Z","submitted_at":"2026-07-21T10:49:29Z","title":"Dual Adversarial Fine-tuning for Enhancing Robustness of Large Vision Language Model","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-01T13:51:21.302816Z"},"links":{"citing_paper":"/paper/2607.18958"},"observation_digest":"sha256:381f60d086e4fe5da15fb224dc007ade35775ce7f73a075d390736bda4427ee4","observation_id":"1e380270-5548-4e78-8866-c2fedc3cb4cb","resolution":{"observed_at":"2026-08-01T13:51:21.302816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:51:21.304728Z","title":"VizWiz grand challenge: Answering visual questions from blind people,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.18958","last_updated":"2026-07-21T10:49:29Z","snapshot_observed_at":"2026-08-16T13:21:59.428143Z","submitted_at":"2026-07-21T10:49:29Z","title":"Dual Adversarial Fine-tuning for Enhancing Robustness of Large Vision Language Model","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-01T13:51:21.304728Z"},"links":{"citing_paper":"/paper/2607.18958"},"observation_digest":"sha256:aba4c70e32ea1cb2a550c76498b59daf2e6593d951cd8273a2599cf3b79c3cc6","observation_id":"430a9b4c-3866-4a57-a94b-adde7d720953","resolution":{"observed_at":"2026-08-01T13:51:21.304728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:51:21.306614Z","title":"OK-VQA: A visual question answering benchmark requiring external knowledge,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.18958","last_updated":"2026-07-21T10:49:29Z","snapshot_observed_at":"2026-08-16T13:21:59.428143Z","submitted_at":"2026-07-21T10:49:29Z","title":"Dual Adversarial Fine-tuning for Enhancing Robustness of Large Vision Language Model","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-01T13:51:21.306614Z"},"links":{"citing_paper":"/paper/2607.18958"},"observation_digest":"sha256:fd016a53d69c0d1c16c89720917d82b4821d2c0e4f6da6ae286a75fbfa5f202f","observation_id":"73bc2303-4b5c-44d0-819c-2d88e4132605","resolution":{"observed_at":"2026-08-01T13:51:21.306614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:51:21.308489Z","title":"CIDEr: Consensus-based image description evaluation,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.18958","last_updated":"2026-07-21T10:49:29Z","snapshot_observed_at":"2026-08-16T13:21:59.428143Z","submitted_at":"2026-07-21T10:49:29Z","title":"Dual Adversarial Fine-tuning for Enhancing Robustness of Large Vision Language Model","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-01T13:51:21.308489Z"},"links":{"citing_paper":"/paper/2607.18958"},"observation_digest":"sha256:d0547f3a3ebfa25820bb2a41b144c96d605a826f2b32e1f926c56885d73da778","observation_id":"bc2cb445-f0ce-4bf4-add3-30c124d53fb5","resolution":{"observed_at":"2026-08-01T13:51:21.308489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:51:21.310303Z","title":"LAION-5B: An open large-scale dataset for training next generation image-text models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.18958","last_updated":"2026-07-21T10:49:29Z","snapshot_observed_at":"2026-08-16T13:21:59.428143Z","submitted_at":"2026-07-21T10:49:29Z","title":"Dual Adversarial Fine-tuning for Enhancing Robustness of Large Vision Language Model","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-01T13:51:21.310303Z"},"links":{"citing_paper":"/paper/2607.18958"},"observation_digest":"sha256:850ace85e47bf2aeb7b3c2411cd6d258da0aa0cb04faa725506384d40287e234","observation_id":"8809d56d-c27f-40c9-a658-918dca5f95b8","resolution":{"observed_at":"2026-08-01T13:51:21.310303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:51:21.312228Z","title":"Decoupled weight decay regularization,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.18958","last_updated":"2026-07-21T10:49:29Z","snapshot_observed_at":"2026-08-16T13:21:59.428143Z","submitted_at":"2026-07-21T10:49:29Z","title":"Dual Adversarial Fine-tuning for Enhancing Robustness of Large Vision Language Model","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-01T13:51:21.312228Z"},"links":{"citing_paper":"/paper/2607.18958"},"observation_digest":"sha256:b242e819e6d4013b01d86fa7bdf5af561520890e6971593246c77dd0a697064d","observation_id":"d282f254-a11f-4587-896a-ce758234946b","resolution":{"observed_at":"2026-08-01T13:51:21.312228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01390","last_updated":"2023-08-07T17:53:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-02T19:10:23Z","title":"OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01390","snapshot_observed_at":"2026-08-01T13:51:21.314012Z","title":"OpenFlamingo: An open-source framework for training large autoregressive vision-language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18958","last_updated":"2026-07-21T10:49:29Z","snapshot_observed_at":"2026-08-16T13:21:59.428143Z","submitted_at":"2026-07-21T10:49:29Z","title":"Dual Adversarial Fine-tuning for Enhancing Robustness of Large Vision Language Model","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-01T13:51:21.314012Z"},"links":{"cited_paper":"/paper/2308.01390","citing_paper":"/paper/2607.18958"},"observation_digest":"sha256:7d3392b27ce81f48b9e6b404ab1fc585097fab6e06bc644b93e4fd105ebaf060","observation_id":"b7007c62-bdcc-499a-8189-b5c2f41f534e","resolution":{"observed_at":"2026-08-01T13:51:21.314012Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.18958","last_updated":"2026-07-21T10:49:29Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T13:21:59.428143Z","submitted_at":"2026-07-21T10:49:29Z","title":"Dual Adversarial Fine-tuning for Enhancing Robustness of Large Vision Language Model"},"reference_resolution":{"displayed":61,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":60,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":61},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 61 of 61 outbound references and 0 inbound Pith citation observations for arXiv:2607.18958."}