{"as_of":"2026-08-07T08:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c1e4112fcd7412d2283a2ee922f8a402a82c753065fd3a120e57477ff9fd9b50","coverage":[{"denominator":71,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":71,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T15:57:58.520448Z","state":"measured"},{"denominator":72,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":72,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-07T15:41:52.882586Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-05-12T00:11:16.955987Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2604.11576","last_updated":"2026-04-13T14:54:25Z","snapshot_observed_at":"2026-08-03T07:06:51.599266Z","submitted_at":"2026-04-13T14:54:25Z","title":"Finetune Like You Pretrain: Boosting Zero-shot Adversarial Robustness in Vision-language Models","version":1},"cited_work":{"arxiv_id":"2604.11576","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.11576","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Finetune Like You Pretrain: Boosting Zero-shot Adversarial Robustness in Vision-language Models","venue":"cs.CV","work_id":"ada82b27-f729-4673-bf5c-026e8f1e5104","year":2026},"citing_paper":{"arxiv_id":"2604.25544","last_updated":"2026-04-28T12:10:29Z","snapshot_observed_at":"2026-07-06T23:11:25.757664Z","submitted_at":"2026-04-28T12:10:29Z","title":"Medoid Prototype Alignment for Cross-Plant Unknown Attack Detection in Industrial Control Systems","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-07T15:41:52.882586Z"},"links":{"cited_paper":"/paper/2604.11576","citing_paper":"/paper/2604.25544"},"observation_digest":"sha256:ecb83b848a8db0dacee041569b84659f604c9a54de0db8754b7e961ead9541e0","observation_id":"4d66e47f-a587-4ebf-96d0-38f7ce34f363","resolution":{"observed_at":"2026-05-12T00:11:16.961228Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2604.11576/citation-record","integrity":"/paper/2604.11576/integrity","json":"/paper/2604.11576/citation-record.json","paper":"/paper/2604.11576"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Objectnet: A large-scale bias-controlled dataset for pushing the limits of object recognition models","venue":null,"work_id":"ae927c15-402e-4f82-bd3e-26b1799aa367","year":2019},"citing_paper":{"arxiv_id":"2604.11576","last_updated":"2026-04-13T14:54:25Z","snapshot_observed_at":"2026-08-03T07:06:51.599266Z","submitted_at":"2026-04-13T14:54:25Z","title":"Finetune Like You Pretrain: Boosting Zero-shot Adversarial Robustness in Vision-language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T15:57:58.520448Z"},"links":{"citing_paper":"/paper/2604.11576"},"observation_digest":"sha256:4f81f4c48659f9a538886fc049137778e2f6930b380276013416b18cfb545175","observation_id":"2929c61c-93ba-409e-8e8c-d0ed81bbf05f","resolution":{"observed_at":"2026-05-17T17:40:03.319499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Food-101–mining discriminative components with random forests","venue":null,"work_id":"f6a70b0e-9c93-4fc7-9dcd-deae5bcbeb59","year":2014},"citing_paper":{"arxiv_id":"2604.11576","last_updated":"2026-04-13T14:54:25Z","snapshot_observed_at":"2026-08-03T07:06:51.599266Z","submitted_at":"2026-04-13T14:54:25Z","title":"Finetune Like You Pretrain: Boosting Zero-shot Adversarial Robustness in Vision-language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T15:57:58.520448Z"},"links":{"citing_paper":"/paper/2604.11576"},"observation_digest":"sha256:e1c31fd880fde940498c9d465aea86a9bfaece3c8b1499caaefbed50f391461b","observation_id":"a33842c0-3303-4d4c-a2a8-a2d55d41bdc4","resolution":{"observed_at":"2026-05-17T17:41:59.937712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards evaluating the robustness of neural networks","venue":null,"work_id":"b81eace0-50a2-4d3e-a1bc-eb2e092537e5","year":2017},"citing_paper":{"arxiv_id":"2604.11576","last_updated":"2026-04-13T14:54:25Z","snapshot_observed_at":"2026-08-03T07:06:51.599266Z","submitted_at":"2026-04-13T14:54:25Z","title":"Finetune Like You Pretrain: Boosting Zero-shot Adversarial Robustness in Vision-language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T15:57:58.520448Z"},"links":{"citing_paper":"/paper/2604.11576"},"observation_digest":"sha256:684e3fa4c4f724f1040d8a5af2e93aae31259d6e66cf63872b611602075c0311","observation_id":"fc965721-a993-4505-b3e3-21f4e0da1531","resolution":{"observed_at":"2026-05-17T17:41:59.893282Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Describing textures in the wild","venue":null,"work_id":"700460bb-dfdc-47af-8b85-9386d27e9167","year":2014},"citing_paper":{"arxiv_id":"2604.11576","last_updated":"2026-04-13T14:54:25Z","snapshot_observed_at":"2026-08-03T07:06:51.599266Z","submitted_at":"2026-04-13T14:54:25Z","title":"Finetune Like You Pretrain: Boosting Zero-shot Adversarial Robustness in Vision-language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T15:57:58.520448Z"},"links":{"citing_paper":"/paper/2604.11576"},"observation_digest":"sha256:0e0b8eb080f49dcc43ffd2cf9b0c3e2fb9c6996c22813027713cea864c64ff5b","observation_id":"76149d10-dbf5-47af-b4c0-0398366df46c","resolution":{"observed_at":"2026-05-17T17:41:59.888777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"An analysis of single-layer networks in unsupervised feature learning","venue":null,"work_id":"3ec2040d-a826-48f4-aa24-42c699c642a1","year":2011},"citing_paper":{"arxiv_id":"2604.11576","last_updated":"2026-04-13T14:54:25Z","snapshot_observed_at":"2026-08-03T07:06:51.599266Z","submitted_at":"2026-04-13T14:54:25Z","title":"Finetune Like You Pretrain: Boosting Zero-shot Adversarial Robustness in Vision-language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T15:57:58.520448Z"},"links":{"citing_paper":"/paper/2604.11576"},"observation_digest":"sha256:2fead0f1387f15651a0025b3b0ea451f33a1abb85bc523833c688656fd5796b0","observation_id":"7909f247-139b-46bf-9845-9eae531e4fbc","resolution":{"observed_at":"2026-05-17T17:41:59.926855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reliable evaluation of adversarial robustness with an ensemble of diverse parameter- free attacks","venue":null,"work_id":"6c99a90b-68ca-4c00-81a3-02a5bb75b7e7","year":2020},"citing_paper":{"arxiv_id":"2604.11576","last_updated":"2026-04-13T14:54:25Z","snapshot_observed_at":"2026-08-03T07:06:51.599266Z","submitted_at":"2026-04-13T14:54:25Z","title":"Finetune Like You Pretrain: Boosting Zero-shot Adversarial Robustness in Vision-language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T15:57:58.520448Z"},"links":{"citing_paper":"/paper/2604.11576"},"observation_digest":"sha256:7197b021510d503b79d97dc6b9355031ad9fd608a18ee045083585961339cdcf","observation_id":"7945fd93-7dec-4d90-b244-40349ebd9bfc","resolution":{"observed_at":"2026-05-17T17:41:59.919546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":"c0f86958-e164-4f61-a87a-c01a3302472e","year":2009},"citing_paper":{"arxiv_id":"2604.11576","last_updated":"2026-04-13T14:54:25Z","snapshot_observed_at":"2026-08-03T07:06:51.599266Z","submitted_at":"2026-04-13T14:54:25Z","title":"Finetune Like You Pretrain: Boosting Zero-shot Adversarial Robustness in Vision-language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T15:57:58.520448Z"},"links":{"citing_paper":"/paper/2604.11576"},"observation_digest":"sha256:c6c101e7e9a1d6c2bced326d2c348208e594995999af5ac80309ada40a230747","observation_id":"9370282a-b023-4bf1-99b7-6fca481cf447","resolution":{"observed_at":"2026-05-17T17:41:59.888342Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improving zero-shot adversarial robustness in vision-language models by closed- form alignment of adversarial path simplices","venue":null,"work_id":"261f1b5d-e4c6-4f9b-a736-2516f7a7adfa","year":2025},"citing_paper":{"arxiv_id":"2604.11576","last_updated":"2026-04-13T14:54:25Z","snapshot_observed_at":"2026-08-03T07:06:51.599266Z","submitted_at":"2026-04-13T14:54:25Z","title":"Finetune Like You Pretrain: Boosting Zero-shot Adversarial Robustness in Vision-language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T15:57:58.520448Z"},"links":{"citing_paper":"/paper/2604.11576"},"observation_digest":"sha256:55d62d3cba66d5fd940c5cb7bd985d8a411a55118cedca0858287249ff34e3ac","observation_id":"f83d97b4-737d-4213-9b47-7dbec88cd4c5","resolution":{"observed_at":"2026-05-17T17:41:59.911533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"One-shot learn- ing of object categories.IEEE transactions on pattern analy- sis and machine intelligence, 28(4):594–611","venue":null,"work_id":"77cf8f08-bbec-4bec-865e-cb62f3a20d6b","year":2006},"citing_paper":{"arxiv_id":"2604.11576","last_updated":"2026-04-13T14:54:25Z","snapshot_observed_at":"2026-08-03T07:06:51.599266Z","submitted_at":"2026-04-13T14:54:25Z","title":"Finetune Like You Pretrain: Boosting Zero-shot Adversarial Robustness in Vision-language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T15:57:58.520448Z"},"links":{"citing_paper":"/paper/2604.11576"},"observation_digest":"sha256:c1c0204a15fff2d951c26dff17d5f0c82e84e9f5a44756a8e8a218716ac7ecfb","observation_id":"4dd87eee-9bf3-421a-9854-be2feb44a8a0","resolution":{"observed_at":"2026-05-17T17:41:59.940244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Finetune like you pretrain: Improved finetuning of zero-shot vision models","venue":null,"work_id":"9bd4ccd9-d401-4a2f-befa-e7ac60798f29","year":2023},"citing_paper":{"arxiv_id":"2604.11576","last_updated":"2026-04-13T14:54:25Z","snapshot_observed_at":"2026-08-03T07:06:51.599266Z","submitted_at":"2026-04-13T14:54:25Z","title":"Finetune Like You Pretrain: Boosting Zero-shot Adversarial Robustness in Vision-language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T15:57:58.520448Z"},"links":{"citing_paper":"/paper/2604.11576"},"observation_digest":"sha256:e06d7eed6ea5afb9b84eb5b5007a4987b4683a5e943ca7368d1faf0eee98ead6","observation_id":"2c2db4f7-56c2-4181-8f62-091a5d035d6d","resolution":{"observed_at":"2026-05-17T17:41:59.935401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Caltech-256 object category dataset","venue":null,"work_id":"91e55250-1ecb-4df0-9a44-570ece2e13b5","year":2007},"citing_paper":{"arxiv_id":"2604.11576","last_updated":"2026-04-13T14:54:25Z","snapshot_observed_at":"2026-08-03T07:06:51.599266Z","submitted_at":"2026-04-13T14:54:25Z","title":"Finetune Like You Pretrain: Boosting Zero-shot Adversarial Robustness in Vision-language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T15:57:58.520448Z"},"links":{"citing_paper":"/paper/2604.11576"},"observation_digest":"sha256:c1ce0fc3cf731959628f4d44d7020b2bf52c1c451f13af4003c4fac41589654b","observation_id":"a47e700c-627c-45cb-b119-bc066ba1d11f","resolution":{"observed_at":"2026-05-17T17:41:59.924381Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deep residual learning for image recognition","venue":null,"work_id":"bf22cea8-f56f-4f47-9430-0751f0183ab4","year":2016},"citing_paper":{"arxiv_id":"2604.11576","last_updated":"2026-04-13T14:54:25Z","snapshot_observed_at":"2026-08-03T07:06:51.599266Z","submitted_at":"2026-04-13T14:54:25Z","title":"Finetune Like You Pretrain: Boosting Zero-shot Adversarial Robustness in Vision-language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T15:57:58.520448Z"},"links":{"citing_paper":"/paper/2604.11576"},"observation_digest":"sha256:19df2e0073248830551493b0f8e7c07c773e9f82318067a24bdef2fd31c448ad","observation_id":"0bc12d05-d6a1-46e3-8f2a-804b843b5168","resolution":{"observed_at":"2026-05-17T17:41:59.921861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ff3be1fa-024a-4635-8856-d1f138d9153e","year":2019},"citing_paper":{"arxiv_id":"2604.11576","last_updated":"2026-04-13T14:54:25Z","snapshot_observed_at":"2026-08-03T07:06:51.599266Z","submitted_at":"2026-04-13T14:54:25Z","title":"Finetune Like You Pretrain: Boosting Zero-shot Adversarial Robustness in Vision-language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T15:57:58.520448Z"},"links":{"citing_paper":"/paper/2604.11576"},"observation_digest":"sha256:ccc43d08f3d70282253b147a1d64d3eadcca8f176ebf6451188c5e11a49fda6b","observation_id":"fc1a1b5f-2a9f-4155-a89d-8d1f161933e5","resolution":{"observed_at":"2026-05-17T17:41:59.952320Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The many faces of robust- ness: A critical analysis of out-of-distribution generalization","venue":null,"work_id":"b23fc813-3f30-484f-93b1-4cb92244aa3d","year":2021},"citing_paper":{"arxiv_id":"2604.11576","last_updated":"2026-04-13T14:54:25Z","snapshot_observed_at":"2026-08-03T07:06:51.599266Z","submitted_at":"2026-04-13T14:54:25Z","title":"Finetune Like You Pretrain: Boosting Zero-shot Adversarial Robustness in Vision-language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T15:57:58.520448Z"},"links":{"citing_paper":"/paper/2604.11576"},"observation_digest":"sha256:d84a7e8ecac8520182c96427363dfa4eb4c1ac0f96a67eda0674f8109d1b8fdf","observation_id":"7b724c9e-65bb-4824-8c6d-cb9dee23ce44","resolution":{"observed_at":"2026-05-17T17:41:59.962807Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Natural adversarial examples","venue":null,"work_id":"b46caf4d-ade2-432f-9ac9-c99b53917f73","year":2021},"citing_paper":{"arxiv_id":"2604.11576","last_updated":"2026-04-13T14:54:25Z","snapshot_observed_at":"2026-08-03T07:06:51.599266Z","submitted_at":"2026-04-13T14:54:25Z","title":"Finetune Like You Pretrain: Boosting Zero-shot Adversarial Robustness in Vision-language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T15:57:58.520448Z"},"links":{"citing_paper":"/paper/2604.11576"},"observation_digest":"sha256:7fd32c2cc0331d364b19791235c0398b95b3ca3a489297d55ada4302c1e19a44","observation_id":"5fbec500-ecbf-4187-a337-d3bb0c73fc53","resolution":{"observed_at":"2026-05-17T17:41:59.959817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scaling up visual and vision-language representation learning with noisy text supervision","venue":null,"work_id":"6a789be4-bcbb-4591-a9c3-61d41662a45c","year":2021},"citing_paper":{"arxiv_id":"2604.11576","last_updated":"2026-04-13T14:54:25Z","snapshot_observed_at":"2026-08-03T07:06:51.599266Z","submitted_at":"2026-04-13T14:54:25Z","title":"Finetune Like You Pretrain: Boosting Zero-shot Adversarial Robustness in Vision-language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T15:57:58.520448Z"},"links":{"citing_paper":"/paper/2604.11576"},"observation_digest":"sha256:4e708d9ea2064be98082bda883e9f77a79dafc0274f7015017371211e6b4caff","observation_id":"ad3dd509-422c-402d-b627-2f1a961f71e4","resolution":{"observed_at":"2026-05-17T17:40:03.237954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"3d object representations for fine-grained categorization","venue":null,"work_id":"0ada9601-6df9-424c-a53d-3f31765381a7","year":2013},"citing_paper":{"arxiv_id":"2604.11576","last_updated":"2026-04-13T14:54:25Z","snapshot_observed_at":"2026-08-03T07:06:51.599266Z","submitted_at":"2026-04-13T14:54:25Z","title":"Finetune Like You Pretrain: Boosting Zero-shot Adversarial Robustness in Vision-language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T15:57:58.520448Z"},"links":{"citing_paper":"/paper/2604.11576"},"observation_digest":"sha256:6939dd2cb92b9eac37a39e2a60e23241e4cb1b160950f292d9bdfbf42ad57686","observation_id":"a58ad780-5977-4349-8301-85979d5321dc","resolution":{"observed_at":"2026-05-17T17:40:03.242786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning multiple layers of features from tiny images","venue":null,"work_id":"6735bfaa-2478-4a60-b339-d3361289ed38","year":2009},"citing_paper":{"arxiv_id":"2604.11576","last_updated":"2026-04-13T14:54:25Z","snapshot_observed_at":"2026-08-03T07:06:51.599266Z","submitted_at":"2026-04-13T14:54:25Z","title":"Finetune Like You Pretrain: Boosting Zero-shot Adversarial Robustness in Vision-language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T15:57:58.520448Z"},"links":{"citing_paper":"/paper/2604.11576"},"observation_digest":"sha256:6fcf9b69d3e236d1d3071a092ec93f781364f27fc9ed6859c285c306ff183446","observation_id":"5e886f48-c022-4f0e-b2da-2199df593ef1","resolution":{"observed_at":"2026-05-17T17:40:03.246925Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Im- agenet classification with deep convolutional neural networks","venue":null,"work_id":"4b0e6fa3-d89e-4952-b246-3cab0d6741c5","year":2012},"citing_paper":{"arxiv_id":"2604.11576","last_updated":"2026-04-13T14:54:25Z","snapshot_observed_at":"2026-08-03T07:06:51.599266Z","submitted_at":"2026-04-13T14:54:25Z","title":"Finetune Like You Pretrain: Boosting Zero-shot Adversarial Robustness in Vision-language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T15:57:58.520448Z"},"links":{"citing_paper":"/paper/2604.11576"},"observation_digest":"sha256:e43e1ede1eabb64a7de4dbc3f630787b9200755e712d545c44399360b1f99e0b","observation_id":"8634692d-f0c0-4c31-9a32-82208489dea2","resolution":{"observed_at":"2026-05-17T17:40:03.267889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fine-tuning can distort pre- trained features and underperform out-of-distribution","venue":null,"work_id":"7a9fedad-1c32-49b5-a94f-ab1a29190195","year":2022},"citing_paper":{"arxiv_id":"2604.11576","last_updated":"2026-04-13T14:54:25Z","snapshot_observed_at":"2026-08-03T07:06:51.599266Z","submitted_at":"2026-04-13T14:54:25Z","title":"Finetune Like You Pretrain: Boosting Zero-shot Adversarial Robustness in Vision-language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T15:57:58.520448Z"},"links":{"citing_paper":"/paper/2604.11576"},"observation_digest":"sha256:41e29aeb12221aeb5a8bb0db9e2a074d4cb10e3f4fd239faf2a4eb5581ed4a43","observation_id":"14d9ee75-a15c-45d9-856c-05b37b5ac586","resolution":{"observed_at":"2026-05-17T17:40:03.212337Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tiny imagenet visual recognition challenge","venue":null,"work_id":"76f1383c-35c8-420a-b33c-15d8ce8b65b6","year":2015},"citing_paper":{"arxiv_id":"2604.11576","last_updated":"2026-04-13T14:54:25Z","snapshot_observed_at":"2026-08-03T07:06:51.599266Z","submitted_at":"2026-04-13T14:54:25Z","title":"Finetune Like You Pretrain: Boosting Zero-shot Adversarial Robustness in Vision-language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T15:57:58.520448Z"},"links":{"citing_paper":"/paper/2604.11576"},"observation_digest":"sha256:8a8136d9afa885147f5f91e98e27741589615728c990675f5513bdce3be928fb","observation_id":"0b7c798a-471c-4d5d-a3f3-bbcf6e849b3f","resolution":{"observed_at":"2026-05-17T17:41:59.902026Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Blip: Bootstrapping language-image pre-training for unified vision- language understanding and generation","venue":null,"work_id":"45f595c9-32c9-4902-8875-642a292ec12a","year":null},"citing_paper":{"arxiv_id":"2604.11576","last_updated":"2026-04-13T14:54:25Z","snapshot_observed_at":"2026-08-03T07:06:51.599266Z","submitted_at":"2026-04-13T14:54:25Z","title":"Finetune Like You Pretrain: Boosting Zero-shot Adversarial Robustness in Vision-language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T15:57:58.520448Z"},"links":{"citing_paper":"/paper/2604.11576"},"observation_digest":"sha256:1c7cb975989b71556bf2f30887caa7b4ce4eb1c0e0f22212723f7d628a8836c9","observation_id":"c9d99b58-cae0-4cfb-94fc-91c9840d69b7","resolution":{"observed_at":"2026-05-17T17:40:03.203875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T08:53:32.228422Z","title":"Blip- 2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":"1145cf5b-64d9-4927-9a6e-7d0cb49a2867","year":null},"citing_paper":{"arxiv_id":"2604.11576","last_updated":"2026-04-13T14:54:25Z","snapshot_observed_at":"2026-08-03T07:06:51.599266Z","submitted_at":"2026-04-13T14:54:25Z","title":"Finetune Like You Pretrain: Boosting Zero-shot Adversarial Robustness in Vision-language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-10T15:57:58.520448Z"},"links":{"citing_paper":"/paper/2604.11576"},"observation_digest":"sha256:e5380f498b3aadbeff218cdcaa9167fc0253efac36616ff43c75418824c9d66b","observation_id":"89f0c6bc-2eca-4ec6-a658-189f5f06ae87","resolution":{"observed_at":"2026-05-17T17:40:03.208598Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"One prompt word is enough to boost adversarial robustness for pre-trained vision-language models","venue":null,"work_id":"acd77dc2-f995-4dd7-8f61-812b8eab917b","year":2024},"citing_paper":{"arxiv_id":"2604.11576","last_updated":"2026-04-13T14:54:25Z","snapshot_observed_at":"2026-08-03T07:06:51.599266Z","submitted_at":"2026-04-13T14:54:25Z","title":"Finetune Like You Pretrain: Boosting Zero-shot Adversarial Robustness in Vision-language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T15:57:58.520448Z"},"links":{"citing_paper":"/paper/2604.11576"},"observation_digest":"sha256:0816460d1c85392bd9c323349bfe51ec88c52aea0d5ae0db45eed762dbbb667c","observation_id":"baa05a66-2577-4a79-a1c6-dbca5dcb86b6","resolution":{"observed_at":"2026-05-17T17:40:03.216043Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Defense against adversarial attacks using high-level representation guided denoiser","venue":null,"work_id":"a23bbc82-9a45-46b5-b532-58f738d6d963","year":2018},"citing_paper":{"arxiv_id":"2604.11576","last_updated":"2026-04-13T14:54:25Z","snapshot_observed_at":"2026-08-03T07:06:51.599266Z","submitted_at":"2026-04-13T14:54:25Z","title":"Finetune Like You Pretrain: Boosting Zero-shot Adversarial Robustness in Vision-language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T15:57:58.520448Z"},"links":{"citing_paper":"/paper/2604.11576"},"observation_digest":"sha256:383ed559af3fa2ee7dd167093c3d1dfe3551052fdc7b0313358ec00dd4e8c90a","observation_id":"86ec9475-85cb-4f2a-9ef0-6c9a2a48d23e","resolution":{"observed_at":"2026-05-17T17:40:03.230348Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916","venue":null,"work_id":"80df3d4a-379c-485b-991a-704ad587d79c","year":2023},"citing_paper":{"arxiv_id":"2604.11576","last_updated":"2026-04-13T14:54:25Z","snapshot_observed_at":"2026-08-03T07:06:51.599266Z","submitted_at":"2026-04-13T14:54:25Z","title":"Finetune Like You Pretrain: Boosting Zero-shot Adversarial Robustness in Vision-language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T15:57:58.520448Z"},"links":{"citing_paper":"/paper/2604.11576"},"observation_digest":"sha256:c7166b0ae5c0d4def729764b7f614744b873c6e4fda6e9320d5676b5ba5a5e3e","observation_id":"a39425e8-d50e-4341-aecd-0b84f727b89f","resolution":{"observed_at":"2026-05-17T17:40:03.188310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Image segmentation us- ing text and image prompts","venue":null,"work_id":"2e4bb049-a8ee-42a1-b7ad-ff8298467e2c","year":2022},"citing_paper":{"arxiv_id":"2604.11576","last_updated":"2026-04-13T14:54:25Z","snapshot_observed_at":"2026-08-03T07:06:51.599266Z","submitted_at":"2026-04-13T14:54:25Z","title":"Finetune Like You Pretrain: Boosting Zero-shot Adversarial Robustness in Vision-language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T15:57:58.520448Z"},"links":{"citing_paper":"/paper/2604.11576"},"observation_digest":"sha256:03562fe178cbd18e95df23c270a4237e028747253cf62d5a5cb8e1b6158ea6a3","observation_id":"a495e399-8c10-42c7-93c8-f1b42b2aa78e","resolution":{"observed_at":"2026-05-17T17:40:03.197784Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards deep learning models resistant to adversarial attacks","venue":null,"work_id":"161d63e9-a54b-4d09-a628-cc5343cf183e","year":2018},"citing_paper":{"arxiv_id":"2604.11576","last_updated":"2026-04-13T14:54:25Z","snapshot_observed_at":"2026-08-03T07:06:51.599266Z","submitted_at":"2026-04-13T14:54:25Z","title":"Finetune Like You Pretrain: Boosting Zero-shot Adversarial Robustness in Vision-language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T15:57:58.520448Z"},"links":{"citing_paper":"/paper/2604.11576"},"observation_digest":"sha256:702da97cd1e2dbbb84bec6baa5259fadeebe29c94f69ac2deb15a4c59f3bef5b","observation_id":"6b8946b5-218e-4cf0-8914-d835d9626c6f","resolution":{"observed_at":"2026-05-17T17:40:03.180520Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1306.5151","last_updated":"2013-06-21T14:31:57Z","snapshot_observed_at":"2026-07-06T03:16:28.287173Z","submitted_at":"2013-06-21T14:31:57Z","title":"Fine-Grained Visual Classification of Aircraft","version":1},"cited_work":{"arxiv_id":"1306.5151","doi":null,"metadata_source":"pith","pith_arxiv_id":"1306.5151","snapshot_observed_at":"2026-07-11T03:07:53.092922Z","title":"Fine-Grained Visual Classification of Aircraft","venue":"cs.CV","work_id":"ed360110-3ce4-4959-8c74-1785cd9e537d","year":2013},"citing_paper":{"arxiv_id":"2604.11576","last_updated":"2026-04-13T14:54:25Z","snapshot_observed_at":"2026-08-03T07:06:51.599266Z","submitted_at":"2026-04-13T14:54:25Z","title":"Finetune Like You Pretrain: Boosting Zero-shot Adversarial Robustness in Vision-language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T15:57:58.520448Z"},"links":{"cited_paper":"/paper/1306.5151","citing_paper":"/paper/2604.11576"},"observation_digest":"sha256:5cd3c1bce89346f1ceb8b4c8ddf246102d2ab21e025a396c30d851d795b9b0c2","observation_id":"35d7249c-3cb3-48e5-852d-0a93e677d1f7","resolution":{"observed_at":"2026-05-11T17:41:07.065951Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Understanding zero-shot adversarial robust- ness for large-scale models","venue":null,"work_id":"16473285-5eb9-469c-b4ac-4c5c9482c992","year":2023},"citing_paper":{"arxiv_id":"2604.11576","last_updated":"2026-04-13T14:54:25Z","snapshot_observed_at":"2026-08-03T07:06:51.599266Z","submitted_at":"2026-04-13T14:54:25Z","title":"Finetune Like You Pretrain: Boosting Zero-shot Adversarial Robustness in Vision-language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-10T15:57:58.520448Z"},"links":{"citing_paper":"/paper/2604.11576"},"observation_digest":"sha256:557f93b6ddb1f2cc69519a963f05def13059a58b8e6ff217d2b526aa4d9a90a1","observation_id":"6a41a3f0-ac6e-4aed-ad2d-f82cb88ecb99","resolution":{"observed_at":"2026-05-17T17:40:03.183993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Context-aware robust fine-tuning.Interna- tional Journal of Computer Vision, 132(5):1685–1700","venue":null,"work_id":"1dcf5ca0-6ad2-44d5-aa6d-9c4b1ac5da75","year":2024},"citing_paper":{"arxiv_id":"2604.11576","last_updated":"2026-04-13T14:54:25Z","snapshot_observed_at":"2026-08-03T07:06:51.599266Z","submitted_at":"2026-04-13T14:54:25Z","title":"Finetune Like You Pretrain: Boosting Zero-shot Adversarial Robustness in Vision-language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-10T15:57:58.520448Z"},"links":{"citing_paper":"/paper/2604.11576"},"observation_digest":"sha256:8ce5751d0f4ac29a6617186b686bc7bc9df58611f63d6b9b112004b08e2cbee7","observation_id":"606861d3-d388-4025-9421-42baf6a46448","resolution":{"observed_at":"2026-05-17T17:40:03.191341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lipsum-FT: Ro- bust fine-tuning of zero-shot models using random text guid- ance","venue":null,"work_id":"a5a3b847-c062-4f39-9303-7d2afab5201d","year":2024},"citing_paper":{"arxiv_id":"2604.11576","last_updated":"2026-04-13T14:54:25Z","snapshot_observed_at":"2026-08-03T07:06:51.599266Z","submitted_at":"2026-04-13T14:54:25Z","title":"Finetune Like You Pretrain: Boosting Zero-shot Adversarial Robustness in Vision-language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-10T15:57:58.520448Z"},"links":{"citing_paper":"/paper/2604.11576"},"observation_digest":"sha256:718ee0e3755104365a927ede2d6abe46ef3d13cd458bcbf2387cae7a824b3db5","observation_id":"fca7e8d7-16f2-44fb-b596-0d0f137a4d96","resolution":{"observed_at":"2026-05-17T17:40:03.194806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Automated flower classification over a large number of classes","venue":null,"work_id":"be428a38-da62-45cb-849a-5e7f45dec2ec","year":2008},"citing_paper":{"arxiv_id":"2604.11576","last_updated":"2026-04-13T14:54:25Z","snapshot_observed_at":"2026-08-03T07:06:51.599266Z","submitted_at":"2026-04-13T14:54:25Z","title":"Finetune Like You Pretrain: Boosting Zero-shot Adversarial Robustness in Vision-language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-10T15:57:58.520448Z"},"links":{"citing_paper":"/paper/2604.11576"},"observation_digest":"sha256:fd81b558f870f221e550455da4707dfeafda059e7f0849973b8bfcaceeb9554d","observation_id":"b87682ef-dc13-4d4e-846e-7c48119ff211","resolution":{"observed_at":"2026-05-17T17:40:03.260230Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards calibrated robust fine-tuning of vision-language models.Advances in Neural Information Processing Systems, 37:12677–12707","venue":null,"work_id":"e1a152b5-29a8-4caf-8ce1-aec475e03944","year":2024},"citing_paper":{"arxiv_id":"2604.11576","last_updated":"2026-04-13T14:54:25Z","snapshot_observed_at":"2026-08-03T07:06:51.599266Z","submitted_at":"2026-04-13T14:54:25Z","title":"Finetune Like You Pretrain: Boosting Zero-shot Adversarial Robustness in Vision-language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-10T15:57:58.520448Z"},"links":{"citing_paper":"/paper/2604.11576"},"observation_digest":"sha256:0f37dd359b137c9a37d6f8fa0c51ada8e08c8036b7b6d9c1a7e864b30d889d58","observation_id":"1c799649-2b77-4c7b-abdc-6a4b562df6bb","resolution":{"observed_at":"2026-05-17T17:40:03.308958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-07-06T06:49:24.960992Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":"1807.03748","doi":"10.1609/aaai.v36i10.21390","metadata_source":"pith","pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Representation Learning with Contrastive Predictive Coding","venue":"cs.LG","work_id":"7b08a1d4-d565-424e-9c86-6ef244b7b90a","year":2018},"citing_paper":{"arxiv_id":"2604.11576","last_updated":"2026-04-13T14:54:25Z","snapshot_observed_at":"2026-08-03T07:06:51.599266Z","submitted_at":"2026-04-13T14:54:25Z","title":"Finetune Like You Pretrain: Boosting Zero-shot Adversarial Robustness in Vision-language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-10T15:57:58.520448Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2604.11576"},"observation_digest":"sha256:ef4c64af8a1ef32b8863419193adfaa55426d603dbd28d9f89062317d4f5ac53","observation_id":"ebeb9347-f286-4ed1-8386-92292f416404","resolution":{"observed_at":"2026-05-11T09:31:05.888640Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"88d8fee2-4cda-48fb-8dbf-d74c7db38699","year":2024},"citing_paper":{"arxiv_id":"2604.11576","last_updated":"2026-04-13T14:54:25Z","snapshot_observed_at":"2026-08-03T07:06:51.599266Z","submitted_at":"2026-04-13T14:54:25Z","title":"Finetune Like You Pretrain: Boosting Zero-shot Adversarial Robustness in Vision-language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-10T15:57:58.520448Z"},"links":{"citing_paper":"/paper/2604.11576"},"observation_digest":"sha256:88e50a288cbfff2d49f6edc27850428d769ae649d0036ad818c9b607ee0845e7","observation_id":"a56f1732-8ef1-4391-916d-44c493040624","resolution":{"observed_at":"2026-05-17T17:41:59.954699Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cats and dogs","venue":null,"work_id":"60e09c5a-541f-412d-8fc0-9973484499a5","year":2012},"citing_paper":{"arxiv_id":"2604.11576","last_updated":"2026-04-13T14:54:25Z","snapshot_observed_at":"2026-08-03T07:06:51.599266Z","submitted_at":"2026-04-13T14:54:25Z","title":"Finetune Like You Pretrain: Boosting Zero-shot Adversarial Robustness in Vision-language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-10T15:57:58.520448Z"},"links":{"citing_paper":"/paper/2604.11576"},"observation_digest":"sha256:35c0a91641b5abbcdab9e5ac36cf9283a0538a1e00964d0af09589133b8b4490","observation_id":"6ca7d8e9-86e8-423d-bfdc-ca60a745e197","resolution":{"observed_at":"2026-05-17T17:41:59.909181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Styleclip: Text-driven manipulation of stylegan imagery","venue":null,"work_id":"e45df975-bef1-4c5e-b233-f7a175041c76","year":2085},"citing_paper":{"arxiv_id":"2604.11576","last_updated":"2026-04-13T14:54:25Z","snapshot_observed_at":"2026-08-03T07:06:51.599266Z","submitted_at":"2026-04-13T14:54:25Z","title":"Finetune Like You Pretrain: Boosting Zero-shot Adversarial Robustness in Vision-language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-10T15:57:58.520448Z"},"links":{"citing_paper":"/paper/2604.11576"},"observation_digest":"sha256:df06ca41d2cd5f03551b8432f22292a7ce754632c529ceb2623fc65161745704","observation_id":"d23d826a-709e-4c39-aaa6-a584cb9ce857","resolution":{"observed_at":"2026-05-17T17:41:59.908636Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"What does a platypus look like? generating customized prompts for zero-shot image classification","venue":null,"work_id":"4ed37a47-7386-4c39-8e65-db7a9bc1f166","year":2023},"citing_paper":{"arxiv_id":"2604.11576","last_updated":"2026-04-13T14:54:25Z","snapshot_observed_at":"2026-08-03T07:06:51.599266Z","submitted_at":"2026-04-13T14:54:25Z","title":"Finetune Like You Pretrain: Boosting Zero-shot Adversarial Robustness in Vision-language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-10T15:57:58.520448Z"},"links":{"citing_paper":"/paper/2604.11576"},"observation_digest":"sha256:1a7c69b66a18392bf8e87b73797f199098e7d1e3fddd22944fa2d560071f3e89","observation_id":"4dcf61f4-4b4f-4be4-89e0-55bb4af1f5ee","resolution":{"observed_at":"2026-05-17T17:40:03.278011Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":"452a3ec7-bc91-483f-a689-153cc54680ce","year":2021},"citing_paper":{"arxiv_id":"2604.11576","last_updated":"2026-04-13T14:54:25Z","snapshot_observed_at":"2026-08-03T07:06:51.599266Z","submitted_at":"2026-04-13T14:54:25Z","title":"Finetune Like You Pretrain: Boosting Zero-shot Adversarial Robustness in Vision-language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-10T15:57:58.520448Z"},"links":{"citing_paper":"/paper/2604.11576"},"observation_digest":"sha256:334a4faefd5b8c0932a360b66b3f6d05a9b239f160f50ee0f61c973cb3a26f20","observation_id":"3a25adac-fbc0-49f2-b766-ac39d05f0db0","resolution":{"observed_at":"2026-05-17T17:40:03.295422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Overfitting in adver- sarially robust deep learning","venue":null,"work_id":"17ef7396-ccc2-49ab-8238-694f1693a7e4","year":2020},"citing_paper":{"arxiv_id":"2604.11576","last_updated":"2026-04-13T14:54:25Z","snapshot_observed_at":"2026-08-03T07:06:51.599266Z","submitted_at":"2026-04-13T14:54:25Z","title":"Finetune Like You Pretrain: Boosting Zero-shot Adversarial Robustness in Vision-language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-10T15:57:58.520448Z"},"links":{"citing_paper":"/paper/2604.11576"},"observation_digest":"sha256:22351b43692987ffa3ca43531553788881a25bbf364039a3da99a99fb0456ed6","observation_id":"b2d0bec5-c14b-4e01-ae42-9ef282b82414","resolution":{"observed_at":"2026-05-17T17:41:59.884912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Im- proved zero-shot classification by adapting vlms with text descriptions","venue":null,"work_id":"06cb137b-950d-46fd-a67d-1408a75970ca","year":null},"citing_paper":{"arxiv_id":"2604.11576","last_updated":"2026-04-13T14:54:25Z","snapshot_observed_at":"2026-08-03T07:06:51.599266Z","submitted_at":"2026-04-13T14:54:25Z","title":"Finetune Like You Pretrain: Boosting Zero-shot Adversarial Robustness in Vision-language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-10T15:57:58.520448Z"},"links":{"citing_paper":"/paper/2604.11576"},"observation_digest":"sha256:19f0bf77043e55487e7250c2cc2f7605d9048d1d0386a88b9628c3014e78e235","observation_id":"268d2882-1432-4c91-84fb-540fd09bb085","resolution":{"observed_at":"2026-05-17T17:41:59.945364Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Interpreting and analysing clip’s zero-shot image classification via mutual knowledge.Advances in Neural Information Processing Sys- tems, 37:39597–39631","venue":null,"work_id":"49a8b90b-f8f2-4e2b-ac6e-de331f1f8f01","year":2024},"citing_paper":{"arxiv_id":"2604.11576","last_updated":"2026-04-13T14:54:25Z","snapshot_observed_at":"2026-08-03T07:06:51.599266Z","submitted_at":"2026-04-13T14:54:25Z","title":"Finetune Like You Pretrain: Boosting Zero-shot Adversarial Robustness in Vision-language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-10T15:57:58.520448Z"},"links":{"citing_paper":"/paper/2604.11576"},"observation_digest":"sha256:963f4e9e694cadaa34d26bada0dd8b5ceb1f8bb360c355b427df90ed7c0939b0","observation_id":"f177cb15-f50c-4258-91a7-17a5bc1d0ea3","resolution":{"observed_at":"2026-05-17T17:41:59.929790Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Robust clip: Unsupervised adversar- ial fine-tuning of vision embeddings for robust large vision- language models","venue":null,"work_id":"26451cac-131b-4dad-aac4-4a5d0a9e2817","year":2024},"citing_paper":{"arxiv_id":"2604.11576","last_updated":"2026-04-13T14:54:25Z","snapshot_observed_at":"2026-08-03T07:06:51.599266Z","submitted_at":"2026-04-13T14:54:25Z","title":"Finetune Like You Pretrain: Boosting Zero-shot Adversarial Robustness in Vision-language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-10T15:57:58.520448Z"},"links":{"citing_paper":"/paper/2604.11576"},"observation_digest":"sha256:5c8ee4d1b732530c10bd07cc9431cf5be8b04857a805738ddd693ffecb13ff87","observation_id":"262a3b6c-ce41-404a-be5f-8457d752ba94","resolution":{"observed_at":"2026-05-17T17:41:59.873837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Laion-400m: Open dataset of clip-filtered 400 million image-text pairs","venue":null,"work_id":"5d75c09f-a41c-4d8c-94dc-72121c2337ba","year":2022},"citing_paper":{"arxiv_id":"2604.11576","last_updated":"2026-04-13T14:54:25Z","snapshot_observed_at":"2026-08-03T07:06:51.599266Z","submitted_at":"2026-04-13T14:54:25Z","title":"Finetune Like You Pretrain: Boosting Zero-shot Adversarial Robustness in Vision-language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-10T15:57:58.520448Z"},"links":{"citing_paper":"/paper/2604.11576"},"observation_digest":"sha256:0f8ebc3105232cc2a90d79d0c71e2e60268d1b21e527ea5e2447cf1c505fa32d","observation_id":"f4e3f746-b7fb-4492-8273-675eda0c8abd","resolution":{"observed_at":"2026-05-17T17:40:03.300541Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"R-tpt: Improving adversarial robustness of vision-language mod- els through test-time prompt tuning","venue":null,"work_id":"fd0e97ee-5a29-4f73-bf5b-4be25efa7ee5","year":2025},"citing_paper":{"arxiv_id":"2604.11576","last_updated":"2026-04-13T14:54:25Z","snapshot_observed_at":"2026-08-03T07:06:51.599266Z","submitted_at":"2026-04-13T14:54:25Z","title":"Finetune Like You Pretrain: Boosting Zero-shot Adversarial Robustness in Vision-language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-10T15:57:58.520448Z"},"links":{"citing_paper":"/paper/2604.11576"},"observation_digest":"sha256:f592169de4f2118d14731fc2b353c5de7f1258541c6884de0acc1e8a57c40c8a","observation_id":"d731e7c0-cb8f-4888-8943-2ba02161a9c3","resolution":{"observed_at":"2026-05-17T17:40:03.226367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Intriguing properties of neural networks","venue":null,"work_id":"94772228-fe9c-4b20-addf-880402cc46a0","year":2014},"citing_paper":{"arxiv_id":"2604.11576","last_updated":"2026-04-13T14:54:25Z","snapshot_observed_at":"2026-08-03T07:06:51.599266Z","submitted_at":"2026-04-13T14:54:25Z","title":"Finetune Like You Pretrain: Boosting Zero-shot Adversarial Robustness in Vision-language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-10T15:57:58.520448Z"},"links":{"citing_paper":"/paper/2604.11576"},"observation_digest":"sha256:e64b85caf6fa8ee00135cac849b2bf72ce0b9246a4915fd1c17feb013fe24ba9","observation_id":"565db654-3039-4bb5-b642-03ea5064bba3","resolution":{"observed_at":"2026-05-17T17:40:03.282577Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On the zero-shot adversarial robustness of vision-language models: A truly zero-shot and training-free approach","venue":null,"work_id":"3b458426-966f-42f3-8d18-b0a69d6b9f39","year":2025},"citing_paper":{"arxiv_id":"2604.11576","last_updated":"2026-04-13T14:54:25Z","snapshot_observed_at":"2026-08-03T07:06:51.599266Z","submitted_at":"2026-04-13T14:54:25Z","title":"Finetune Like You Pretrain: Boosting Zero-shot Adversarial Robustness in Vision-language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-10T15:57:58.520448Z"},"links":{"citing_paper":"/paper/2604.11576"},"observation_digest":"sha256:e746e1d3a56956ff9c2c7234aa14b66ac245897f2e2d2f6b5afcdb8fe32eebf7","observation_id":"75c4081a-6126-4fe1-b8be-11296fdf9a64","resolution":{"observed_at":"2026-05-17T17:41:59.885428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning robust global representations by penalizing local predictive power.Advances in neural information processing systems, 32","venue":null,"work_id":"13524b91-7c03-42ff-9973-75c5ae856ea2","year":2019},"citing_paper":{"arxiv_id":"2604.11576","last_updated":"2026-04-13T14:54:25Z","snapshot_observed_at":"2026-08-03T07:06:51.599266Z","submitted_at":"2026-04-13T14:54:25Z","title":"Finetune Like You Pretrain: Boosting Zero-shot Adversarial Robustness in Vision-language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-10T15:57:58.520448Z"},"links":{"citing_paper":"/paper/2604.11576"},"observation_digest":"sha256:cda40565b98b6051edc5d6607adf665dc383043b441c1c14b50d24c72568d6fc","observation_id":"91d54fe2-7df3-40db-beee-ad7e2e3bb2eb","resolution":{"observed_at":"2026-05-17T17:40:03.323916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Declip: Decoupled learning for open- vocabulary dense perception","venue":null,"work_id":"f273cfab-6bb9-41d6-9d0e-e1cd629755cb","year":2025},"citing_paper":{"arxiv_id":"2604.11576","last_updated":"2026-04-13T14:54:25Z","snapshot_observed_at":"2026-08-03T07:06:51.599266Z","submitted_at":"2026-04-13T14:54:25Z","title":"Finetune Like You Pretrain: Boosting Zero-shot Adversarial Robustness in Vision-language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-10T15:57:58.520448Z"},"links":{"citing_paper":"/paper/2604.11576"},"observation_digest":"sha256:504e32487995093b600e20027cbd1d5d5b5a7486c6378724cb4762013f664700","observation_id":"df666936-8370-41bd-9086-f05ad16e1977","resolution":{"observed_at":"2026-05-17T17:41:59.957557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pre- trained model guided fine-tuning for zero-shot adversarial robustness","venue":null,"work_id":"c7d7f5ef-8132-405b-971a-fbb8ca6734e5","year":null},"citing_paper":{"arxiv_id":"2604.11576","last_updated":"2026-04-13T14:54:25Z","snapshot_observed_at":"2026-08-03T07:06:51.599266Z","submitted_at":"2026-04-13T14:54:25Z","title":"Finetune Like You Pretrain: Boosting Zero-shot Adversarial Robustness in Vision-language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-10T15:57:58.520448Z"},"links":{"citing_paper":"/paper/2604.11576"},"observation_digest":"sha256:3fa752690b884399c46eb8cf4b70572001c1cead755c4398c85063a8f2b538cc","observation_id":"417165b8-6c91-4e50-8c09-56f45de5cd16","resolution":{"observed_at":"2026-05-17T17:41:59.916843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tapt: Test-time adversarial prompt tuning for robust inference in vision-language models","venue":null,"work_id":"cfc0f561-bcd4-4381-9d9b-d1a662315b4b","year":2025},"citing_paper":{"arxiv_id":"2604.11576","last_updated":"2026-04-13T14:54:25Z","snapshot_observed_at":"2026-08-03T07:06:51.599266Z","submitted_at":"2026-04-13T14:54:25Z","title":"Finetune Like You Pretrain: Boosting Zero-shot Adversarial Robustness in Vision-language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-10T15:57:58.520448Z"},"links":{"citing_paper":"/paper/2604.11576"},"observation_digest":"sha256:f2828232a0ee5ec6c9a9d7458615a6f011ccde9fcf6c575a17ed4b0bd32cff4a","observation_id":"b8241e98-7a17-4072-9228-9c35c5d237df","resolution":{"observed_at":"2026-05-17T17:41:59.947773Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Quality text, robust vision: The role of language in enhancing visual robustness of vision-language models","venue":null,"work_id":"9a661e15-e110-4b66-a4b0-8ad8c33b7ca6","year":2025},"citing_paper":{"arxiv_id":"2604.11576","last_updated":"2026-04-13T14:54:25Z","snapshot_observed_at":"2026-08-03T07:06:51.599266Z","submitted_at":"2026-04-13T14:54:25Z","title":"Finetune Like You Pretrain: Boosting Zero-shot Adversarial Robustness in Vision-language Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-10T15:57:58.520448Z"},"links":{"citing_paper":"/paper/2604.11576"},"observation_digest":"sha256:b7436024ea2dea94631b2f85bada52bb00466f1afe318ee7fd0177007f085fa5","observation_id":"b44f8bcb-e0fc-4d78-a025-a209ac946acf","resolution":{"observed_at":"2026-05-17T17:41:59.965138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sun database: Large-scale scene recog- nition from abbey to zoo","venue":null,"work_id":"bdeed324-9139-47ee-9095-8cddffb7461e","year":2010},"citing_paper":{"arxiv_id":"2604.11576","last_updated":"2026-04-13T14:54:25Z","snapshot_observed_at":"2026-08-03T07:06:51.599266Z","submitted_at":"2026-04-13T14:54:25Z","title":"Finetune Like You Pretrain: Boosting Zero-shot Adversarial Robustness in Vision-language Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-10T15:57:58.520448Z"},"links":{"citing_paper":"/paper/2604.11576"},"observation_digest":"sha256:79b515a0e87312c38d9033f36b3f3429b925b9a973286085087e7e96e6fce069","observation_id":"d10b628d-94a5-4022-8db0-e29d14d186fe","resolution":{"observed_at":"2026-05-17T17:40:03.286734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Clip is strong enough to fight back: Test-time counterattacks towards zero- shot adversarial robustness of clip","venue":null,"work_id":"31416f69-ea58-475c-8382-a470b4503080","year":2025},"citing_paper":{"arxiv_id":"2604.11576","last_updated":"2026-04-13T14:54:25Z","snapshot_observed_at":"2026-08-03T07:06:51.599266Z","submitted_at":"2026-04-13T14:54:25Z","title":"Finetune Like You Pretrain: Boosting Zero-shot Adversarial Robustness in Vision-language Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-10T15:57:58.520448Z"},"links":{"citing_paper":"/paper/2604.11576"},"observation_digest":"sha256:4c89668862a659bb05d9c694d5aeca5edb0b28f21f5340e89b1fd2a77a67fe42","observation_id":"dd272cff-cba1-4529-a86f-7246b0c109b3","resolution":{"observed_at":"2026-05-17T17:40:03.234241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Text-guided attention is all you need for zero-shot robustness in vision- language models.Advances in Neural Information Processing Systems, 37:96424–96448","venue":null,"work_id":"dfd26237-2b58-44e2-bb85-3c466487d9d3","year":2024},"citing_paper":{"arxiv_id":"2604.11576","last_updated":"2026-04-13T14:54:25Z","snapshot_observed_at":"2026-08-03T07:06:51.599266Z","submitted_at":"2026-04-13T14:54:25Z","title":"Finetune Like You Pretrain: Boosting Zero-shot Adversarial Robustness in Vision-language Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-10T15:57:58.520448Z"},"links":{"citing_paper":"/paper/2604.11576"},"observation_digest":"sha256:6db96c8cb2bc5fda9e2a3ffa99b94d399c3f1dd96bc003869293db4a579f5f18","observation_id":"7426ec7c-e0a2-4e0b-a54a-f4e9d455b511","resolution":{"observed_at":"2026-05-17T17:40:03.222618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Theoretically principled trade-off between robustness and accuracy","venue":null,"work_id":"743fce67-3681-461d-a8be-23da4f45eed3","year":null},"citing_paper":{"arxiv_id":"2604.11576","last_updated":"2026-04-13T14:54:25Z","snapshot_observed_at":"2026-08-03T07:06:51.599266Z","submitted_at":"2026-04-13T14:54:25Z","title":"Finetune Like You Pretrain: Boosting Zero-shot Adversarial Robustness in Vision-language Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-10T15:57:58.520448Z"},"links":{"citing_paper":"/paper/2604.11576"},"observation_digest":"sha256:3665489e59a2357eee07b7708865e998c4c631a0e27d908ea0fd78a3c826ebdd","observation_id":"760b5bb3-733e-4246-90bf-3df19184e925","resolution":{"observed_at":"2026-05-17T17:40:03.200796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Adversarial prompt tuning for vision-language models","venue":null,"work_id":"bfb8621d-e459-4b6a-a9f6-732a5a3c9f47","year":2024},"citing_paper":{"arxiv_id":"2604.11576","last_updated":"2026-04-13T14:54:25Z","snapshot_observed_at":"2026-08-03T07:06:51.599266Z","submitted_at":"2026-04-13T14:54:25Z","title":"Finetune Like You Pretrain: Boosting Zero-shot Adversarial Robustness in Vision-language Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-10T15:57:58.520448Z"},"links":{"citing_paper":"/paper/2604.11576"},"observation_digest":"sha256:a6b0c2ebbfe60a4e6a4596ad5d10140b2cb1053a6ac3a6683872ba655f2fb6cd","observation_id":"ead92761-baff-4e21-91ed-2d4e41ea20ad","resolution":{"observed_at":"2026-05-17T17:40:03.263829Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"CLIPure: Purification in latent space via CLIP for adversarially robust zero-shot classification","venue":null,"work_id":"b762754b-59d1-4832-864b-dda1663077c7","year":null},"citing_paper":{"arxiv_id":"2604.11576","last_updated":"2026-04-13T14:54:25Z","snapshot_observed_at":"2026-08-03T07:06:51.599266Z","submitted_at":"2026-04-13T14:54:25Z","title":"Finetune Like You Pretrain: Boosting Zero-shot Adversarial Robustness in Vision-language Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-10T15:57:58.520448Z"},"links":{"citing_paper":"/paper/2604.11576"},"observation_digest":"sha256:aa2030c0cb420dcab07ce4bb4a135c546c799c3444e092e42487a6bf70d02caf","observation_id":"7c9b4bfb-4b6c-4e7c-ba9b-5716e3799cf6","resolution":{"observed_at":"2026-05-17T17:40:03.314155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Point- clip: Point cloud understanding by clip","venue":null,"work_id":"337d15f7-0d80-4737-b23f-bbfa34659a49","year":2022},"citing_paper":{"arxiv_id":"2604.11576","last_updated":"2026-04-13T14:54:25Z","snapshot_observed_at":"2026-08-03T07:06:51.599266Z","submitted_at":"2026-04-13T14:54:25Z","title":"Finetune Like You Pretrain: Boosting Zero-shot Adversarial Robustness in Vision-language Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-10T15:57:58.520448Z"},"links":{"citing_paper":"/paper/2604.11576"},"observation_digest":"sha256:c9a3e18e1e143922ff12021a1711ead830187c4ec37a076a4e84cd69dfe04452","observation_id":"0ea6e37d-4410-4be9-9759-372aab8d6531","resolution":{"observed_at":"2026-05-17T17:41:59.932825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On evaluating adversarial robustness of large vision-language models.Ad- vances in Neural Information Processing Systems, 36:54111– 54138","venue":null,"work_id":"a56c6a7d-c36e-4c85-823b-5e3a38485126","year":2023},"citing_paper":{"arxiv_id":"2604.11576","last_updated":"2026-04-13T14:54:25Z","snapshot_observed_at":"2026-08-03T07:06:51.599266Z","submitted_at":"2026-04-13T14:54:25Z","title":"Finetune Like You Pretrain: Boosting Zero-shot Adversarial Robustness in Vision-language Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-10T15:57:58.520448Z"},"links":{"citing_paper":"/paper/2604.11576"},"observation_digest":"sha256:0130535f86c9742827775f9e725ab90497d0a222dbb63c77ea34d040b3bad44e","observation_id":"507f72d2-4c98-4e7b-88cb-c71bdffb41e4","resolution":{"observed_at":"2026-05-17T17:41:59.914162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Regionclip: Region-based language- image pretraining","venue":null,"work_id":"1117c404-1602-4265-81c6-1d04ab845593","year":2022},"citing_paper":{"arxiv_id":"2604.11576","last_updated":"2026-04-13T14:54:25Z","snapshot_observed_at":"2026-08-03T07:06:51.599266Z","submitted_at":"2026-04-13T14:54:25Z","title":"Finetune Like You Pretrain: Boosting Zero-shot Adversarial Robustness in Vision-language Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-10T15:57:58.520448Z"},"links":{"citing_paper":"/paper/2604.11576"},"observation_digest":"sha256:ceb6e2c26f65aca3348a645290f145e4ea5833aaac51e4017d838b19a8704686","observation_id":"8b8a02df-649f-490c-9bf9-39a81a0e70bc","resolution":{"observed_at":"2026-05-17T17:41:59.881953Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Conditional prompt learning for vision-language models","venue":null,"work_id":"6b1f5162-55aa-4555-85d7-1e812a987d72","year":2022},"citing_paper":{"arxiv_id":"2604.11576","last_updated":"2026-04-13T14:54:25Z","snapshot_observed_at":"2026-08-03T07:06:51.599266Z","submitted_at":"2026-04-13T14:54:25Z","title":"Finetune Like You Pretrain: Boosting Zero-shot Adversarial Robustness in Vision-language Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-10T15:57:58.520448Z"},"links":{"citing_paper":"/paper/2604.11576"},"observation_digest":"sha256:918fdb2361c518bdd21b7a6eae145a359ef6d41f0e7669568c3fa7fa00f2bc84","observation_id":"9b6b2ca5-cc1b-4a31-816b-c939ff65b8ed","resolution":{"observed_at":"2026-05-17T17:41:59.967213Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning to prompt for vision-language models.Interna- tional Journal of Computer Vision, 130(9):2337–2348","venue":null,"work_id":"677bba17-3be8-44a5-9f5a-b5ebf9cf3176","year":2022},"citing_paper":{"arxiv_id":"2604.11576","last_updated":"2026-04-13T14:54:25Z","snapshot_observed_at":"2026-08-03T07:06:51.599266Z","submitted_at":"2026-04-13T14:54:25Z","title":"Finetune Like You Pretrain: Boosting Zero-shot Adversarial Robustness in Vision-language Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-10T15:57:58.520448Z"},"links":{"citing_paper":"/paper/2604.11576"},"observation_digest":"sha256:0c582648c0d034098961dc1996fad1d6e79544c6fc69539b834d2416dcc867ac","observation_id":"2e7aabab-c560-4374-b7d3-3fb76ced370c","resolution":{"observed_at":"2026-05-17T17:41:59.942578Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Few-shot adversarial prompt learning on vision-language models.Advances in Neural Information Processing Systems, 37:3122–3156","venue":null,"work_id":"b12b09d7-2dc1-4eef-bbdf-112e6bde2a08","year":2024},"citing_paper":{"arxiv_id":"2604.11576","last_updated":"2026-04-13T14:54:25Z","snapshot_observed_at":"2026-08-03T07:06:51.599266Z","submitted_at":"2026-04-13T14:54:25Z","title":"Finetune Like You Pretrain: Boosting Zero-shot Adversarial Robustness in Vision-language Models","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-10T15:57:58.520448Z"},"links":{"citing_paper":"/paper/2604.11576"},"observation_digest":"sha256:6e917a6cfac55c0145f84b267ef2a4bfa2606d93ea33e6538878a6c54d2fc38e","observation_id":"5ed3e947-31f9-4691-890f-88eab8cf079a","resolution":{"observed_at":"2026-05-17T17:41:59.898957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models","venue":null,"work_id":"4be78a0c-ed02-4435-a425-51df284a8904","year":2024},"citing_paper":{"arxiv_id":"2604.11576","last_updated":"2026-04-13T14:54:25Z","snapshot_observed_at":"2026-08-03T07:06:51.599266Z","submitted_at":"2026-04-13T14:54:25Z","title":"Finetune Like You Pretrain: Boosting Zero-shot Adversarial Robustness in Vision-language Models","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-10T15:57:58.520448Z"},"links":{"citing_paper":"/paper/2604.11576"},"observation_digest":"sha256:20112a144cd37ab9ef6b73ba5dcae7586c2bd5f2d7cba6e12b599ea3f697967f","observation_id":"60802fe9-1143-436b-9d99-3efe2b593a72","resolution":{"observed_at":"2026-05-17T17:40:03.254430Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"9c16e0c3-ec68-4e96-badb-0ac6b4563e16","year":null},"citing_paper":{"arxiv_id":"2604.11576","last_updated":"2026-04-13T14:54:25Z","snapshot_observed_at":"2026-08-03T07:06:51.599266Z","submitted_at":"2026-04-13T14:54:25Z","title":"Finetune Like You Pretrain: Boosting Zero-shot Adversarial Robustness in Vision-language Models","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-10T15:57:58.520448Z"},"links":{"citing_paper":"/paper/2604.11576"},"observation_digest":"sha256:07c15ece331801fbad44ba05842ee7938c361a637d98bddc9e7197adf1786867","observation_id":"c60f7ccc-6d42-4e5f-824f-4976c47e2c04","resolution":{"observed_at":"2026-05-17T17:40:03.250680Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"dfe2f00f-800c-4442-8788-f97d81a79bf4","year":null},"citing_paper":{"arxiv_id":"2604.11576","last_updated":"2026-04-13T14:54:25Z","snapshot_observed_at":"2026-08-03T07:06:51.599266Z","submitted_at":"2026-04-13T14:54:25Z","title":"Finetune Like You Pretrain: Boosting Zero-shot Adversarial Robustness in Vision-language Models","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-10T15:57:58.520448Z"},"links":{"citing_paper":"/paper/2604.11576"},"observation_digest":"sha256:beb985b326b2d359d96613b2d2e2c766311ec39e7c8d10116d287decedd991a3","observation_id":"53d73022-d57b-41b0-8714-b74cadc4e6e1","resolution":{"observed_at":"2026-05-17T17:40:03.290694Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"4132.9815","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Robustness under Higher Attack Budgets We report the full tables of robustness evaluated under the attack strength of ϵ= 2/255 and ϵ= 4/255 in Tab","venue":null,"work_id":"96be1c3a-3dc4-497a-bda9-9ac89d475d69","year":1917},"citing_paper":{"arxiv_id":"2604.11576","last_updated":"2026-04-13T14:54:25Z","snapshot_observed_at":"2026-08-03T07:06:51.599266Z","submitted_at":"2026-04-13T14:54:25Z","title":"Finetune Like You Pretrain: Boosting Zero-shot Adversarial Robustness in Vision-language Models","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-10T15:57:58.520448Z"},"links":{"citing_paper":"/paper/2604.11576"},"observation_digest":"sha256:aa81b28fbcc6c64ab8c361a01e7aee130dedc36eae5dbd268c43794da272167b","observation_id":"0603ecfd-e201-46b6-b210-0978bc633f82","resolution":{"observed_at":"2026-05-11T09:31:05.879592Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"This paradigm is reasonable in the sense that the fine- tuned CLIP is to be deployed in downstream classification datasets","venue":null,"work_id":"91af5236-07b7-41dd-9bb2-19b067299a00","year":null},"citing_paper":{"arxiv_id":"2604.11576","last_updated":"2026-04-13T14:54:25Z","snapshot_observed_at":"2026-08-03T07:06:51.599266Z","submitted_at":"2026-04-13T14:54:25Z","title":"Finetune Like You Pretrain: Boosting Zero-shot Adversarial Robustness in Vision-language Models","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-10T15:57:58.520448Z"},"links":{"citing_paper":"/paper/2604.11576"},"observation_digest":"sha256:3731b282b4bd6d5b2226e7c34f54fcd2c53b6a0cea6854003c0ebd0af06cfef1","observation_id":"62dcbf51-e7ad-4e57-8c56-4bd74941161e","resolution":{"observed_at":"2026-05-17T17:40:03.304298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"43b93c51-8600-4747-bf0b-fc50435c64f7","year":null},"citing_paper":{"arxiv_id":"2604.11576","last_updated":"2026-04-13T14:54:25Z","snapshot_observed_at":"2026-08-03T07:06:51.599266Z","submitted_at":"2026-04-13T14:54:25Z","title":"Finetune Like You Pretrain: Boosting Zero-shot Adversarial Robustness in Vision-language Models","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-10T15:57:58.520448Z"},"links":{"citing_paper":"/paper/2604.11576"},"observation_digest":"sha256:da0bf2aa69e77f0ae7713ec7031dfd58707fe43793a3a43bdddcbb572072c53e","observation_id":"0a1bacac-8d7d-4ac3-95c8-3e858318cfed","resolution":{"observed_at":"2026-05-17T17:41:59.950100Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.11576","last_updated":"2026-04-13T14:54:25Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-03T07:06:51.599266Z","submitted_at":"2026-04-13T14:54:25Z","title":"Finetune Like You Pretrain: Boosting Zero-shot Adversarial Robustness in Vision-language Models"},"reference_resolution":{"displayed":71,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":5,"verified_exact":2,"verified_fuzzy":63},"total_outbound_references":71},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 71 of 71 outbound references and 1 inbound Pith citation observation for arXiv:2604.11576."}