{"as_of":"2026-08-09T22:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cd36e9c946eb7bebb9179aa70e1302da945d9235f97ded70ee6262fd020df674","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T23:31:51.830778Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.27897/citation-record","integrity":"/paper/2607.27897/integrity","json":"/paper/2607.27897/citation-record.json","paper":"/paper/2607.27897"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:31:47.095781Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.27897","last_updated":"2026-07-30T09:13:35Z","snapshot_observed_at":"2026-08-09T09:14:57.836359Z","submitted_at":"2026-07-30T09:13:35Z","title":"Unifying Adversarially Robust Model Experts in Vision-Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-31T23:31:47.095781Z"},"links":{"citing_paper":"/paper/2607.27897"},"observation_digest":"sha256:4c32d65599a23f5ee5c183f8e32471e87537a3e454b9c75f78becc9e6e8a9f70","observation_id":"bf45c194-9d57-4460-9aa2-5b56008eeef0","resolution":{"observed_at":"2026-07-31T23:31:47.095781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:31:47.251520Z","title":"On the adversarial robustness of multi- modal foundation models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.27897","last_updated":"2026-07-30T09:13:35Z","snapshot_observed_at":"2026-08-09T09:14:57.836359Z","submitted_at":"2026-07-30T09:13:35Z","title":"Unifying Adversarially Robust Model Experts in Vision-Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-31T23:31:47.251520Z"},"links":{"citing_paper":"/paper/2607.27897"},"observation_digest":"sha256:6538854c12513d47500a0c1bbea52f44e4232f46f8017553d985cc52101b085d","observation_id":"fa8698d5-9f40-4378-be31-41093d69e6d6","resolution":{"observed_at":"2026-07-31T23:31:47.251520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.06083","last_updated":"2019-09-04T18:53:10Z","snapshot_observed_at":"2026-08-07T14:27:46.872660Z","submitted_at":"2017-06-19T17:53:11Z","title":"Towards Deep Learning Models Resistant to Adversarial Attacks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.06083","snapshot_observed_at":"2026-07-31T23:31:47.502499Z","title":"Towards deep learning models resistant to adversarial attacks,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.27897","last_updated":"2026-07-30T09:13:35Z","snapshot_observed_at":"2026-08-09T09:14:57.836359Z","submitted_at":"2026-07-30T09:13:35Z","title":"Unifying Adversarially Robust Model Experts in Vision-Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-31T23:31:47.502499Z"},"links":{"cited_paper":"/paper/1706.06083","citing_paper":"/paper/2607.27897"},"observation_digest":"sha256:eb40f0fd88df19ed1b2cbf18cd5d8b5925811212614750165b5cfdcba47a8743","observation_id":"dc2b84ac-b237-4149-8aaa-88010b3a9ac0","resolution":{"observed_at":"2026-07-31T23:31:47.502499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:31:47.630155Z","title":"Theoretically principled trade-off between robustness and accuracy,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.27897","last_updated":"2026-07-30T09:13:35Z","snapshot_observed_at":"2026-08-09T09:14:57.836359Z","submitted_at":"2026-07-30T09:13:35Z","title":"Unifying Adversarially Robust Model Experts in Vision-Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-31T23:31:47.630155Z"},"links":{"citing_paper":"/paper/2607.27897"},"observation_digest":"sha256:f814d5cd5b815fa3266c3bff7118af7520db5e165e7d30efeaae57a4d57e5f3c","observation_id":"b142ab8b-c190-4360-8b88-88f4d9791cd6","resolution":{"observed_at":"2026-07-31T23:31:47.630155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.07016","last_updated":"2023-04-21T17:08:27Z","snapshot_observed_at":"2026-08-02T07:43:21.690977Z","submitted_at":"2022-12-14T04:08:56Z","title":"Understanding Zero-Shot Adversarial Robustness for Large-Scale Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.07016","snapshot_observed_at":"2026-07-31T23:31:47.764957Z","title":"Understanding zero-shot adversarial robustness for large-scale models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.27897","last_updated":"2026-07-30T09:13:35Z","snapshot_observed_at":"2026-08-09T09:14:57.836359Z","submitted_at":"2026-07-30T09:13:35Z","title":"Unifying Adversarially Robust Model Experts in Vision-Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-31T23:31:47.764957Z"},"links":{"cited_paper":"/paper/2212.07016","citing_paper":"/paper/2607.27897"},"observation_digest":"sha256:54f1854d7f0c62f71f97fbe208a119cb7411d9aa657b086e503fc3454e5d66f3","observation_id":"15c12e7a-ee39-40c6-bcc1-aa48c37a08a1","resolution":{"observed_at":"2026-07-31T23:31:47.764957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:31:47.964419Z","title":"Text-guided attention is all you need for zero-shot robustness in vision-language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27897","last_updated":"2026-07-30T09:13:35Z","snapshot_observed_at":"2026-08-09T09:14:57.836359Z","submitted_at":"2026-07-30T09:13:35Z","title":"Unifying Adversarially Robust Model Experts in Vision-Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-31T23:31:47.964419Z"},"links":{"citing_paper":"/paper/2607.27897"},"observation_digest":"sha256:fa4506453c53a7fab10cd2cc80c192f4c2ade7db9e8a2e6d20a924a796a894b5","observation_id":"8bbfbfea-6272-485c-92f9-0341c6359525","resolution":{"observed_at":"2026-07-31T23:31:47.964419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:31:48.045782Z","title":"Generalist: Decoupling natural and robust gen- eralization,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.27897","last_updated":"2026-07-30T09:13:35Z","snapshot_observed_at":"2026-08-09T09:14:57.836359Z","submitted_at":"2026-07-30T09:13:35Z","title":"Unifying Adversarially Robust Model Experts in Vision-Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-31T23:31:48.045782Z"},"links":{"citing_paper":"/paper/2607.27897"},"observation_digest":"sha256:0336ab980d6aedb59c20b1173938fe9438d757716ad246ead6bd0ec9baa42382","observation_id":"c69bc4c5-5da8-4ecc-960a-91b6b658c52d","resolution":{"observed_at":"2026-07-31T23:31:48.045782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:31:48.121662Z","title":"Adversarially robust few-shot learning via parameter co-distillation of similarity and class concept learners,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27897","last_updated":"2026-07-30T09:13:35Z","snapshot_observed_at":"2026-08-09T09:14:57.836359Z","submitted_at":"2026-07-30T09:13:35Z","title":"Unifying Adversarially Robust Model Experts in Vision-Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-31T23:31:48.121662Z"},"links":{"citing_paper":"/paper/2607.27897"},"observation_digest":"sha256:a683534d271ac3d903f9df704f5dfa838093de4e5423cd86b1d1ba296084c271","observation_id":"7dca82ae-6007-4baa-8beb-6b7ee38a5710","resolution":{"observed_at":"2026-07-31T23:31:48.121662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:31:48.240917Z","title":"Scaling up visual and vision-language representation learning with noisy text supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.27897","last_updated":"2026-07-30T09:13:35Z","snapshot_observed_at":"2026-08-09T09:14:57.836359Z","submitted_at":"2026-07-30T09:13:35Z","title":"Unifying Adversarially Robust Model Experts in Vision-Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-31T23:31:48.240917Z"},"links":{"citing_paper":"/paper/2607.27897"},"observation_digest":"sha256:68bb10aa1361f1cc51ef440fee7761b74113bcf07ad51d53943d57f103c02bd0","observation_id":"23c76e7d-b28d-4352-8554-e6cac7618b02","resolution":{"observed_at":"2026-07-31T23:31:48.240917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:31:48.331739Z","title":"Align before fuse: Vision and language representation learning with momentum distillation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.27897","last_updated":"2026-07-30T09:13:35Z","snapshot_observed_at":"2026-08-09T09:14:57.836359Z","submitted_at":"2026-07-30T09:13:35Z","title":"Unifying Adversarially Robust Model Experts in Vision-Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-31T23:31:48.331739Z"},"links":{"citing_paper":"/paper/2607.27897"},"observation_digest":"sha256:d78c3d0dcf2c95a31845e4b738aee0dd86ecb6f2112555c719669b92de6e1b9e","observation_id":"8328cc14-6121-4743-b00d-d900d443491f","resolution":{"observed_at":"2026-07-31T23:31:48.331739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:31:48.337097Z","title":"Flamingo: a visual language model for few-shot learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.27897","last_updated":"2026-07-30T09:13:35Z","snapshot_observed_at":"2026-08-09T09:14:57.836359Z","submitted_at":"2026-07-30T09:13:35Z","title":"Unifying Adversarially Robust Model Experts in Vision-Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-31T23:31:48.337097Z"},"links":{"citing_paper":"/paper/2607.27897"},"observation_digest":"sha256:9e68309397b9b4cfee2cefe52b18a05909d59e855a4412feb13e5007b3adfabc","observation_id":"930400d6-7775-4bdd-9a5e-40669587a5a6","resolution":{"observed_at":"2026-07-31T23:31:48.337097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01390","last_updated":"2023-08-07T17:53:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-02T19:10:23Z","title":"OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01390","snapshot_observed_at":"2026-07-31T23:31:48.350233Z","title":"Openflamingo: An open-source framework for training large autoregressive vision-language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.27897","last_updated":"2026-07-30T09:13:35Z","snapshot_observed_at":"2026-08-09T09:14:57.836359Z","submitted_at":"2026-07-30T09:13:35Z","title":"Unifying Adversarially Robust Model Experts in Vision-Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-31T23:31:48.350233Z"},"links":{"cited_paper":"/paper/2308.01390","citing_paper":"/paper/2607.27897"},"observation_digest":"sha256:b9decf3d938cfaa9bf772284adbcf18557df2af2ea1a2b51aef0a7786baf6b5d","observation_id":"e140a7c5-cf8f-4944-9770-730abd74c9a0","resolution":{"observed_at":"2026-07-31T23:31:48.350233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:31:48.369198Z","title":"Visual instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.27897","last_updated":"2026-07-30T09:13:35Z","snapshot_observed_at":"2026-08-09T09:14:57.836359Z","submitted_at":"2026-07-30T09:13:35Z","title":"Unifying Adversarially Robust Model Experts in Vision-Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-31T23:31:48.369198Z"},"links":{"citing_paper":"/paper/2607.27897"},"observation_digest":"sha256:ea24b00aed3c11c3bfcbd58387dd0fe0036443c15ba96b6931a2c0879c3a4a33","observation_id":"3c9bbc45-f05f-4c49-b8d4-f9dbf96cfdf0","resolution":{"observed_at":"2026-07-31T23:31:48.369198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:31:48.392674Z","title":"Visual adversarial examples jailbreak large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.27897","last_updated":"2026-07-30T09:13:35Z","snapshot_observed_at":"2026-08-09T09:14:57.836359Z","submitted_at":"2026-07-30T09:13:35Z","title":"Unifying Adversarially Robust Model Experts in Vision-Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-31T23:31:48.392674Z"},"links":{"citing_paper":"/paper/2607.27897"},"observation_digest":"sha256:817563c8f6174bbe518df87321997b359bf528e3c45f3fcdd601111cb9e45ea7","observation_id":"01cd3881-2913-40f6-9d2a-b266b17b7a22","resolution":{"observed_at":"2026-07-31T23:31:48.392674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:31:48.466618Z","title":"Are aligned neural networks adversarially aligned?","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.27897","last_updated":"2026-07-30T09:13:35Z","snapshot_observed_at":"2026-08-09T09:14:57.836359Z","submitted_at":"2026-07-30T09:13:35Z","title":"Unifying Adversarially Robust Model Experts in Vision-Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-31T23:31:48.466618Z"},"links":{"citing_paper":"/paper/2607.27897"},"observation_digest":"sha256:c45c6bb4aef25e43cfa2a60f8a889626a2e785ae51ce268d256a6c5321883f65","observation_id":"b590d260-02a2-4efb-b141-04f4d658bbc9","resolution":{"observed_at":"2026-07-31T23:31:48.466618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:31:48.555495Z","title":"On evaluating adversarial robustness of large vision-language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.27897","last_updated":"2026-07-30T09:13:35Z","snapshot_observed_at":"2026-08-09T09:14:57.836359Z","submitted_at":"2026-07-30T09:13:35Z","title":"Unifying Adversarially Robust Model Experts in Vision-Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-31T23:31:48.555495Z"},"links":{"citing_paper":"/paper/2607.27897"},"observation_digest":"sha256:a4d372b026b2c76e5d1ecced88edb232d0bce728d8786c8f903d41f3c26b191b","observation_id":"c26265c5-3f85-4a07-aff8-78c8f4f2ae1b","resolution":{"observed_at":"2026-07-31T23:31:48.555495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08567","last_updated":"2024-06-03T14:15:03Z","snapshot_observed_at":"2026-08-09T09:14:39.779608Z","submitted_at":"2024-02-13T16:06:17Z","title":"Agent Smith: A Single Image Can Jailbreak One Million Multimodal LLM Agents Exponentially Fast","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08567","snapshot_observed_at":"2026-07-31T23:31:48.601478Z","title":"Agent smith: A single image can jailbreak one million multimodal llm agents exponentially fast,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27897","last_updated":"2026-07-30T09:13:35Z","snapshot_observed_at":"2026-08-09T09:14:57.836359Z","submitted_at":"2026-07-30T09:13:35Z","title":"Unifying Adversarially Robust Model Experts in Vision-Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-31T23:31:48.601478Z"},"links":{"cited_paper":"/paper/2402.08567","citing_paper":"/paper/2607.27897"},"observation_digest":"sha256:99d0436a476d4c9b9f2f893d564acc359471b032762e74f6b3578332be312af8","observation_id":"23df2e04-fbc3-44fa-973d-aadfbfe0538e","resolution":{"observed_at":"2026-07-31T23:31:48.601478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:31:48.676822Z","title":"Pre-trained model guided fine-tuning for zero-shot adversarial robustness,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27897","last_updated":"2026-07-30T09:13:35Z","snapshot_observed_at":"2026-08-09T09:14:57.836359Z","submitted_at":"2026-07-30T09:13:35Z","title":"Unifying Adversarially Robust Model Experts in Vision-Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-31T23:31:48.676822Z"},"links":{"citing_paper":"/paper/2607.27897"},"observation_digest":"sha256:790cd4cb6e31abe8a64e6d6f1e3e72fe63c43650423874136d76ea49f055fda1","observation_id":"2e6a60e7-9860-40e7-a013-d1d8feeb40c8","resolution":{"observed_at":"2026-07-31T23:31:48.676822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12336","last_updated":"2024-06-05T15:32:03Z","snapshot_observed_at":"2026-07-06T17:32:24.161667Z","submitted_at":"2024-02-19T18:09:48Z","title":"Robust CLIP: Unsupervised Adversarial Fine-Tuning of Vision Embeddings for Robust Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12336","snapshot_observed_at":"2026-07-31T23:31:48.797271Z","title":"Robust clip: Unsupervised adversarial fine-tuning of vision embeddings for robust large vision-language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27897","last_updated":"2026-07-30T09:13:35Z","snapshot_observed_at":"2026-08-09T09:14:57.836359Z","submitted_at":"2026-07-30T09:13:35Z","title":"Unifying Adversarially Robust Model Experts in Vision-Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-31T23:31:48.797271Z"},"links":{"cited_paper":"/paper/2402.12336","citing_paper":"/paper/2607.27897"},"observation_digest":"sha256:8c143de04b70a402717c05a6c194aac77e55a5140473a4e11595f6bddd99cfa2","observation_id":"45b3fb0f-1089-4e95-9caf-ba4113ac01b8","resolution":{"observed_at":"2026-07-31T23:31:48.797271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:31:48.903810Z","title":"Model soups: averaging weights of multiple fine-tuned models improves accuracy without increasing inference time,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.27897","last_updated":"2026-07-30T09:13:35Z","snapshot_observed_at":"2026-08-09T09:14:57.836359Z","submitted_at":"2026-07-30T09:13:35Z","title":"Unifying Adversarially Robust Model Experts in Vision-Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-31T23:31:48.903810Z"},"links":{"citing_paper":"/paper/2607.27897"},"observation_digest":"sha256:e6db2707af76bdda53dec1abdc626e62c59c0ed5e80606fd4fab89751c0fe2ee","observation_id":"294de650-8b27-4e78-bc99-87290e569616","resolution":{"observed_at":"2026-07-31T23:31:48.903810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04089","last_updated":"2023-03-31T15:27:01Z","snapshot_observed_at":"2026-08-03T22:12:27.993418Z","submitted_at":"2022-12-08T05:50:53Z","title":"Editing Models with Task Arithmetic","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04089","snapshot_observed_at":"2026-07-31T23:31:48.996765Z","title":"Editing models with task arithmetic,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.27897","last_updated":"2026-07-30T09:13:35Z","snapshot_observed_at":"2026-08-09T09:14:57.836359Z","submitted_at":"2026-07-30T09:13:35Z","title":"Unifying Adversarially Robust Model Experts in Vision-Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-31T23:31:48.996765Z"},"links":{"cited_paper":"/paper/2212.04089","citing_paper":"/paper/2607.27897"},"observation_digest":"sha256:33232b285caf4c47dbd52c74d4a96507693c3b795cd337ff4f74140ce74af396","observation_id":"b7fd4dff-496a-40dd-bd17-f72a722fe4bf","resolution":{"observed_at":"2026-07-31T23:31:48.996765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:31:49.078840Z","title":"Task arithmetic in the tangent space: Improved editing of pre-trained models,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27897","last_updated":"2026-07-30T09:13:35Z","snapshot_observed_at":"2026-08-09T09:14:57.836359Z","submitted_at":"2026-07-30T09:13:35Z","title":"Unifying Adversarially Robust Model Experts in Vision-Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-31T23:31:49.078840Z"},"links":{"citing_paper":"/paper/2607.27897"},"observation_digest":"sha256:5aa5c704fcd5d02e8248692e39d14cc1640cea19d0c9b06c3cea86788ea6daf1","observation_id":"500dac07-9e41-4921-92ea-55fc61219cb4","resolution":{"observed_at":"2026-07-31T23:31:49.078840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:31:49.139438Z","title":"Univer- sal adversarial perturbations,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.27897","last_updated":"2026-07-30T09:13:35Z","snapshot_observed_at":"2026-08-09T09:14:57.836359Z","submitted_at":"2026-07-30T09:13:35Z","title":"Unifying Adversarially Robust Model Experts in Vision-Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-31T23:31:49.139438Z"},"links":{"citing_paper":"/paper/2607.27897"},"observation_digest":"sha256:3360b0fce29b9c31ea67fd045725783479dc59de56b4296c3278e0d503600393","observation_id":"f115bc2f-27dd-490f-a304-2cb538d67da8","resolution":{"observed_at":"2026-07-31T23:31:49.139438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:31:49.247036Z","title":"Universal adversarial training,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.27897","last_updated":"2026-07-30T09:13:35Z","snapshot_observed_at":"2026-08-09T09:14:57.836359Z","submitted_at":"2026-07-30T09:13:35Z","title":"Unifying Adversarially Robust Model Experts in Vision-Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-31T23:31:49.247036Z"},"links":{"citing_paper":"/paper/2607.27897"},"observation_digest":"sha256:59f2db575c8ca272d482c1e61f7b2f048416c455512d64a5f6ace37b2c592d15","observation_id":"30ddb735-2032-410e-b37c-79e31f490014","resolution":{"observed_at":"2026-07-31T23:31:49.247036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:31:49.357623Z","title":"Imagenet: A large-scale hierarchical image database,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2607.27897","last_updated":"2026-07-30T09:13:35Z","snapshot_observed_at":"2026-08-09T09:14:57.836359Z","submitted_at":"2026-07-30T09:13:35Z","title":"Unifying Adversarially Robust Model Experts in Vision-Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-31T23:31:49.357623Z"},"links":{"citing_paper":"/paper/2607.27897"},"observation_digest":"sha256:17346c294674b83da96e21339bd65b1742f9f75bc55de40838945da15396097f","observation_id":"398336b2-a552-4372-9aca-f196740988a7","resolution":{"observed_at":"2026-07-31T23:31:49.357623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:31:49.474875Z","title":"Reliable evaluation of adversarial robustness with an ensemble of diverse parameter-free attacks,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.27897","last_updated":"2026-07-30T09:13:35Z","snapshot_observed_at":"2026-08-09T09:14:57.836359Z","submitted_at":"2026-07-30T09:13:35Z","title":"Unifying Adversarially Robust Model Experts in Vision-Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-31T23:31:49.474875Z"},"links":{"citing_paper":"/paper/2607.27897"},"observation_digest":"sha256:03140680be856e73ea9fd2f2e1b4ce3d746b0ae0847e4bb92c1fa5af64f1d5b8","observation_id":"48819f16-29fc-4aff-a840-10c6dce7ed71","resolution":{"observed_at":"2026-07-31T23:31:49.474875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:31:49.599553Z","title":"Decoupled weight decay regularization,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.27897","last_updated":"2026-07-30T09:13:35Z","snapshot_observed_at":"2026-08-09T09:14:57.836359Z","submitted_at":"2026-07-30T09:13:35Z","title":"Unifying Adversarially Robust Model Experts in Vision-Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-31T23:31:49.599553Z"},"links":{"citing_paper":"/paper/2607.27897"},"observation_digest":"sha256:014034c60ddf8e112394a0ff454008dc65da40ab2656b775f724ff22d4164247","observation_id":"6273e9e1-242d-49d7-aa3d-abbfaf67fa65","resolution":{"observed_at":"2026-07-31T23:31:49.599553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:31:49.700627Z","title":"An analysis of single-layer networks in unsupervised feature learning,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2607.27897","last_updated":"2026-07-30T09:13:35Z","snapshot_observed_at":"2026-08-09T09:14:57.836359Z","submitted_at":"2026-07-30T09:13:35Z","title":"Unifying Adversarially Robust Model Experts in Vision-Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-31T23:31:49.700627Z"},"links":{"citing_paper":"/paper/2607.27897"},"observation_digest":"sha256:3f3f1039ce59b045ff2a81bd7db0433e7174da5395d8de00acafa2bf0b207f02","observation_id":"ea40a64b-5de2-4d99-a9f2-5d2b83512cf9","resolution":{"observed_at":"2026-07-31T23:31:49.700627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:31:49.791695Z","title":"Learning multiple layers of features from tiny images,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2607.27897","last_updated":"2026-07-30T09:13:35Z","snapshot_observed_at":"2026-08-09T09:14:57.836359Z","submitted_at":"2026-07-30T09:13:35Z","title":"Unifying Adversarially Robust Model Experts in Vision-Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-31T23:31:49.791695Z"},"links":{"citing_paper":"/paper/2607.27897"},"observation_digest":"sha256:d162d4469928ac00312230dff7dc7f63ac09004eeb64fcdc63de18d9ce38c1e3","observation_id":"cb37eafb-d292-4818-a706-8bbb8a043fea","resolution":{"observed_at":"2026-07-31T23:31:49.791695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:31:49.887435Z","title":"Learning generative visual models from few training examples: An incremental bayesian approach tested on 101 object categories,","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2607.27897","last_updated":"2026-07-30T09:13:35Z","snapshot_observed_at":"2026-08-09T09:14:57.836359Z","submitted_at":"2026-07-30T09:13:35Z","title":"Unifying Adversarially Robust Model Experts in Vision-Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-31T23:31:49.887435Z"},"links":{"citing_paper":"/paper/2607.27897"},"observation_digest":"sha256:5cc0ebad576263616cab7175ee2a0565f0fd4a51b44ef8f89773e8331f68443d","observation_id":"b129fb9d-04f4-44eb-b471-a85daafb6305","resolution":{"observed_at":"2026-07-31T23:31:49.887435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:31:50.036951Z","title":"3d object representations for fine-grained categorization,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2607.27897","last_updated":"2026-07-30T09:13:35Z","snapshot_observed_at":"2026-08-09T09:14:57.836359Z","submitted_at":"2026-07-30T09:13:35Z","title":"Unifying Adversarially Robust Model Experts in Vision-Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-31T23:31:50.036951Z"},"links":{"citing_paper":"/paper/2607.27897"},"observation_digest":"sha256:bba1a6babcbde878c006c56cba615d9892407708cb99981c6344bcc4873029a5","observation_id":"b940b0ad-2664-4d7a-947c-7e17d1fcdcd7","resolution":{"observed_at":"2026-07-31T23:31:50.036951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:31:50.125618Z","title":"Cats and dogs,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2607.27897","last_updated":"2026-07-30T09:13:35Z","snapshot_observed_at":"2026-08-09T09:14:57.836359Z","submitted_at":"2026-07-30T09:13:35Z","title":"Unifying Adversarially Robust Model Experts in Vision-Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-31T23:31:50.125618Z"},"links":{"citing_paper":"/paper/2607.27897"},"observation_digest":"sha256:61f93bee69618dca8ebd379f80c49ad03e0d6c2080c2c692813e53acbfeaa3f7","observation_id":"c7016b0e-95ba-4d8d-ab86-0e0f3693777d","resolution":{"observed_at":"2026-07-31T23:31:50.125618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:31:50.249320Z","title":"Automated flower classification over a large number of classes,","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2607.27897","last_updated":"2026-07-30T09:13:35Z","snapshot_observed_at":"2026-08-09T09:14:57.836359Z","submitted_at":"2026-07-30T09:13:35Z","title":"Unifying Adversarially Robust Model Experts in Vision-Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-31T23:31:50.249320Z"},"links":{"citing_paper":"/paper/2607.27897"},"observation_digest":"sha256:2df88745a2148593123bb094b6f48d3de936024acf6db9e7c4046014f0583d60","observation_id":"6940ef55-4729-48be-90ce-3b99be28da29","resolution":{"observed_at":"2026-07-31T23:31:50.249320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1306.5151","last_updated":"2013-06-21T14:31:57Z","snapshot_observed_at":"2026-07-06T03:16:28.287173Z","submitted_at":"2013-06-21T14:31:57Z","title":"Fine-Grained Visual Classification of Aircraft","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1306.5151","snapshot_observed_at":"2026-07-31T23:31:50.346634Z","title":"Fine- grained visual classification of aircraft,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27897","last_updated":"2026-07-30T09:13:35Z","snapshot_observed_at":"2026-08-09T09:14:57.836359Z","submitted_at":"2026-07-30T09:13:35Z","title":"Unifying Adversarially Robust Model Experts in Vision-Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-31T23:31:50.346634Z"},"links":{"cited_paper":"/paper/1306.5151","citing_paper":"/paper/2607.27897"},"observation_digest":"sha256:6554a0ee8b0255a7e7d0b9c83d04abb7bb8887dcdef59a227f7c286705b102b0","observation_id":"43a8e4b0-28ff-4a01-b084-d9c2d97bfc3c","resolution":{"observed_at":"2026-07-31T23:31:50.346634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:31:50.466946Z","title":"Describing textures in the wild,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.27897","last_updated":"2026-07-30T09:13:35Z","snapshot_observed_at":"2026-08-09T09:14:57.836359Z","submitted_at":"2026-07-30T09:13:35Z","title":"Unifying Adversarially Robust Model Experts in Vision-Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-31T23:31:50.466946Z"},"links":{"citing_paper":"/paper/2607.27897"},"observation_digest":"sha256:680d19ac8b3d4e7f73396d53bf42fd6315f91876219491c55f9c72f4cee0b7f1","observation_id":"ce111af3-6a65-4960-9714-4e709e6522c3","resolution":{"observed_at":"2026-07-31T23:31:50.466946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:31:50.621868Z","title":"Eurosat: A novel dataset and deep learning benchmark for land use and land cover classi- fication,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.27897","last_updated":"2026-07-30T09:13:35Z","snapshot_observed_at":"2026-08-09T09:14:57.836359Z","submitted_at":"2026-07-30T09:13:35Z","title":"Unifying Adversarially Robust Model Experts in Vision-Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-31T23:31:50.621868Z"},"links":{"citing_paper":"/paper/2607.27897"},"observation_digest":"sha256:a49b05b82f14357e6bfa78c2fbcdfec7684978419c2393db275672baba02c527","observation_id":"03938e6c-5669-4c29-b73d-c337e3c0775a","resolution":{"observed_at":"2026-07-31T23:31:50.621868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:31:50.703866Z","title":"Rotation equivariant cnns for digital pathology,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.27897","last_updated":"2026-07-30T09:13:35Z","snapshot_observed_at":"2026-08-09T09:14:57.836359Z","submitted_at":"2026-07-30T09:13:35Z","title":"Unifying Adversarially Robust Model Experts in Vision-Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-31T23:31:50.703866Z"},"links":{"citing_paper":"/paper/2607.27897"},"observation_digest":"sha256:d90721d4e2eaabf20829ab3eba10709bd8a5ec06ed3f2b50e1cbdb1a103fb4b3","observation_id":"739a9f35-e39e-4ed5-be69-9c0c831b3ff8","resolution":{"observed_at":"2026-07-31T23:31:50.703866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:31:50.830870Z","title":"The many faces of robustness: A critical analysis of out- of-distribution generalization,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.27897","last_updated":"2026-07-30T09:13:35Z","snapshot_observed_at":"2026-08-09T09:14:57.836359Z","submitted_at":"2026-07-30T09:13:35Z","title":"Unifying Adversarially Robust Model Experts in Vision-Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-31T23:31:50.830870Z"},"links":{"citing_paper":"/paper/2607.27897"},"observation_digest":"sha256:07b6e412446f7fd2211a64238c9eeedadff90459d78dd003fe442ec4c165e42d","observation_id":"1a95169a-0d0b-4b16-b88a-fd7e23febd99","resolution":{"observed_at":"2026-07-31T23:31:50.830870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:31:50.958632Z","title":"Learning robust global representations by penalizing local predictive power,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.27897","last_updated":"2026-07-30T09:13:35Z","snapshot_observed_at":"2026-08-09T09:14:57.836359Z","submitted_at":"2026-07-30T09:13:35Z","title":"Unifying Adversarially Robust Model Experts in Vision-Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-31T23:31:50.958632Z"},"links":{"citing_paper":"/paper/2607.27897"},"observation_digest":"sha256:2859a3d80085e4c19841e89f2db762d3d6905db32ee7b9d814cc2eb51fd25e27","observation_id":"73cb773f-b3b9-4882-99f4-3486857c33fe","resolution":{"observed_at":"2026-07-31T23:31:50.958632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:31:51.083857Z","title":"Microsoft coco: Common objects in context,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.27897","last_updated":"2026-07-30T09:13:35Z","snapshot_observed_at":"2026-08-09T09:14:57.836359Z","submitted_at":"2026-07-30T09:13:35Z","title":"Unifying Adversarially Robust Model Experts in Vision-Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-31T23:31:51.083857Z"},"links":{"citing_paper":"/paper/2607.27897"},"observation_digest":"sha256:8321c65f4c69fa833887ccd2c477103cdb87f776d13c5345aa8797e81e312c76","observation_id":"420077dc-c05a-464e-ab08-e5bd321aed7e","resolution":{"observed_at":"2026-07-31T23:31:51.083857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:31:51.207625Z","title":"Flickr30k entities: Collecting region-to-phrase correspondences for richer image-to-sentence models,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.27897","last_updated":"2026-07-30T09:13:35Z","snapshot_observed_at":"2026-08-09T09:14:57.836359Z","submitted_at":"2026-07-30T09:13:35Z","title":"Unifying Adversarially Robust Model Experts in Vision-Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-31T23:31:51.207625Z"},"links":{"citing_paper":"/paper/2607.27897"},"observation_digest":"sha256:45d7f605feeb3b170bb3e54f228809108905beaef976d6b6bc3500422663ece9","observation_id":"b38e76d8-5340-4abf-85bd-6658b821fda0","resolution":{"observed_at":"2026-07-31T23:31:51.207625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:31:51.371847Z","title":"Towards vqa models that can read,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.27897","last_updated":"2026-07-30T09:13:35Z","snapshot_observed_at":"2026-08-09T09:14:57.836359Z","submitted_at":"2026-07-30T09:13:35Z","title":"Unifying Adversarially Robust Model Experts in Vision-Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-31T23:31:51.371847Z"},"links":{"citing_paper":"/paper/2607.27897"},"observation_digest":"sha256:e2aea7e01ad527783767be00e751d317d526db83e379b9d378a3493628a407b9","observation_id":"a1353f3f-c12a-47ca-859f-0b2e05960026","resolution":{"observed_at":"2026-07-31T23:31:51.371847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:31:51.528122Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answering,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.27897","last_updated":"2026-07-30T09:13:35Z","snapshot_observed_at":"2026-08-09T09:14:57.836359Z","submitted_at":"2026-07-30T09:13:35Z","title":"Unifying Adversarially Robust Model Experts in Vision-Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-31T23:31:51.528122Z"},"links":{"citing_paper":"/paper/2607.27897"},"observation_digest":"sha256:874c90e366d410249fde8e1be8fb92c720cd7d0912d2c9575743d6acc26120a9","observation_id":"02af37c5-1e9e-441e-a463-c7422089e416","resolution":{"observed_at":"2026-07-31T23:31:51.528122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:31:51.670822Z","title":"Cider: Consensus- based image description evaluation,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.27897","last_updated":"2026-07-30T09:13:35Z","snapshot_observed_at":"2026-08-09T09:14:57.836359Z","submitted_at":"2026-07-30T09:13:35Z","title":"Unifying Adversarially Robust Model Experts in Vision-Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-31T23:31:51.670822Z"},"links":{"citing_paper":"/paper/2607.27897"},"observation_digest":"sha256:b0893cffc86c6edae8809661142391d95fdfaaded3dab2d60530be9d3ecde69b","observation_id":"bfc4c3df-2b43-4ef8-94d7-a9743a7886f7","resolution":{"observed_at":"2026-07-31T23:31:51.670822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:31:51.830778Z","title":"Vqa: Visual question answering,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.27897","last_updated":"2026-07-30T09:13:35Z","snapshot_observed_at":"2026-08-09T09:14:57.836359Z","submitted_at":"2026-07-30T09:13:35Z","title":"Unifying Adversarially Robust Model Experts in Vision-Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-31T23:31:51.830778Z"},"links":{"citing_paper":"/paper/2607.27897"},"observation_digest":"sha256:5cc0200b33a5b81f5327e99c9c59d88c381d38136048637d977c747ca939b7e6","observation_id":"458ecea5-c183-451c-983e-daea2b234257","resolution":{"observed_at":"2026-07-31T23:31:51.830778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.27897","last_updated":"2026-07-30T09:13:35Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T09:14:57.836359Z","submitted_at":"2026-07-30T09:13:35Z","title":"Unifying Adversarially Robust Model Experts in Vision-Language Models"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":45,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 0 inbound Pith citation observations for arXiv:2607.27897."}