{"as_of":"2026-08-08T04:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:be08b6b4d74e78986c146579ce237d2e4ca56451a63b7b165a5e4a11ee6311e4","coverage":[{"denominator":69,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":69,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T16:37:24.063644Z","state":"measured"},{"denominator":72,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":72,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T21:24:53.437554Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-06T16:28:24.176563Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.13089","snapshot_observed_at":"2026-08-05T21:24:53.437554Z","title":"Glad: Generalizable tuning for vision-language mod- els","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.08812","last_updated":"2025-08-12T10:14:15Z","snapshot_observed_at":"2026-08-05T21:24:50.843638Z","submitted_at":"2025-08-12T10:14:15Z","title":"TARA: Token-Aware LoRA for Composable Personalization in Diffusion Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T21:24:53.437554Z"},"links":{"cited_paper":"/paper/2507.13089","citing_paper":"/paper/2508.08812"},"observation_digest":"sha256:dc81cad69e357cfbc1cd489b34e629b588b3f7c49b1d8bc753a762c8da45acbf","observation_id":"bd78f140-02f5-4e16-b878-6d00bf653a39","resolution":{"observed_at":"2026-08-05T21:24:53.437554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-06T16:28:24.176563Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2507.13089","doi":"10.48550/arxiv.2507.13089","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.13089","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":"ArXiv.org","work_id":"29d2ea58-dc5a-4525-aeac-4ed42dbc5f70","year":2025},"citing_paper":{"arxiv_id":"2604.14262","last_updated":"2026-07-01T10:12:28Z","snapshot_observed_at":"2026-07-12T20:25:38.300915Z","submitted_at":"2026-04-15T16:39:22Z","title":"GUI-Perturbed: Domain Randomization Reveals Systematic Brittleness in GUI Grounding Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T13:39:15.820777Z"},"links":{"cited_paper":"/paper/2507.13089","citing_paper":"/paper/2604.14262"},"observation_digest":"sha256:9d903c0ff511bedad410e174fde48be08307953831fdf83f1cc09e5568cfa7df","observation_id":"30255c27-ef3b-4a30-b360-43510c56f66e","resolution":{"observed_at":"2026-05-10T13:40:26.018918Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-06T16:28:24.176563Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.13089","snapshot_observed_at":"2026-07-12T20:25:41.773345Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.14262","last_updated":"2026-07-01T10:12:28Z","snapshot_observed_at":"2026-07-12T20:25:38.300915Z","submitted_at":"2026-04-15T16:39:22Z","title":"GUI-Perturbed: Domain Randomization Reveals Systematic Brittleness in GUI Grounding Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-12T20:25:41.773345Z"},"links":{"cited_paper":"/paper/2507.13089","citing_paper":"/paper/2604.14262"},"observation_digest":"sha256:61dae02835e970b551a5f707ba6e3f96c0c9d2ee2503e88fa77d092ea9f92022","observation_id":"240109b8-82e3-4783-b64a-5230a8efe68a","resolution":{"observed_at":"2026-07-12T20:25:41.773345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.13089/citation-record","integrity":"/paper/2507.13089/integrity","json":"/paper/2507.13089/citation-record.json","paper":"/paper/2507.13089"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:17.647963Z","title":"Food-101–mining discriminative components with random forests","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-06T16:28:24.176563Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:17.647963Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:34a6704059f62a4042f75902236a8f9ad2dec95f6a12d39e8028118a800fbe16","observation_id":"8c631083-f522-4e07-a307-b4355579d76a","resolution":{"observed_at":"2026-08-06T16:37:17.647963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:28.637205Z","title":"Domain prompt learning with quaternion networks","venue":null,"work_id":"6b93b635-1226-4b90-bd1c-7b2b71887208","year":2024},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-06T16:28:24.176563Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:17.697297Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:c6ea018f6740fec9e630230a91d3053abb995cbeb6d5b4e523f0bda2bc0a8819","observation_id":"18c46557-4c87-4e5d-9b2b-23ae3baf775b","resolution":{"observed_at":"2026-08-06T16:37:28.642311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:28.623669Z","title":"Tokenmixup: Efficient attention-guided token-level data augmentation for transformers","venue":null,"work_id":"f65e171e-e9fc-48c8-8b2a-891fed538466","year":2023},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-06T16:28:24.176563Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:17.771183Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:1883f053eeb7c5366aab62e80643fd6e6975d792154ea5c5078625ce0fe62b08","observation_id":"f5650e68-a17e-43f8-802b-123d6870fa79","resolution":{"observed_at":"2026-08-06T16:37:28.627929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:17.939549Z","title":"Describing textures in the wild","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-06T16:28:24.176563Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:17.939549Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:765ebaf71386b27e38b65485c02cdd05542f6da59bd15c256c8a7ac03bc12ed1","observation_id":"7ef1785a-36f0-40fd-9ea4-f5bb33dd768d","resolution":{"observed_at":"2026-08-06T16:37:17.939549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:28.599292Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":"42683e04-9c7b-495b-b850-ca0e3783d5fb","year":2009},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-06T16:28:24.176563Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:18.028779Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:b2a1d26ffb04805b081a9965d83eaa163da4675542d81f7c0ed52e4628a6649f","observation_id":"0ad76c32-0c90-486f-b8e4-3ea618b7fccf","resolution":{"observed_at":"2026-08-06T16:37:28.603846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:28.585530Z","title":"Learning to prompt for open-vocabulary ob- ject detection with vision-language model","venue":null,"work_id":"8a945263-6a67-4010-b3bd-30266c33a6f8","year":2022},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-06T16:28:24.176563Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:18.104529Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:441bcfb8ca9f7d5e1f6d85af8461e126400053c8cd910483fdcfc4ca332d3eaf","observation_id":"92e68a92-edaa-4485-8bfe-43b4805b65ee","resolution":{"observed_at":"2026-08-06T16:37:28.589929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:28.569055Z","title":"Learning gener- ative visual models from few training examples: An incre- mental bayesian approach tested on 101 object categories","venue":null,"work_id":"3370ed96-d3a0-4056-ac26-f177b7b67279","year":2004},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-06T16:28:24.176563Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:18.176667Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:e59f6db9d38f003a1c32a30d5fd72daa703d26c5520428c124260dacd1199c9f","observation_id":"219ff661-2bad-498b-8dc5-b478deef58ff","resolution":{"observed_at":"2026-08-06T16:37:28.574755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:28.550624Z","title":"Prompt- det: Towards open-vocabulary detection using uncurated im- ages","venue":null,"work_id":"5863cf9c-d1de-4a74-8cf4-5c89c1c7a5dc","year":2022},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-06T16:28:24.176563Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:18.272795Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:49ef57b514be80c69811d4f083646950920e9e518c70ee00e6cb0a91b834c0bd","observation_id":"1cdbdb46-701f-4237-be09-1ffb4e5a7ad3","resolution":{"observed_at":"2026-08-06T16:37:28.555382Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.01412","last_updated":"2021-04-29T16:44:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-03T19:02:10Z","title":"Sharpness-Aware Minimization for Efficiently Improving Generalization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.01412","snapshot_observed_at":"2026-08-06T16:37:18.401393Z","title":"Sharpness-aware minimization for efficiently improving generalization","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-06T16:28:24.176563Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:18.401393Z"},"links":{"cited_paper":"/paper/2010.01412","citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:29994870464088e8590bda1efbfe4fb7d4adaf57c8d92bddc36bfa0c44177174","observation_id":"3123dc9a-92b4-4b59-a7cf-d4ce526c1dec","resolution":{"observed_at":"2026-08-06T16:37:18.401393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.04544","last_updated":"2025-03-25T14:34:04Z","snapshot_observed_at":"2026-08-04T10:22:52.279940Z","submitted_at":"2021-10-09T11:39:30Z","title":"CLIP-Adapter: Better Vision-Language Models with Feature Adapters","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.04544","snapshot_observed_at":"2026-08-06T16:37:18.530702Z","title":"Clip-adapter: Better vision-language models with feature adapters","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-06T16:28:24.176563Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:18.530702Z"},"links":{"cited_paper":"/paper/2110.04544","citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:d5cc8cff0dab72745238f62c66dcb48b6b724a6dc186d4d9748b89773918d0b5","observation_id":"062cd90d-afa2-40bf-b4ed-a5ecf1e1fef6","resolution":{"observed_at":"2026-08-06T16:37:18.530702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6572","last_updated":"2015-03-20T20:19:16Z","snapshot_observed_at":"2026-07-06T04:04:16.777653Z","submitted_at":"2014-12-20T01:17:12Z","title":"Explaining and Harnessing Adversarial Examples","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6572","snapshot_observed_at":"2026-08-06T16:37:18.616605Z","title":"Explaining and harnessing adversarial examples","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-06T16:28:24.176563Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:18.616605Z"},"links":{"cited_paper":"/paper/1412.6572","citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:87bdac6c7e6910c92dbcbbf7ce6779c41af1d6c001a42502a2ea4ea48e8b4b91","observation_id":"c8cdf682-f7dd-47c4-8bd7-fa1559d24ea6","resolution":{"observed_at":"2026-08-06T16:37:18.616605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:28.535867Z","title":"Open-vocabulary object detection via vision and language knowledge distillation","venue":null,"work_id":"343a3b16-94b8-48f5-81f9-0e1cfff7a0f7","year":2022},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-06T16:28:24.176563Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:18.662303Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:0497d0a4426a5dfa1bfb12b6544a0fb42f497adb1b41035c0900612b9bde4bb7","observation_id":"c557da71-b43d-4aa4-ad2c-953260e28b21","resolution":{"observed_at":"2026-08-06T16:37:28.540229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:28.520948Z","title":"Eurosat: A novel dataset and deep learn- ing benchmark for land use and land cover classification","venue":null,"work_id":"b41ed11e-b6cd-4f7d-9fd4-80c90adceef0","year":2019},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-06T16:28:24.176563Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:18.791568Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:7952b5887fda0cce8d7445b31fc588ec5cf63a85cc84d8c869f31bbaa59dff6d","observation_id":"6d2940be-bf72-4e9f-98a7-d6b6929d039f","resolution":{"observed_at":"2026-08-06T16:37:28.525518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:28.504833Z","title":"The many faces of robust- ness: A critical analysis of out-of-distribution generalization","venue":null,"work_id":"6e27ab7e-75f6-4b7a-9275-2eb5739195c7","year":2021},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-06T16:28:24.176563Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:18.857488Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:6c088246c5edddc98a074e1152d962a7b9eff986d72cff4805801f03daa3a408","observation_id":"f44a092f-0253-48bb-a48b-226d4d514e5d","resolution":{"observed_at":"2026-08-06T16:37:28.509559Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:28.490870Z","title":"Natural adversarial examples","venue":null,"work_id":"15b95f89-6985-4d33-b870-bbb1ed3af7cf","year":2021},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-06T16:28:24.176563Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:18.963976Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:a87673698d9be1687780b7fe3c33e94e8ae86410558f9d2d38416981784e5e7f","observation_id":"89a001d4-2771-45ac-b562-633982e981f0","resolution":{"observed_at":"2026-08-06T16:37:28.495020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:19.090863Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-06T16:28:24.176563Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:19.090863Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:0177a213b5bd43b13326fceb5bbebb3e5f314e0b0222aee4b0452a470594e335","observation_id":"6b185be9-37b5-46cb-a022-c7019faad37d","resolution":{"observed_at":"2026-08-06T16:37:19.090863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.12471","last_updated":"2022-05-25T03:50:23Z","snapshot_observed_at":"2026-07-06T13:13:40.650733Z","submitted_at":"2022-05-25T03:50:23Z","title":"Learning a Better Initialization for Soft Prompts via Meta-Learning","version":1},"cited_work":{"arxiv_id":"2205.12471","doi":null,"metadata_source":"pith","pith_arxiv_id":"2205.12471","snapshot_observed_at":"2026-08-06T16:37:24.735209Z","title":"Learning a Better Initialization for Soft Prompts via Meta-Learning","venue":"cs.CL","work_id":"6ec077dd-c2a4-4e7c-a9f2-87235743e4d1","year":2022},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-06T16:28:24.176563Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:19.243859Z"},"links":{"cited_paper":"/paper/2205.12471","citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:74b09c76695cc34ee12c4e63a6b5ccec0c342094fe7a105f7cd2bd57dd1a0c02","observation_id":"00d50d34-2784-4f23-aa36-adebb894f1a2","resolution":{"observed_at":"2026-08-06T16:37:24.853475Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.05592","last_updated":"2022-10-11T22:33:14Z","snapshot_observed_at":"2026-08-01T12:26:03.140439Z","submitted_at":"2022-08-10T23:47:43Z","title":"Patching open-vocabulary models by interpolating weights","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.05592","snapshot_observed_at":"2026-08-06T16:37:19.347269Z","title":"Patching open- vocabulary models by interpolating weights","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-06T16:28:24.176563Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:19.347269Z"},"links":{"cited_paper":"/paper/2208.05592","citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:c360b7d3fed06eda64574a43052e409dab044da27b166c7060b7da603cb86054","observation_id":"7f0920ef-a73e-4379-8f36-d74481668e8a","resolution":{"observed_at":"2026-08-06T16:37:19.347269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:19.448372Z","title":"Vi- sual prompt tuning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-06T16:28:24.176563Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:19.448372Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:442be352c6a5803cd2037e1cb761d76ca28526491f711fbe37be6c6813cd3aa5","observation_id":"5ff13c00-186d-45e9-97e9-fff6c9f2e3fe","resolution":{"observed_at":"2026-08-06T16:37:19.448372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:28.451306Z","title":"Maple: Multi-modal prompt learning","venue":null,"work_id":"31163fbc-cfa2-48bf-96ff-072a96454148","year":2023},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-06T16:28:24.176563Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:19.508974Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:896eaf53dda8311c2b8503cd9f8440f8e253bb25e09a2c43d307ac43467d18b7","observation_id":"adf384f3-9ef9-412d-9a1c-73dffa930e01","resolution":{"observed_at":"2026-08-06T16:37:28.456352Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:28.436129Z","title":"Self-regulating prompts: Foundational model adaptation without forgetting","venue":null,"work_id":"b0fb0e74-fd9b-46c1-9164-443e383ec9c3","year":2023},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-06T16:28:24.176563Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:19.619850Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:90eef2a0bc9be7ac6bbb4e3acb8c92f2a0e785d1f6420f9e2b08e638be454dd7","observation_id":"d58f73ca-6225-4079-8f74-8bc9337af873","resolution":{"observed_at":"2026-08-06T16:37:28.440487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:28.420246Z","title":"Co-mixup: Saliency guided joint mixup with super- modular diversity","venue":null,"work_id":"1ff7c43b-85da-4e89-adba-c1a863880483","year":2021},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-06T16:28:24.176563Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:19.807655Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:264e6b0029856c7e0951f417a75884c2ca74cdf3a59f568040fae20bf39b6e2b","observation_id":"ec6763f4-2486-43f2-8d8a-cdec6d4795fd","resolution":{"observed_at":"2026-08-06T16:37:28.425528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:19.982942Z","title":"3d object representations for fine-grained categorization","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-06T16:28:24.176563Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:19.982942Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:b4bd1dc74f5761e25d50087e9af7fe2b2ad8800c43423a6ef7eead84995bfa91","observation_id":"5b63c5e1-dc1a-4444-a1e4-dd0c43ae81e3","resolution":{"observed_at":"2026-08-06T16:37:19.982942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:28.392295Z","title":"Read-only prompt op- timization for vision-language few-shot learning","venue":null,"work_id":"ae748853-22f8-4e05-b2bc-da934ad60e87","year":null},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-06T16:28:24.176563Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:20.056213Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:c73b4b28d575d3b7fb17c1eae08df1a9092976ab5898863d40098dbac7f8df48","observation_id":"b57eb404-5fac-42f4-ada8-4ea5bff4d2d0","resolution":{"observed_at":"2026-08-06T16:37:28.396667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:28.376268Z","title":"The power of scale for parameter-efficient prompt tuning","venue":null,"work_id":"b7507f42-3981-45a4-b5e2-16c79bd12ed7","year":null},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-06T16:28:24.176563Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:20.165333Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:2680abfa33f93b3dbf75f23ebff08276b6454822e6f00b6830abdf2b6db04862","observation_id":"8db438d4-ce38-4fc4-a3f7-f481a3744da0","resolution":{"observed_at":"2026-08-06T16:37:28.380993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:20.278857Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-06T16:28:24.176563Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:20.278857Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:07a3525350fd47a5825a874d8c8562cd9c5d1e49545a3b0b7b2355c4bf7dcd2d","observation_id":"6825f01f-c45e-4115-805c-0a6b5cea8238","resolution":{"observed_at":"2026-08-06T16:37:20.278857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:20.463882Z","title":"Promptkd: Unsupervised prompt distillation for vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-06T16:28:24.176563Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:20.463882Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:7775484addb1bb5ad6a92b6d1c4ace18c787f61acbde2d94d0f10ff7b9630168","observation_id":"8d1fffa2-0021-4fa0-a42f-194812283d3a","resolution":{"observed_at":"2026-08-06T16:37:20.463882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:20.549960Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-06T16:28:24.176563Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:20.549960Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:ebb7e5d907da5681d64f05505ba0dc5579470e49a65426c106ab9ca36760363f","observation_id":"1db82ce7-f022-48a6-abd9-dca872383d73","resolution":{"observed_at":"2026-08-06T16:37:20.549960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:28.328651Z","title":"Pre-train, prompt, and predict: A systematic survey of prompting methods in nat- ural language processing","venue":null,"work_id":"5d40162a-5f77-44f0-8871-857d48e4dcd5","year":2023},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-06T16:28:24.176563Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:20.621651Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:f83497a6eef761acbe64335f04474be48068f822e1eada07806dd2fa71bb9155","observation_id":"a3d9f104-71f8-4166-86f3-088edfee8a7f","resolution":{"observed_at":"2026-08-06T16:37:28.333469Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:28.313192Z","title":"Decoupled weight decay regularization","venue":null,"work_id":"628884f1-5585-4d1c-beb5-b8668df7df56","year":2019},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-06T16:28:24.176563Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:20.716825Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:1463cfeeea9256a90853782f284ac6fe502a0708f8d2041f5e0d473a7290af96","observation_id":"9afda434-7a57-409d-b40c-f35ca7b1eb54","resolution":{"observed_at":"2026-08-06T16:37:28.318282Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:28.296590Z","title":"Prompt distribution learning","venue":null,"work_id":"74999d30-c465-49a0-ba98-e5af2e4dbfac","year":2022},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-06T16:28:24.176563Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:20.801162Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:e1c3d308b693c459a7f2f819ed69be66540871a18c878d40fb583318a68c0920","observation_id":"ba63cdc1-477a-44e0-b77a-aef4a4a45e5f","resolution":{"observed_at":"2026-08-06T16:37:28.302878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:20.912376Z","title":"Image segmentation using text and image prompts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-06T16:28:24.176563Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:20.912376Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:2ca9b694830248be2fb5469818d53741a49085d4db15f412e287f1f004df7db8","observation_id":"24a22a1d-c2eb-4b73-ad51-a3ba60b337d0","resolution":{"observed_at":"2026-08-06T16:37:20.912376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1306.5151","last_updated":"2013-06-21T14:31:57Z","snapshot_observed_at":"2026-07-06T03:16:28.287173Z","submitted_at":"2013-06-21T14:31:57Z","title":"Fine-Grained Visual Classification of Aircraft","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1306.5151","snapshot_observed_at":"2026-08-06T16:37:21.038250Z","title":"Fine-grained visual classi- fication of aircraft","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-06T16:28:24.176563Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:21.038250Z"},"links":{"cited_paper":"/paper/1306.5151","citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:d3afcbdb42ac69cc48dfc99e7beaa4b3a16c7980ba95ab3275ed2f75d893250f","observation_id":"a25130ff-2c5c-44c8-8ab4-ba7bad27944f","resolution":{"observed_at":"2026-08-06T16:37:21.038250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09734","last_updated":"2021-11-18T14:49:15Z","snapshot_observed_at":"2026-07-06T12:09:52.161425Z","submitted_at":"2021-11-18T14:49:15Z","title":"ClipCap: CLIP Prefix for Image Captioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09734","snapshot_observed_at":"2026-08-06T16:37:21.189934Z","title":"Clipcap: Clip prefix for image captioning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-06T16:28:24.176563Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:21.189934Z"},"links":{"cited_paper":"/paper/2111.09734","citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:cdb7bfd2e6bbc4ff5a0654d1efc0274f823f9b4cc30d6b8a8c57ddfdd1b0e884","observation_id":"5772af9d-23eb-449e-94e4-c3813760953a","resolution":{"observed_at":"2026-08-06T16:37:21.189934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16704","last_updated":"2024-05-16T16:44:11Z","snapshot_observed_at":"2026-08-05T14:42:34.010396Z","submitted_at":"2023-07-31T14:23:39Z","title":"Lookbehind-SAM: k steps back, 1 step forward","version":3},"cited_work":{"arxiv_id":"2307.16704","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.16704","snapshot_observed_at":"2026-08-06T16:37:24.485211Z","title":"Lookbehind-SAM: k steps back, 1 step forward","venue":"cs.LG","work_id":"b76e4352-5e3f-4bb3-838a-84bb50470e73","year":2023},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-06T16:28:24.176563Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:21.263196Z"},"links":{"cited_paper":"/paper/2307.16704","citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:ca85a4cf7d72e3600399d94264b24f2fabc4a6671868e16912ca991392aeb097","observation_id":"715a6811-a62d-4ac5-b41b-be757be0b828","resolution":{"observed_at":"2026-08-06T16:37:24.559955Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:28.270734Z","title":"When does label smoothing help? Advances in neural in- formation processing systems, 32, 2019","venue":null,"work_id":"93cebf0d-3bce-40f1-8a06-7be94a20811a","year":2019},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-06T16:28:24.176563Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:21.345862Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:0dd357b03700bcb923f101024382370cfa01b758a8dae4e64ac9cc469d7d4909","observation_id":"cea1fbff-c8c4-4478-bdc4-839e46f9c63a","resolution":{"observed_at":"2026-08-06T16:37:28.275633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:28.249957Z","title":"Automated flower classification over a large number of classes","venue":null,"work_id":"53c02c77-3bef-48b0-887f-5b8d17206e93","year":2008},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-06T16:28:24.176563Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:21.409595Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:88d803a36417f0717f6a7a875027b8d1fc547421e0d5b03122c26655a81a6fd0","observation_id":"cbe497ab-911b-43df-b53c-d286e638ee63","resolution":{"observed_at":"2026-08-06T16:37:28.255053Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:28.235107Z","title":"Metropolis-hastings data augmentation for graph neu- ral networks","venue":null,"work_id":"438c937b-7218-4507-8b31-b5d9afef5ebe","year":2022},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-06T16:28:24.176563Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:21.560898Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:9414648efc422bbee949ec278450b7af643b2e1daf9325a118e7215a9e8f4a1d","observation_id":"50e15440-8eba-4475-8bd7-813569dbe26d","resolution":{"observed_at":"2026-08-06T16:37:28.239720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:28.220226Z","title":"Cats and dogs","venue":null,"work_id":"bafebbdf-a58b-4dd7-a8d6-06e9ba2835c1","year":2012},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-06T16:28:24.176563Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:21.659196Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:7db0fb67ae60ac85e104611d84cc8aeccb25f64cff82303349e22d4aa5f272b3","observation_id":"2dd8802d-63e3-42cc-8c26-ab2ba19371a3","resolution":{"observed_at":"2026-08-06T16:37:28.224586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:28.204951Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":"e8a71f7b-2597-424b-a4b8-b4b277e76d40","year":2021},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-06T16:28:24.176563Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:21.754468Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:39decaa3bb5ac1915c801b1a5b32f6f931a1dd6383b983cbe812cd2871ebcd57","observation_id":"4efa1e0e-858b-4470-91e6-cb0d0e004511","resolution":{"observed_at":"2026-08-06T16:37:28.209884Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:28.187980Z","title":"Do imagenet classifiers generalize to im- agenet? In ICML, pages 5389–5400","venue":null,"work_id":"83b2d342-7fb1-435e-9bfc-dffb7baada1b","year":2019},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-06T16:28:24.176563Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:21.848212Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:b9008cecade8f55b79d2963c7139e02538b36a75ffdf22b7c38a580f58af7fc1","observation_id":"f66149b4-eb02-46e6-bea3-8b47a049627a","resolution":{"observed_at":"2026-08-06T16:37:28.193331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15896","last_updated":"2024-12-06T00:41:15Z","snapshot_observed_at":"2026-07-06T17:34:57.509162Z","submitted_at":"2024-02-24T20:15:31Z","title":"Multimodal Instruction Tuning with Conditional Mixture of LoRA","version":2},"cited_work":{"arxiv_id":"2402.15896","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.15896","snapshot_observed_at":"2026-08-06T16:37:24.285861Z","title":"Multimodal Instruction Tuning with Conditional Mixture of LoRA","venue":"cs.CV","work_id":"159fede5-3e90-47d4-8ee8-ed61a6e07841","year":2024},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-06T16:28:24.176563Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:21.969328Z"},"links":{"cited_paper":"/paper/2402.15896","citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:bed3291052ccecd8c4fe5630b554a1a86129d0f409d9c761bd56b9dfb69651fb","observation_id":"8ab4ee32-8f35-4cfc-b375-66f9e12e4cd6","resolution":{"observed_at":"2026-08-06T16:37:24.375379Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:28.170951Z","title":"Flava: A foundational language and vision alignment model","venue":null,"work_id":"fd61f563-b349-49bb-b3c7-f15b6845fc46","year":2022},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-06T16:28:24.176563Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:22.053563Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:2dbd0d6cdf85905eb7b40bf137b9f021003e82383f4b85d1ca07f902fd04f41c","observation_id":"15bc974f-d69b-4c6c-bbac-a30160cdad02","resolution":{"observed_at":"2026-08-06T16:37:28.175590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1212.0402","last_updated":"2012-12-03T14:45:31Z","snapshot_observed_at":"2026-07-06T03:01:10.229407Z","submitted_at":"2012-12-03T14:45:31Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1212.0402","snapshot_observed_at":"2026-08-06T16:37:22.126152Z","title":"Ucf101: A dataset of 101 human actions classes from videos in the wild","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-06T16:28:24.176563Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:22.126152Z"},"links":{"cited_paper":"/paper/1212.0402","citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:e838329df5e797f3103c0e1cace75a7ebe461abcdeda8565463acc92f8bb8a03","observation_id":"a6321269-a557-4ccf-98b8-5e6577c2a80b","resolution":{"observed_at":"2026-08-06T16:37:22.126152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:28.151504Z","title":"Dropout: a simple way to prevent neural networks from overfitting","venue":null,"work_id":"af754078-b770-4788-bdd6-7d958c1776f6","year":1929},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-06T16:28:24.176563Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:22.207731Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:4aa2b0e514a7c5622566784c484851bdbc81011fd59dfe69d2d762411b3cda18","observation_id":"87838670-f2e1-4caa-8d19-a87cf28c806e","resolution":{"observed_at":"2026-08-06T16:37:28.158376Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:22.304601Z","title":"Rethinking the inception ar- chitecture for computer vision","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-06T16:28:24.176563Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:22.304601Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:8c96b15149403715f7540aa2a1445aa865c521c2c3c1e0b7c381374735521c92","observation_id":"64b15ba4-b80f-4605-8475-87b9d93f4409","resolution":{"observed_at":"2026-08-06T16:37:22.304601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:28.122456Z","title":"Saliencymix: A saliency guided data augmentation strategy for better regularization","venue":null,"work_id":"71a7c939-5137-45db-be06-e1c8bae307e2","year":null},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-06T16:28:24.176563Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:22.449012Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:517a7fe1514bc3555246504bb2b312c8b4da1614fe05e46927baed302d0e4ae1","observation_id":"f35469ff-89a5-4ed7-97a5-5237913a7af8","resolution":{"observed_at":"2026-08-06T16:37:28.126994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:28.109263Z","title":"Manifold mixup: learning better representations by in- terpolating hidden states","venue":null,"work_id":"3ba04f39-f517-46aa-b042-f7a56f31b47e","year":2019},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-06T16:28:24.176563Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:22.547152Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:4c3e5c9cdec32dae0d460a38b89e8a8a5fc81d19779c531447eb837f9a357578","observation_id":"19d8d1bc-bc71-4e05-ba88-830e49bcec3d","resolution":{"observed_at":"2026-08-06T16:37:28.113352Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:28.077907Z","title":"Tuning multi-mode token- level prompt alignment across modalities","venue":null,"work_id":"d25880e4-2536-425a-ba3c-bba3759e82fd","year":2023},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-06T16:28:24.176563Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:22.642193Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:48f7af0cac1c6f0a44f75bdaa4d28d53fa7801d50a56000c530d6d0f91697739","observation_id":"c0af567c-bd48-4819-a7cd-1d224f61e30c","resolution":{"observed_at":"2026-08-06T16:37:28.098342Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:27.988015Z","title":"Learning robust global representations by penalizing local predictive power","venue":null,"work_id":"5ef1f7b9-d3ab-48e5-8c3f-1052b4e4306f","year":2019},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-06T16:28:24.176563Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:22.737119Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:92646ee6a39ab0664b5d97ccb6616db46dc6f4c6b9dc7e94ca7b597ebdf02725","observation_id":"a9d23265-ea2c-46a4-b7c7-f71efadfa374","resolution":{"observed_at":"2026-08-06T16:37:28.066014Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:27.804495Z","title":"Sharpness-aware gradient matching for domain generaliza- tion","venue":null,"work_id":"5cc5d379-c635-438c-a64b-c3f01cc4614b","year":null},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-06T16:28:24.176563Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:22.854498Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:576ab34afa0314d75d29f6b7fc111c43e112c1ead7c855c194d133e7a49b0e16","observation_id":"c7bb7d1a-3b7b-46e3-8776-df01c172b0cf","resolution":{"observed_at":"2026-08-06T16:37:27.896307Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:27.649130Z","title":"Cogvlm: Visual expert for pretrained language models","venue":null,"work_id":"395e2cc1-a4af-43e3-862c-d6e95b236f50","year":2024},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-06T16:28:24.176563Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:22.959808Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:f5fd077d3c9b623b6154898c239e2dad2a5edcd9c93d03804561818c4bfba9b8","observation_id":"93c1dd62-3c84-4a36-bd81-82d3afda935f","resolution":{"observed_at":"2026-08-06T16:37:27.723422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:27.488899Z","title":"Robust fine-tuning of zero-shot models","venue":null,"work_id":"6e2541e6-8b2d-4f48-83f5-eebca71ab928","year":2022},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-06T16:28:24.176563Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:23.033154Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:9a17b2784f35d4a552579201d0e407a1b0f38ffa57210928c825a7d97da48dd6","observation_id":"d3ea47da-5c28-4003-ba0e-dcabcfd057ed","resolution":{"observed_at":"2026-08-06T16:37:27.583409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:27.322936Z","title":"Sun database: Large-scale scene recognition from abbey to zoo","venue":null,"work_id":"52458145-43d1-40d9-a82c-b05551609de8","year":2010},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-06T16:28:24.176563Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:23.079232Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:f589465ebddb8ccbfe653b11051c5815b55a11ce4697201bf499601a3a9d7b57","observation_id":"26048ba1-384a-4013-ab3e-dc289bd39204","resolution":{"observed_at":"2026-08-06T16:37:27.403579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:27.151567Z","title":"Tcp: Textual- based class-aware prompt tuning for visual-language model","venue":null,"work_id":"eb07a785-c713-4745-8b98-a0ffd585de37","year":2024},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-06T16:28:24.176563Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:23.150721Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:6e57f8182569cda0e1128c4d539df03739a2b44cc316eb927479f0f4bc29e921","observation_id":"35131259-a89b-4284-bdad-790893de0a37","resolution":{"observed_at":"2026-08-06T16:37:27.246670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:27.010021Z","title":"Cutmix: Regu- larization strategy to train strong classifiers with localizable features","venue":null,"work_id":"5e6ed437-4b3e-4b0f-a551-76f98bdcfe74","year":2019},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-06T16:28:24.176563Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:23.220423Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:037b689e4262afeed27c628dfd6cdf630bf6052a0c561e9b2a7d3bf8aeb8e192","observation_id":"3806585f-bbcc-4e70-be8d-2fde26295261","resolution":{"observed_at":"2026-08-06T16:37:27.078177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:26.839676Z","title":"Low-rank few-shot adaptation of vision-language models","venue":null,"work_id":"ca00d715-1601-403d-b7d2-ef7e2895fbcb","year":2024},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-06T16:28:24.176563Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:23.292963Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:4942d5f8de5623b96b83b74837b238847714cbf8f769ba430a0d54ef6f514c64","observation_id":"ebfd872d-fb0f-49e5-88fb-d918115b5910","resolution":{"observed_at":"2026-08-06T16:37:26.915990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:26.706388Z","title":"Lit: Zero-shot transfer with locked-image text tuning","venue":null,"work_id":"429133e5-86bd-4b25-93c3-1460be160e29","year":2022},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-06T16:28:24.176563Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:23.388218Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:8e49f0191f9b6131e9cfbe810678bff7ea7e202a7f236ef081460eb5033d29c7","observation_id":"626eb206-3728-4927-90aa-835e1c098562","resolution":{"observed_at":"2026-08-06T16:37:26.763594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:26.520439Z","title":"Three mechanisms of weight decay regularization","venue":null,"work_id":"b628bc2f-f74c-486f-91e2-02364beac4d7","year":2019},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-06T16:28:24.176563Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:23.425869Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:9d25ce4232252dfc3f8b4d3f9ebdbaa3095566b963d959b4c0d9019cd9fb3d17","observation_id":"ed262ff5-852e-41f0-9a30-dbb356a79355","resolution":{"observed_at":"2026-08-06T16:37:26.620181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.09412","last_updated":"2018-04-27T21:39:25Z","snapshot_observed_at":"2026-07-06T06:06:04.571585Z","submitted_at":"2017-10-25T18:30:49Z","title":"mixup: Beyond Empirical Risk Minimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.09412","snapshot_observed_at":"2026-08-06T16:37:23.459308Z","title":"mixup: Beyond empirical risk minimiza- tion","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-06T16:28:24.176563Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:23.459308Z"},"links":{"cited_paper":"/paper/1710.09412","citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:681ee33b6c5680388355e9f8512f1f434aee7e92c26d2aaea34882072a97c109","observation_id":"d28e2228-19a9-496c-8ffc-62e3c36aeeb4","resolution":{"observed_at":"2026-08-06T16:37:23.459308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:26.274970Z","title":"Dept: Decoupled prompt tuning","venue":null,"work_id":"a536b986-501f-4d2b-ba29-275c8b74afa6","year":2024},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-06T16:28:24.176563Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:23.526271Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:5a60e7f0cace679710166bab36fb536fd83ad8d2951ac2433b635e924261a70e","observation_id":"4834b420-d026-4e38-86e4-76b17aadee68","resolution":{"observed_at":"2026-08-06T16:37:26.426058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:23.593178Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-06T16:28:24.176563Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:23.593178Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:028e9e55c3ff8e2169a426590740c734e31e99719a185bf19f6c124ef8e67b0b","observation_id":"a21fe1d1-d66b-4447-9f44-667a3af33382","resolution":{"observed_at":"2026-08-06T16:37:23.593178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:26.041456Z","title":"Llama-adapter: Efficient fine-tuning of language models with zero-init attention","venue":null,"work_id":"158ece89-2eeb-40f5-b60d-bcaf99601674","year":2024},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-06T16:28:24.176563Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:23.638487Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:47db3a2c4a604d7938587dc60bce60a504b28e957f40ca49ba157bfe33a566cb","observation_id":"b7512f2a-6b89-4be1-b313-2e6847175b69","resolution":{"observed_at":"2026-08-06T16:37:26.126021Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04087","last_updated":"2023-12-28T16:01:36Z","snapshot_observed_at":"2026-08-06T02:13:50.627750Z","submitted_at":"2023-07-09T03:25:14Z","title":"SVIT: Scaling up Visual Instruction Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04087","snapshot_observed_at":"2026-08-06T16:37:23.687949Z","title":"Svit: Scaling up visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-06T16:28:24.176563Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:23.687949Z"},"links":{"cited_paper":"/paper/2307.04087","citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:e195b10576c02a54f9ff17ed439310ed6eb08183aa083d447f57199d839ffbea","observation_id":"c04e7633-c62d-43a3-ba52-725bb69e0a6d","resolution":{"observed_at":"2026-08-06T16:37:23.687949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:25.799425Z","title":"Regionclip: Region-based language-image pretraining","venue":null,"work_id":"ce207464-8943-4035-9fd8-7a3b562f7897","year":2022},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-06T16:28:24.176563Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:23.748806Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:1b8d12fb8dc01fe7958cfd031c466ebb04335d15b4757ad8daf87fe3f96c7b5f","observation_id":"2dadc935-ceed-472a-a3cd-822b7c5036d8","resolution":{"observed_at":"2026-08-06T16:37:25.879634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:25.434869Z","title":"Conditional prompt learning for vision-language models","venue":null,"work_id":"ca2b23ea-0201-4e3d-b66a-3c84c420d296","year":2022},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-06T16:28:24.176563Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:23.856095Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:c0ee45d943ba6109e08f8f53438a5df113a5efa70a95ff079f5fd2eae6a6d03c","observation_id":"7d993c5f-112d-4b83-b15e-97df888bc360","resolution":{"observed_at":"2026-08-06T16:37:25.618806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:25.096677Z","title":"Learning to prompt for vision-language models","venue":null,"work_id":"587335d1-96ff-4b2b-a649-1aedb3e4a4d2","year":2022},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-06T16:28:24.176563Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:23.927447Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:dae6776297c989998fe940ba92239738113b80acaf1fa8fb713aea6c8c01834e","observation_id":"2cbf78dd-d784-4289-a2ae-135dcd884f41","resolution":{"observed_at":"2026-08-06T16:37:25.237348Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:23.993559Z","title":"Prompt-aligned gradient for prompt tuning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-06T16:28:24.176563Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:23.993559Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:4443efb96ed64558c17768668a9aac482019bf4e316ddb635e55a92ec28d6400","observation_id":"e2a1921c-ccf8-4a8d-a30d-298f18332a4e","resolution":{"observed_at":"2026-08-06T16:37:23.993559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.08065","last_updated":"2022-03-19T15:56:32Z","snapshot_observed_at":"2026-07-06T12:48:13.087800Z","submitted_at":"2022-03-15T16:57:59Z","title":"Surrogate Gap Minimization Improves Sharpness-Aware Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.08065","snapshot_observed_at":"2026-08-06T16:37:24.063644Z","title":"Surrogate gap minimization improves sharpness-aware training","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-06T16:28:24.176563Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:24.063644Z"},"links":{"cited_paper":"/paper/2203.08065","citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:516275942d97dd1032bcb1db9c4b7a2224ebf283c128e057e4e5f9d14fecc501","observation_id":"e9c866b0-7b5d-4199-be01-49ece54bf2c4","resolution":{"observed_at":"2026-08-06T16:37:24.063644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T16:28:24.176563Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models"},"reference_resolution":{"displayed":69,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":3,"verified_fuzzy":44},"total_outbound_references":69},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 69 of 69 outbound references and 3 inbound Pith citation observations for arXiv:2507.13089."}