{"as_of":"2026-08-09T04:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:833ffb68b76e240b0c9207ba6566365734a33015008e166e038b117bebd55d49","coverage":[{"denominator":299,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T23:17:06.729087Z","state":"measured"},{"denominator":104,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":104,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T23:10:08.033785Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-30T12:54:40.377437Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-06T15:48:30.505708Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"cited_work":{"arxiv_id":"2508.05547","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.05547","snapshot_observed_at":"2026-06-30T12:54:40.377437Z","title":"Adapting vision-language models without labels: A comprehensive survey.arXiv preprint arXiv:2508.05547","venue":null,"work_id":"91b2f1e7-7c8f-4a75-91f0-41bde8328f3e","year":2025},"citing_paper":{"arxiv_id":"2605.12325","last_updated":"2026-05-13T05:07:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T16:08:18Z","title":"VIP: Visual-guided Prompt Evolution for Efficient Dense Vision-Language Inference","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-13T07:27:02.544831Z"},"links":{"cited_paper":"/paper/2508.05547","citing_paper":"/paper/2605.12325"},"observation_digest":"sha256:183bc78f541f0a79f520a49e77a21ed5c298a3638eff46aa55a029e6c3e5acec","observation_id":"a924611e-c64a-4e38-af94-4b9e9e490014","resolution":{"observed_at":"2026-05-13T07:27:29.164716Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-06T15:48:30.505708Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"cited_work":{"arxiv_id":"2508.05547","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.05547","snapshot_observed_at":"2026-06-30T12:54:40.377437Z","title":"Adapting vision-language models without labels: A comprehensive survey.arXiv preprint arXiv:2508.05547","venue":null,"work_id":"91b2f1e7-7c8f-4a75-91f0-41bde8328f3e","year":2025},"citing_paper":{"arxiv_id":"2605.12325","last_updated":"2026-05-13T05:07:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T16:08:18Z","title":"VIP: Visual-guided Prompt Evolution for Efficient Dense Vision-Language Inference","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-14T21:42:36.088959Z"},"links":{"cited_paper":"/paper/2508.05547","citing_paper":"/paper/2605.12325"},"observation_digest":"sha256:7284d109e019eab504a6ea3fa9c828c90dc0a7f28d5a634e97984e25d4ed19e8","observation_id":"63954e70-ee0f-45f8-a0c9-8e86a17425f9","resolution":{"observed_at":"2026-05-14T21:43:00.188003Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-06T15:48:30.505708Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"cited_work":{"arxiv_id":"2508.05547","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.05547","snapshot_observed_at":"2026-06-30T12:54:40.377437Z","title":"Adapting vision-language models without labels: A comprehensive survey.arXiv preprint arXiv:2508.05547","venue":null,"work_id":"91b2f1e7-7c8f-4a75-91f0-41bde8328f3e","year":2025},"citing_paper":{"arxiv_id":"2606.28719","last_updated":"2026-06-27T03:55:04Z","snapshot_observed_at":"2026-08-06T03:55:03.915990Z","submitted_at":"2026-06-27T03:55:04Z","title":"ComMem: Complementary Memory Systems for Test-Time Adaptation of Vision-Language Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-06-30T09:57:02.377866Z"},"links":{"cited_paper":"/paper/2508.05547","citing_paper":"/paper/2606.28719"},"observation_digest":"sha256:0d0cb26d8695dfde94d733f34d4a75fd51388155a6107bd8068944fadfa405df","observation_id":"21374d3e-ec90-4c91-86c3-b6e740d7c3d3","resolution":{"observed_at":"2026-06-30T12:54:40.378855Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-06T15:48:30.505708Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.05547","snapshot_observed_at":"2026-07-11T23:10:08.033785Z","title":"arXiv preprint arXiv:2508.05547 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03900","last_updated":"2026-07-04T14:45:23Z","snapshot_observed_at":"2026-08-07T16:10:17.903582Z","submitted_at":"2026-07-04T14:45:23Z","title":"USE: A Unified Self-Ensembling Framework for Test-Time Prompt Tuning","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-07-11T23:10:08.033785Z"},"links":{"cited_paper":"/paper/2508.05547","citing_paper":"/paper/2607.03900"},"observation_digest":"sha256:15b0832cf89b2cc2231fe37e3c602e2d74eafe2b28db243c4d38a2775a75ce5e","observation_id":"7646928a-0959-4ed0-9ea9-14e3b74238db","resolution":{"observed_at":"2026-07-11T23:10:08.033785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2508.05547/citation-record","integrity":"/paper/2508.05547/integrity","json":"/paper/2508.05547/citation-record.json","paper":"/paper/2508.05547"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:17:03.411463Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-06T15:48:30.505708Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:03.411463Z"},"links":{"citing_paper":"/paper/2508.05547"},"observation_digest":"sha256:fa7867090172e5dd6f5e01afc1bb1dc5694f4b4a369c7af49e1997060e520f3e","observation_id":"c7b6bc77-500a-472d-865f-2f872bda4b73","resolution":{"observed_at":"2026-08-05T23:17:03.411463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:17:03.440245Z","title":"Scaling up visual and vision-language representation learning with noisy text supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-06T15:48:30.505708Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:03.440245Z"},"links":{"citing_paper":"/paper/2508.05547"},"observation_digest":"sha256:4566093317a682f81b50bf38cf1abb90c5b7d691150d5a1db6db98d307a50d99","observation_id":"b31b2cf6-d9fc-4828-b62b-048077f931a8","resolution":{"observed_at":"2026-08-05T23:17:03.440245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:17:03.506315Z","title":"Flamingo: a visual language model for few-shot learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-06T15:48:30.505708Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:03.506315Z"},"links":{"citing_paper":"/paper/2508.05547"},"observation_digest":"sha256:b9fff3f0f22015b5f4f133e83f841e8b271a325958543b06fa861f32f92d5d42","observation_id":"c25732c9-0c30-4640-bae1-4ef40b5f49f0","resolution":{"observed_at":"2026-08-05T23:17:03.506315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:17:03.573874Z","title":"Visual instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-06T15:48:30.505708Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:03.573874Z"},"links":{"citing_paper":"/paper/2508.05547"},"observation_digest":"sha256:878dbb7af7188bbf3465f3f703a424ce6ac3a08dfbcec9cb76125b651ccd334d","observation_id":"a6d4c706-f83b-4876-9841-aa92642aeb6c","resolution":{"observed_at":"2026-08-05T23:17:03.573874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:17:03.616036Z","title":"Laion-5b: An open large-scale dataset for training next generation image-text models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-06T15:48:30.505708Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:03.616036Z"},"links":{"citing_paper":"/paper/2508.05547"},"observation_digest":"sha256:c6483838be8ea865771fbd3aa3263ae9861bfea973c9ef7671bf2f69716c97d7","observation_id":"871f2069-6a30-41ea-8e04-b01f027af56a","resolution":{"observed_at":"2026-08-05T23:17:03.616036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:17:03.674684Z","title":"Clip2scene: Towards label-efficient 3d scene understanding by clip,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-06T15:48:30.505708Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:03.674684Z"},"links":{"citing_paper":"/paper/2508.05547"},"observation_digest":"sha256:2c74f80f4dc36e229b562f723c25756d0cc43bff67b5c17c3be8004602d11e6f","observation_id":"f656fd03-df30-4533-8938-90be9d1ffa37","resolution":{"observed_at":"2026-08-05T23:17:03.674684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.05663","last_updated":"2023-05-22T22:34:29Z","snapshot_observed_at":"2026-08-06T13:49:39.474018Z","submitted_at":"2022-10-11T17:57:10Z","title":"CLIP-Fields: Weakly Supervised Semantic Fields for Robotic Memory","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.05663","snapshot_observed_at":"2026-08-05T23:17:03.779796Z","title":"Clip-fields: Weakly supervised semantic fields for robotic memory,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-06T15:48:30.505708Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:03.779796Z"},"links":{"cited_paper":"/paper/2210.05663","citing_paper":"/paper/2508.05547"},"observation_digest":"sha256:365b64cf8393f53ba8f1c753c20e7985d8fcaaf2265a1d14a03a2173d3c387ee","observation_id":"3beeec1f-bdac-4ce2-877c-6bee9c981e19","resolution":{"observed_at":"2026-08-05T23:17:03.779796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:17:03.831119Z","title":"Unseen visual anomaly generation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-06T15:48:30.505708Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:03.831119Z"},"links":{"citing_paper":"/paper/2508.05547"},"observation_digest":"sha256:d22263b214a1ee7647c03eca94bf37754ee1cfefe60184e589e9ab07dc1a319d","observation_id":"a2af32f6-8260-4f30-8822-38d51e270b87","resolution":{"observed_at":"2026-08-05T23:17:03.831119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:17:03.910821Z","title":"Probabilistic embeddings for cross-modal retrieval,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-06T15:48:30.505708Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:03.910821Z"},"links":{"citing_paper":"/paper/2508.05547"},"observation_digest":"sha256:180e971bbd86d90b73997bc8188fc5cfdd5328cf7e605553367aa9683a02f34d","observation_id":"fd09b1c1-6566-4185-b79b-c82440621154","resolution":{"observed_at":"2026-08-05T23:17:03.910821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:17:03.951281Z","title":"Learning to prompt for vision-language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-06T15:48:30.505708Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:03.951281Z"},"links":{"citing_paper":"/paper/2508.05547"},"observation_digest":"sha256:43b218dbb1512abdbd6bf92292d09f04bc9583352db36a157e7b93a0182eb08c","observation_id":"ba6eecd3-805d-46a9-87f9-170a1bbb4d0b","resolution":{"observed_at":"2026-08-05T23:17:03.951281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:17:04.008476Z","title":"Conditional prompt learning for vision-language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-06T15:48:30.505708Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:04.008476Z"},"links":{"citing_paper":"/paper/2508.05547"},"observation_digest":"sha256:67bca8abb4d8bc3c10b579ac322e576112746a722ee9d070948fb9d9b75bdad4","observation_id":"a204632c-839e-4b13-b0f0-d6ad72687abb","resolution":{"observed_at":"2026-08-05T23:17:04.008476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03117","last_updated":"2023-04-01T06:47:44Z","snapshot_observed_at":"2026-07-06T14:01:25.012788Z","submitted_at":"2022-10-06T17:59:56Z","title":"MaPLe: Multi-modal Prompt Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03117","snapshot_observed_at":"2026-08-05T23:17:04.069590Z","title":"Maple: Multi-modal prompt learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-06T15:48:30.505708Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:04.069590Z"},"links":{"cited_paper":"/paper/2210.03117","citing_paper":"/paper/2508.05547"},"observation_digest":"sha256:4a6b4a7afb355ee586a587f205bd14996aeb1b5fea6a39c8dc7c2c71b0cfa5b9","observation_id":"dc17dc4d-4f79-4b3b-be30-068c5e9da5a6","resolution":{"observed_at":"2026-08-05T23:17:04.069590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:17:04.125513Z","title":"A hard-to- beat baseline for training-free clip-based adaptation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-06T15:48:30.505708Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:04.125513Z"},"links":{"citing_paper":"/paper/2508.05547"},"observation_digest":"sha256:ed7e26e3901bcfbb588fd687d79ff289cffdcb5dedbe8e15ddfb2771dd47f546","observation_id":"37b296ab-d061-46b0-af81-05101b73d4aa","resolution":{"observed_at":"2026-08-05T23:17:04.125513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:17:04.180514Z","title":"Adapting visual category models to new domains,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-06T15:48:30.505708Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:04.180514Z"},"links":{"citing_paper":"/paper/2508.05547"},"observation_digest":"sha256:528b7ee788ca5b917e406556b962ed5705ce7dc8108e1078456b9b3ff919ea17","observation_id":"c7d5e9f4-b8b5-48a1-b6f1-03b734620888","resolution":{"observed_at":"2026-08-05T23:17:04.180514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:17:04.240023Z","title":"Visual classification via description from large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-06T15:48:30.505708Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:04.240023Z"},"links":{"citing_paper":"/paper/2508.05547"},"observation_digest":"sha256:b05317bf971ead5ee777b3dad3b513d1f59d1b5fff2ba1c324fd6a772697983c","observation_id":"ae56fbcf-d5fb-4397-b0b8-c5b88ba57c63","resolution":{"observed_at":"2026-08-05T23:17:04.240023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:17:04.287319Z","title":"Extract free dense labels from clip,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-06T15:48:30.505708Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:04.287319Z"},"links":{"citing_paper":"/paper/2508.05547"},"observation_digest":"sha256:4f069d128ad72389744676ac32dec67507a158adafaef5a8d7aa543be7ad0e29","observation_id":"43569026-8929-4db7-a916-50f67bb0c716","resolution":{"observed_at":"2026-08-05T23:17:04.287319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.03649","last_updated":"2022-08-22T08:45:33Z","snapshot_observed_at":"2026-07-06T12:57:58.716731Z","submitted_at":"2022-04-07T17:59:57Z","title":"Unsupervised Prompt Learning for Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.03649","snapshot_observed_at":"2026-08-05T23:17:04.343681Z","title":"Unsupervised prompt learning for vision-language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-06T15:48:30.505708Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:04.343681Z"},"links":{"cited_paper":"/paper/2204.03649","citing_paper":"/paper/2508.05547"},"observation_digest":"sha256:5a9233799f97f2e0061e56cad2ceb09d7a67ff467161504c9cdb48e54cb76a42","observation_id":"c3942aff-a4f6-4c99-945b-09a255845dd3","resolution":{"observed_at":"2026-08-05T23:17:04.343681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:17:04.396702Z","title":"Test-time prompt tuning for zero-shot generalization in vision-language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-06T15:48:30.505708Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:04.396702Z"},"links":{"citing_paper":"/paper/2508.05547"},"observation_digest":"sha256:6a6bb0e595a306c6cf1ad1412bac1ade280aa1372fe30f8c2b73e168886496ff","observation_id":"68b5ba6b-c2c9-496f-b81f-0d203c35a7ca","resolution":{"observed_at":"2026-08-05T23:17:04.396702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:17:04.466211Z","title":"Swapprompt: Test-time prompt adaptation for vision-language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-06T15:48:30.505708Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:04.466211Z"},"links":{"citing_paper":"/paper/2508.05547"},"observation_digest":"sha256:1cbf9a97979e7b7c78ce49b0f427cb80b77f178a36f0d1d8b4f011b77eac6700","observation_id":"788dd14e-fd13-4fbc-ad9d-ba36c89c061c","resolution":{"observed_at":"2026-08-05T23:17:04.466211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.24000","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:17:14.998901Z","title":"The illusion of progress? a critical look at test-time adaptation for vision-language models,","venue":null,"work_id":"e9902d92-ff54-4dae-ba8d-131f92fa13f1","year":2025},"citing_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-06T15:48:30.505708Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:04.506791Z"},"links":{"citing_paper":"/paper/2508.05547"},"observation_digest":"sha256:97d36a4af3870c7bbc24ed9b0b36bcb3cbb25d8a36e5fb901d07233e9e49a2bd","observation_id":"c3c3c35f-78cd-46df-b823-32edca0210c0","resolution":{"observed_at":"2026-08-05T23:17:15.006412Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:17:04.542044Z","title":"What does a platypus look like? generating customized prompts for zero-shot image classi- fication,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-06T15:48:30.505708Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:04.542044Z"},"links":{"citing_paper":"/paper/2508.05547"},"observation_digest":"sha256:3c1065a43f45a80ff0ded93d94599bf917b28ebd661689f692286a9ab5f1491c","observation_id":"e124257a-b3a7-41f6-8f27-cb4a0b3476b3","resolution":{"observed_at":"2026-08-05T23:17:04.542044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.00784","last_updated":"2022-12-01T18:59:03Z","snapshot_observed_at":"2026-08-09T00:38:39.293360Z","submitted_at":"2022-12-01T18:59:03Z","title":"Improving Zero-Shot Models with Label Distribution Priors","version":1},"cited_work":{"arxiv_id":"2212.00784","doi":null,"metadata_source":"pith","pith_arxiv_id":"2212.00784","snapshot_observed_at":"2026-08-05T23:17:14.923393Z","title":"Improving Zero-Shot Models with Label Distribution Priors","venue":"cs.CV","work_id":"aab74c0f-127e-470b-8902-fc8530187e03","year":2022},"citing_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-06T15:48:30.505708Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:04.589997Z"},"links":{"cited_paper":"/paper/2212.00784","citing_paper":"/paper/2508.05547"},"observation_digest":"sha256:d4a4b21fa67b8d9ea62fbd3f12951c68a80e20066a9dbb96525d43821c83a8ea","observation_id":"7fca3fa5-e0cd-4f0b-a89b-0fdc766993b2","resolution":{"observed_at":"2026-08-05T23:17:14.928712Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:17:04.649384Z","title":"Online zero-shot classification with clip,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-06T15:48:30.505708Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:04.649384Z"},"links":{"citing_paper":"/paper/2508.05547"},"observation_digest":"sha256:177a8fb391c68ed87ebadcbe20b5b6d548eec3a0a735e4fbe25da93c3555f023","observation_id":"447f5e3e-7f2c-4d92-aa47-da94c1dec0c3","resolution":{"observed_at":"2026-08-05T23:17:04.649384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:17:04.682395Z","title":"Align your prompts: Test- time prompting with distribution alignment for zero-shot generaliza- tion,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-06T15:48:30.505708Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:04.682395Z"},"links":{"citing_paper":"/paper/2508.05547"},"observation_digest":"sha256:f708d375cb2d3c98ae57e59e7ce2f23ca370ab13369adab9f1110df4d3b940cd","observation_id":"0d32d8bf-997f-4b63-b1ed-f92733283f9a","resolution":{"observed_at":"2026-08-05T23:17:04.682395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:17:04.745293Z","title":"Efficient test-time adaptation of vision-language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-06T15:48:30.505708Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:04.745293Z"},"links":{"citing_paper":"/paper/2508.05547"},"observation_digest":"sha256:e6e9a037943cff54de23d1ba0882a083fe784ac2fbeb4956177c34f26e6b5205","observation_id":"40ceada1-b4e4-47a8-9dcc-76ad2c947cd3","resolution":{"observed_at":"2026-08-05T23:17:04.745293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:17:04.829357Z","title":"Masked unsupervised self-training for label-free image classification,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-06T15:48:30.505708Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:04.829357Z"},"links":{"citing_paper":"/paper/2508.05547"},"observation_digest":"sha256:c0ac59d034e29e599c7958ddeaed7530d89184f667cb3a586161bea2e7d32927","observation_id":"d26b76ca-92e6-460b-a75d-33fff16c2494","resolution":{"observed_at":"2026-08-05T23:17:04.829357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:17:04.889601Z","title":"Realistic unsupervised clip fine-tuning with universal entropy optimization,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-06T15:48:30.505708Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:04.889601Z"},"links":{"citing_paper":"/paper/2508.05547"},"observation_digest":"sha256:b6bc4a2cf4c2591f7735df475427a17b05213e4c65a4f8cc2700cf46254f3d37","observation_id":"2588556e-e9e0-440e-b2f1-903b9e85aba7","resolution":{"observed_at":"2026-08-05T23:17:04.889601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:17:04.931657Z","title":"Reco: Retrieve and co-segment for zero-shot transfer,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-06T15:48:30.505708Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:04.931657Z"},"links":{"citing_paper":"/paper/2508.05547"},"observation_digest":"sha256:34bbc04051963bf0cf7cf9681da221438d485751f4466f07b5508a011c051b68","observation_id":"e42f5036-091d-4e86-9a67-2fb5ac166d2d","resolution":{"observed_at":"2026-08-05T23:17:04.931657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:17:04.977067Z","title":"Pay attention to your neighbours: Training-free open-vocabulary semantic segmentation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-06T15:48:30.505708Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:04.977067Z"},"links":{"citing_paper":"/paper/2508.05547"},"observation_digest":"sha256:4f6f21a0105261e79d50f48358b1ef53c69022749312ed2da26281e7d1d50ee9","observation_id":"ea382039-b3dc-40c6-96ab-0c3079b25544","resolution":{"observed_at":"2026-08-05T23:17:04.977067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:17:05.046092Z","title":"Can language-guided unsupervised adaptation improve medical image classification using unpaired images and texts?","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-06T15:48:30.505708Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:05.046092Z"},"links":{"citing_paper":"/paper/2508.05547"},"observation_digest":"sha256:76d07a007558177023d724b53a8ac301b755464dc44d711f2db60b92f89c4ab0","observation_id":"9386ebcb-8a65-4608-9c31-ec0d63031710","resolution":{"observed_at":"2026-08-05T23:17:05.046092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:17:05.070471Z","title":"A chatgpt aided explainable framework for zero-shot medical image diagnosis,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-06T15:48:30.505708Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:05.070471Z"},"links":{"citing_paper":"/paper/2508.05547"},"observation_digest":"sha256:e87248729e92c37712302d100aeb4e5be6241b9a8a91163283ba2b7d830327da","observation_id":"0b96e069-5ce9-46fb-ba23-618196242cbd","resolution":{"observed_at":"2026-08-05T23:17:05.070471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:17:05.138131Z","title":"Text-enhanced zero-shot action recognition: A training-free approach,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-06T15:48:30.505708Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:05.138131Z"},"links":{"citing_paper":"/paper/2508.05547"},"observation_digest":"sha256:a080d691f332ac8f4a69df21e12f9236dd71604dd7872a13c14ef06c554af615","observation_id":"e432cc70-4a70-4a78-834c-ee7a7e2fb61c","resolution":{"observed_at":"2026-08-05T23:17:05.138131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:17:05.189370Z","title":"Dts-tpt: dual temporal-sync test-time prompt tuning for zero-shot activity recogni- tion,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-06T15:48:30.505708Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:05.189370Z"},"links":{"citing_paper":"/paper/2508.05547"},"observation_digest":"sha256:ee14c3ec299272f27a4054e71ff983304bf04c8a0c75be7098c9f518eec4adc2","observation_id":"efb7bc96-b047-4ae8-ab73-df044ce405da","resolution":{"observed_at":"2026-08-05T23:17:05.189370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:17:05.253496Z","title":"Pouf: Prompt- oriented unsupervised fine-tuning for large pre-trained models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-06T15:48:30.505708Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:05.253496Z"},"links":{"citing_paper":"/paper/2508.05547"},"observation_digest":"sha256:9061546bf2ecd3ec330e08e659a2970bd996f50a54094c4033249d011d7745cc","observation_id":"2d5e7e2c-9e54-4fd9-9876-a1e3ec263850","resolution":{"observed_at":"2026-08-05T23:17:05.253496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:17:05.308737Z","title":"Label propagation for zero-shot classification with vision-language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-06T15:48:30.505708Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:05.308737Z"},"links":{"citing_paper":"/paper/2508.05547"},"observation_digest":"sha256:dbc54f3d93b1d99e24f244d36426d18b6288ef83e7bc595f6d5f7e37fb69d571","observation_id":"a4d550c2-8289-4794-a8c9-5bea88691405","resolution":{"observed_at":"2026-08-05T23:17:05.308737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:17:05.371056Z","title":"On the test-time zero-shot generalization of vision-language models: Do we really need prompt learning?","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-06T15:48:30.505708Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:05.371056Z"},"links":{"citing_paper":"/paper/2508.05547"},"observation_digest":"sha256:97ec96af1821c8e54db9247785a5375b29dddfaca025fac99a58ae6095145b5c","observation_id":"2bc59056-7b73-454a-8dd2-bed00cc3b9be","resolution":{"observed_at":"2026-08-05T23:17:05.371056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:17:05.461471Z","title":"Vision-language models for vision tasks: A survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-06T15:48:30.505708Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:05.461471Z"},"links":{"citing_paper":"/paper/2508.05547"},"observation_digest":"sha256:2856b2f1d6f91ea76cfefb6a47416b8c0cc1810ec8e494f0a4fd896e5bd32886","observation_id":"ea13eed2-730c-4441-91de-ef40aadca1f7","resolution":{"observed_at":"2026-08-05T23:17:05.461471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:17:05.538275Z","title":"Advances in multimodal adaptation and generalization: From traditional approaches to foundation models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-06T15:48:30.505708Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:05.538275Z"},"links":{"citing_paper":"/paper/2508.05547"},"observation_digest":"sha256:d571ff42764339500355aa51a398e107adbf3dd700723147ec498920ffe89b21","observation_id":"e5790b02-7f2d-4dad-a3f2-33261cc94dfd","resolution":{"observed_at":"2026-08-05T23:17:05.538275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-08T10:23:10.135024Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18504","snapshot_observed_at":"2026-08-05T23:17:05.585412Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-06T15:48:30.505708Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:05.585412Z"},"links":{"cited_paper":"/paper/2506.18504","citing_paper":"/paper/2508.05547"},"observation_digest":"sha256:4ad658a8141a3f9318de45c091dd6a9921df7b64c6733c3ca9299e0a638b7ecc","observation_id":"f8531e7b-6bdf-4510-b747-0e5a4a7f87ed","resolution":{"observed_at":"2026-08-05T23:17:05.585412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:17:05.671452Z","title":"A comprehensive survey on test-time adaptation under distribution shifts,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-06T15:48:30.505708Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:05.671452Z"},"links":{"citing_paper":"/paper/2508.05547"},"observation_digest":"sha256:baf1386bc9307f4a8909d26f312f2db78620f6dafd67c18e7b15bf60e5e717a5","observation_id":"bf69ec72-773f-48b1-8cca-2da2df8b104c","resolution":{"observed_at":"2026-08-05T23:17:05.671452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:17:05.713046Z","title":"In search of lost online test-time adaptation: A survey,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-06T15:48:30.505708Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:05.713046Z"},"links":{"citing_paper":"/paper/2508.05547"},"observation_digest":"sha256:339466dce6d145d1a0160ca6171ff769632978a76dcc0d66bef37d79896decfa","observation_id":"842cf4bc-c21d-4531-8f59-f062c69b0885","resolution":{"observed_at":"2026-08-05T23:17:05.713046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.03687","last_updated":"2024-11-06T06:13:57Z","snapshot_observed_at":"2026-08-06T20:03:24.909204Z","submitted_at":"2024-11-06T06:13:57Z","title":"Beyond Model Adaptation at Test Time: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.03687","snapshot_observed_at":"2026-08-05T23:17:05.771665Z","title":"Beyond model adaptation at test time: A survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-06T15:48:30.505708Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:05.771665Z"},"links":{"cited_paper":"/paper/2411.03687","citing_paper":"/paper/2508.05547"},"observation_digest":"sha256:db8f1707e4936dc4c7edf34b85fa38786ee4c9ee831138ce194c92e7a6d93f2c","observation_id":"d0d3fa61-1766-4e2b-9cae-d689705ac2fb","resolution":{"observed_at":"2026-08-05T23:17:05.771665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.07783","last_updated":"2021-11-09T17:15:38Z","snapshot_observed_at":"2026-07-06T12:08:35.761426Z","submitted_at":"2021-11-09T17:15:38Z","title":"FILIP: Fine-grained Interactive Language-Image Pre-Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.07783","snapshot_observed_at":"2026-08-05T23:17:05.859329Z","title":"Filip: Fine-grained interactive language-image pre-training,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-06T15:48:30.505708Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:05.859329Z"},"links":{"cited_paper":"/paper/2111.07783","citing_paper":"/paper/2508.05547"},"observation_digest":"sha256:0f8d2df3ec031375a59c832bed87915b1d95c004438cbc648bbe36df0d4b221e","observation_id":"e716f882-24dc-4ea4-b2f4-4fc56b7832f5","resolution":{"observed_at":"2026-08-05T23:17:05.859329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:17:05.910520Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-06T15:48:30.505708Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:05.910520Z"},"links":{"citing_paper":"/paper/2508.05547"},"observation_digest":"sha256:baa1863000ebcf1bfcbf1db4002eb0bcc6c87d4cab7b6326810a2f62d886f69b","observation_id":"c30dc607-dab7-4d22-bae1-125ce99ae1eb","resolution":{"observed_at":"2026-08-05T23:17:05.910520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:17:05.951097Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-06T15:48:30.505708Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:05.951097Z"},"links":{"citing_paper":"/paper/2508.05547"},"observation_digest":"sha256:27baec9205a0754743c9ce626aeb87fcd82a9e3059dcfd88d18840341ad8ed73","observation_id":"200d380b-0fc0-4d23-91a2-4c94b932b669","resolution":{"observed_at":"2026-08-05T23:17:05.951097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-05T23:17:06.035332Z","title":"Microsoft coco captions: Data collection and evaluation server,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-06T15:48:30.505708Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:06.035332Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2508.05547"},"observation_digest":"sha256:41c9799bd97fb243a19dd0f1999709320eb52ee03c38922f361f41fb073966e2","observation_id":"aaf5043a-1208-4a05-9244-460064c6cb40","resolution":{"observed_at":"2026-08-05T23:17:06.035332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:17:06.095913Z","title":"Image captioning with semantic attention,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-06T15:48:30.505708Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:06.095913Z"},"links":{"citing_paper":"/paper/2508.05547"},"observation_digest":"sha256:dd64326b6d41b9950fca20691a4d39f53b76555ba711c2a4539548f05f512446","observation_id":"57e4bcf7-a40f-4541-86cc-45e50f583cc9","resolution":{"observed_at":"2026-08-05T23:17:06.095913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:17:06.198250Z","title":"Visual question answering: A survey of methods and datasets,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-06T15:48:30.505708Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:06.198250Z"},"links":{"citing_paper":"/paper/2508.05547"},"observation_digest":"sha256:94c908ec38d642bad0c8b5ec0fd90eb7c01904d4bd707dad9944b8b9fc8ff1ab","observation_id":"ee405704-3202-4be4-a1ab-e3073d8f9d58","resolution":{"observed_at":"2026-08-05T23:17:06.198250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:17:06.276256Z","title":"High- resolution image synthesis with latent diffusion models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-06T15:48:30.505708Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:06.276256Z"},"links":{"citing_paper":"/paper/2508.05547"},"observation_digest":"sha256:d33a4136e8b1126ee9b05f3d09d3b4f0492e0daa4141ade918c18c225f518c8f","observation_id":"b11b603b-f8e3-497e-be26-5e4aa4056122","resolution":{"observed_at":"2026-08-05T23:17:06.276256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:17:06.317978Z","title":"Deep supervised cross-modal retrieval,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-06T15:48:30.505708Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:06.317978Z"},"links":{"citing_paper":"/paper/2508.05547"},"observation_digest":"sha256:60800566c9ffb4dd065cafd8a3784f8434121ce5fbbeeaa0fc2859c120d779f9","observation_id":"02359158-71fa-4a62-9dd2-f003c7892612","resolution":{"observed_at":"2026-08-05T23:17:06.317978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:17:06.384111Z","title":"A comprehensive survey on pretrained foundation models: A history from bert to chatgpt,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-06T15:48:30.505708Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:06.384111Z"},"links":{"citing_paper":"/paper/2508.05547"},"observation_digest":"sha256:7f5486a38c07f21c9a3bb2ff392cd42f1bc54172a6be7ce569b7df3ffbc1c2b1","observation_id":"83f1a346-24ac-4557-93a1-f3d22b65a286","resolution":{"observed_at":"2026-08-05T23:17:06.384111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:17:06.445225Z","title":"Learning to detect unseen object classes by between-class attribute transfer,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-06T15:48:30.505708Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:06.445225Z"},"links":{"citing_paper":"/paper/2508.05547"},"observation_digest":"sha256:7a51018d6565038b8ca606d08aeb6fe47816ff5dd8e70f3b18377c343617f820","observation_id":"61ef6ba4-54e1-479b-b3c1-e5a66aef93b7","resolution":{"observed_at":"2026-08-05T23:17:06.445225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:17:06.511582Z","title":"Describing objects by their attributes,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-06T15:48:30.505708Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:06.511582Z"},"links":{"citing_paper":"/paper/2508.05547"},"observation_digest":"sha256:2be1b1335ae28139423e45baaf4a171e3d1cdbbc73ea403f15d80de0a984ed92","observation_id":"c38ba418-de6d-4f35-9acc-7332b1c1c721","resolution":{"observed_at":"2026-08-05T23:17:06.511582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:17:06.519380Z","title":"Devise: A deep visual-semantic embedding model,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-06T15:48:30.505708Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:06.519380Z"},"links":{"citing_paper":"/paper/2508.05547"},"observation_digest":"sha256:dec2fa5fb1feda127370241e4e9e90f42c43592c2acdd6044c89b529a3aa2307","observation_id":"7df03e6e-1b56-43ad-8a7d-7a52637ed111","resolution":{"observed_at":"2026-08-05T23:17:06.519380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:17:06.524000Z","title":"An embarrassingly simple approach to zero-shot learning,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-06T15:48:30.505708Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:06.524000Z"},"links":{"citing_paper":"/paper/2508.05547"},"observation_digest":"sha256:5574b79a32a61e10569d640e699eb605e41de72ebc2e986b3d34a48c07e7b6af","observation_id":"3536aa89-4f5e-4bed-9844-69467245b3d1","resolution":{"observed_at":"2026-08-05T23:17:06.524000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:17:06.528338Z","title":"Generalized zero-shot learning via synthesized examples,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-06T15:48:30.505708Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:06.528338Z"},"links":{"citing_paper":"/paper/2508.05547"},"observation_digest":"sha256:5340a0a6fb9cf22ac29b4db20137bef9152fb289f2b73e6802a83f4f9ff5b633","observation_id":"bd00ec66-9ca8-4ca5-bea0-5d1ad47cabce","resolution":{"observed_at":"2026-08-05T23:17:06.528338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:17:06.532571Z","title":"Multi-modal cycle-consistent generalized zero-shot learning,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-06T15:48:30.505708Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:06.532571Z"},"links":{"citing_paper":"/paper/2508.05547"},"observation_digest":"sha256:ef9137071827843eea39c337ec5f8712c83069a01ae247464071f3e00b1ae2da","observation_id":"c293621c-f38d-4d18-af71-7364ada6ef61","resolution":{"observed_at":"2026-08-05T23:17:06.532571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:17:06.537074Z","title":"f-vaegan-d2: A feature generating framework for any-shot learning,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-06T15:48:30.505708Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:06.537074Z"},"links":{"citing_paper":"/paper/2508.05547"},"observation_digest":"sha256:908c77feddc6c1be48674aea65fac67e01c8c61beb6d04417424000446154935","observation_id":"fd4c9846-139c-474a-beec-29711a63aee4","resolution":{"observed_at":"2026-08-05T23:17:06.537074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:17:06.541736Z","title":"An empirical study and analysis of generalized zero-shot learning for object recognition in the wild,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-06T15:48:30.505708Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:06.541736Z"},"links":{"citing_paper":"/paper/2508.05547"},"observation_digest":"sha256:93bf3d9c807f1a4d7344b03f0780de3954cf20baa16717c14cfa76d7034ece83","observation_id":"c72e388f-fee6-4710-90e6-e6bbd9715452","resolution":{"observed_at":"2026-08-05T23:17:06.541736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:17:06.546148Z","title":"Zero-shot learning-the good, the bad and the ugly,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-06T15:48:30.505708Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:06.546148Z"},"links":{"citing_paper":"/paper/2508.05547"},"observation_digest":"sha256:2a05fc9d07e314b68e16a61f54f789146821e6a2fbd2a85858925eabcc8f37f0","observation_id":"e9ef69b8-6ff8-43b3-8a42-d537f92582ce","resolution":{"observed_at":"2026-08-05T23:17:06.546148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:17:06.550354Z","title":"A review of generalized zero-shot learning meth- ods,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-06T15:48:30.505708Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:06.550354Z"},"links":{"citing_paper":"/paper/2508.05547"},"observation_digest":"sha256:cc69bb2ed9b4b36c158f5ae05586b2c63f133266afe6e1f2d5be9a88c93d7e4f","observation_id":"0e9509dd-9864-47a8-aba1-19cbb38e52f9","resolution":{"observed_at":"2026-08-05T23:17:06.550354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:17:06.554621Z","title":"A survey of zero-shot learning: Settings, methods, and applications,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-06T15:48:30.505708Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:06.554621Z"},"links":{"citing_paper":"/paper/2508.05547"},"observation_digest":"sha256:8a20a333db3a6e05c5f2e496b5c2ab95ee5fe2b8cfdb9719a1308a30d914a874","observation_id":"9f0d1a5f-f402-4753-9031-61e150c492d7","resolution":{"observed_at":"2026-08-05T23:17:06.554621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.02219","last_updated":"2023-02-14T14:01:38Z","snapshot_observed_at":"2026-07-06T14:14:18.434647Z","submitted_at":"2022-11-04T02:06:22Z","title":"Understanding and Mitigating Overfitting in Prompt Tuning for Vision-Language Models","version":3},"cited_work":{"arxiv_id":"2211.02219","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.02219","snapshot_observed_at":"2026-08-05T23:17:14.759809Z","title":"Understanding and Mitigating Overfitting in Prompt Tuning for Vision-Language Models","venue":"cs.CV","work_id":"adc0aa78-1a98-4b2f-989a-25123e278ac4","year":2022},"citing_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-06T15:48:30.505708Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:06.559119Z"},"links":{"cited_paper":"/paper/2211.02219","citing_paper":"/paper/2508.05547"},"observation_digest":"sha256:e8fa460160c4d25d1141ff5b379e68b2080ef697687b3cc6b78560842db14c17","observation_id":"cedb5ca5-4f96-49a2-800f-3bbf385f578d","resolution":{"observed_at":"2026-08-05T23:17:14.764669Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:17:06.563682Z","title":"Clip-adapter: Better vision-language models with feature adapters,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-06T15:48:30.505708Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:06.563682Z"},"links":{"citing_paper":"/paper/2508.05547"},"observation_digest":"sha256:5e7f424a5dc03a8cdce06f502da0b2f77eaccc021473ebe27d85bf895e258be2","observation_id":"295c011c-078c-4ccc-a1bf-3ebd20648b9e","resolution":{"observed_at":"2026-08-05T23:17:06.563682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.03930","last_updated":"2021-11-15T04:58:28Z","snapshot_observed_at":"2026-07-31T03:05:21.352948Z","submitted_at":"2021-11-06T18:09:22Z","title":"Tip-Adapter: Training-free CLIP-Adapter for Better Vision-Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.03930","snapshot_observed_at":"2026-08-05T23:17:06.568562Z","title":"Tip-adapter: Training-free clip-adapter for better vision- language modeling,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-06T15:48:30.505708Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:06.568562Z"},"links":{"cited_paper":"/paper/2111.03930","citing_paper":"/paper/2508.05547"},"observation_digest":"sha256:bce99415dfcd22afc0edb8f38a34c6ad28fee01ccb55a08a9f3dcfef1d04108c","observation_id":"6bdd2d81-edc0-4840-8603-264b06a8fbad","resolution":{"observed_at":"2026-08-05T23:17:06.568562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:17:06.572790Z","title":"Low-rank few-shot adaptation of vision- language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-06T15:48:30.505708Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:06.572790Z"},"links":{"citing_paper":"/paper/2508.05547"},"observation_digest":"sha256:a41acc1262fff8bcdd65dcb34798ab89a9112c5dcfa8cca8aec01d4c6cbc6362","observation_id":"508ca37d-ec6c-41f9-9955-d8a8c376ed91","resolution":{"observed_at":"2026-08-05T23:17:06.572790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07183","last_updated":"2022-12-01T17:38:37Z","snapshot_observed_at":"2026-08-08T07:53:13.926951Z","submitted_at":"2022-10-13T17:03:46Z","title":"Visual Classification via Description from Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07183","snapshot_observed_at":"2026-08-05T23:17:06.577174Z","title":"Visual classification via description from large language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-06T15:48:30.505708Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:06.577174Z"},"links":{"cited_paper":"/paper/2210.07183","citing_paper":"/paper/2508.05547"},"observation_digest":"sha256:d6b00ace7424f0f8c1d954370e5e5a71c1d362e2adf210ebca50b9ba13621881","observation_id":"be2961b0-4a51-4b47-995f-fc2953daa493","resolution":{"observed_at":"2026-08-05T23:17:06.577174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:17:06.581490Z","title":"Denseclip: Language-guided dense prediction with context- aware prompting,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-06T15:48:30.505708Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:06.581490Z"},"links":{"citing_paper":"/paper/2508.05547"},"observation_digest":"sha256:a1212289b20a6395cb5168aec637d60674b2b3ce5b404d48745fb3600c81ce89","observation_id":"647103fe-dd31-47ff-ae31-feed2951415b","resolution":{"observed_at":"2026-08-05T23:17:06.581490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.12980","last_updated":"2023-07-24T17:58:06Z","snapshot_observed_at":"2026-08-08T23:43:33.914655Z","submitted_at":"2023-07-24T17:58:06Z","title":"A Systematic Survey of Prompt Engineering on Vision-Language Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.12980","snapshot_observed_at":"2026-08-05T23:17:06.585528Z","title":"A systematic survey of prompt engineering on vision-language foundation models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-06T15:48:30.505708Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:06.585528Z"},"links":{"cited_paper":"/paper/2307.12980","citing_paper":"/paper/2508.05547"},"observation_digest":"sha256:7de70f4c193c49dadcef31b42f130a242f0e57aba02771e2360014ec63c6e226","observation_id":"a0d3e291-6774-4c4b-b33c-5f3ddc703e08","resolution":{"observed_at":"2026-08-05T23:17:06.585528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.12558","last_updated":"2025-06-26T14:33:44Z","snapshot_observed_at":"2026-07-06T19:52:37.903769Z","submitted_at":"2024-11-19T15:18:50Z","title":"Recall and Refine: A Simple but Effective Source-free Open-set Domain Adaptation Framework","version":2},"cited_work":{"arxiv_id":"2411.12558","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.12558","snapshot_observed_at":"2026-08-05T23:17:14.690647Z","title":"Recall and Refine: A Simple but Effective Source-free Open-set Domain Adaptation Framework","venue":"cs.CV","work_id":"e92ae3ac-1c6c-496a-8e1a-e756b1ce966d","year":2024},"citing_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-06T15:48:30.505708Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:06.589956Z"},"links":{"cited_paper":"/paper/2411.12558","citing_paper":"/paper/2508.05547"},"observation_digest":"sha256:25f2904317f5d6c9c2188d959c5479dd6ffcc56d6f8a9e512a861fa2423a402b","observation_id":"fb8af6a8-7d5e-4f5e-a6b1-9d43331e4572","resolution":{"observed_at":"2026-08-05T23:17:14.695358Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:17:06.594580Z","title":"Do we really need to access the source data? source hypothesis transfer for unsupervised domain adaptation,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-06T15:48:30.505708Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:06.594580Z"},"links":{"citing_paper":"/paper/2508.05547"},"observation_digest":"sha256:3b088af6728d1c66f507a332a0c0b63fffbef81c824a60f886aaaa4ed018406b","observation_id":"19322e0b-ce33-4da2-b424-77e88498a2e5","resolution":{"observed_at":"2026-08-05T23:17:06.594580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:17:06.598787Z","title":"Exploiting local feature patterns for unsupervised domain adaptation,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-06T15:48:30.505708Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:06.598787Z"},"links":{"citing_paper":"/paper/2508.05547"},"observation_digest":"sha256:2b2167fab66761e035bb725dbd1a475a629a80f138928f62c5185392442e58a5","observation_id":"8e7bf716-5549-4aad-9d98-634e953e60d6","resolution":{"observed_at":"2026-08-05T23:17:06.598787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:17:06.602801Z","title":"Contrastive test-time adaptation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-06T15:48:30.505708Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:06.602801Z"},"links":{"citing_paper":"/paper/2508.05547"},"observation_digest":"sha256:8a2a357cc32ed63272f2519d3f0db74c259ab67f8072b4ad995c2fa469e2e52f","observation_id":"ce03de49-3ecc-4add-90dd-634f432ef179","resolution":{"observed_at":"2026-08-05T23:17:06.602801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:17:06.607476Z","title":"Universal source-free domain adaptation,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-06T15:48:30.505708Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:06.607476Z"},"links":{"citing_paper":"/paper/2508.05547"},"observation_digest":"sha256:d53f7bdd92da5845103769a2e79c40285b7aca61076c9191c8ded01c2289ca5d","observation_id":"d8d98dbb-c695-44bf-afd4-c9a410ea73b1","resolution":{"observed_at":"2026-08-05T23:17:06.607476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:17:06.611750Z","title":"Model adaptation: Historical contrastive learning for unsupervised domain adaptation without source data,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-06T15:48:30.505708Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:06.611750Z"},"links":{"citing_paper":"/paper/2508.05547"},"observation_digest":"sha256:73f46046bdb872fee066cf9b3c14a692f026992dfe07c37358c877f881bc0219","observation_id":"338b0a1c-c833-4f03-aea6-808e47f1a14f","resolution":{"observed_at":"2026-08-05T23:17:06.611750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:17:06.615871Z","title":"Domain adaptation without source data,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-06T15:48:30.505708Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:06.615871Z"},"links":{"citing_paper":"/paper/2508.05547"},"observation_digest":"sha256:ee6aa0d9fa3972d298725803906f5e58d873693715af4e5fb23d5390d8e7baa1","observation_id":"1861f6fd-2daa-4cf2-9940-09ceecbc5bc9","resolution":{"observed_at":"2026-08-05T23:17:06.615871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:17:06.620242Z","title":"A comprehensive survey on source-free domain adaptation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-06T15:48:30.505708Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:06.620242Z"},"links":{"citing_paper":"/paper/2508.05547"},"observation_digest":"sha256:872c13ceb860363b518874b1403d98fcbfc274812c2e3ce45168b1e394db1c02","observation_id":"7fa2327c-4e39-4d95-85d2-6db255df0849","resolution":{"observed_at":"2026-08-05T23:17:06.620242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:17:06.624666Z","title":"Source-free unsu- pervised domain adaptation: A survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-06T15:48:30.505708Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:06.624666Z"},"links":{"citing_paper":"/paper/2508.05547"},"observation_digest":"sha256:1d4b5f2a62c5105f1cbc37ff729a4e6f09fbfef9689610491ec3df9b4660e53c","observation_id":"f4ce1167-0449-48b6-9528-9dba3aff35d9","resolution":{"observed_at":"2026-08-05T23:17:06.624666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:17:06.628996Z","title":"Tent: Fully test-time adaptation by entropy minimization,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-06T15:48:30.505708Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:06.628996Z"},"links":{"citing_paper":"/paper/2508.05547"},"observation_digest":"sha256:cceadff728ef28557c016b4e835bf1b0de6d9a63c15e49ddeeb3d31b1f914a5f","observation_id":"5b0de065-0440-4bfc-9d68-f2fc31c4619d","resolution":{"observed_at":"2026-08-05T23:17:06.628996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:17:06.633652Z","title":"Towards robust multimodal open-set test-time adaptation via adaptive entropy-aware optimization,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-06T15:48:30.505708Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:06.633652Z"},"links":{"citing_paper":"/paper/2508.05547"},"observation_digest":"sha256:27abf748e59fadbc09c759a6a5987ae404783207f40740a993cfc5a76cb4ed83","observation_id":"df703f37-0672-45f7-9e34-c28f0e8d0c7a","resolution":{"observed_at":"2026-08-05T23:17:06.633652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:17:06.638132Z","title":"Efficient test-time model adaptation without forgetting,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-06T15:48:30.505708Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:06.638132Z"},"links":{"citing_paper":"/paper/2508.05547"},"observation_digest":"sha256:23b2c6dab23df48b48f152418bb163df6a509c0fb832f55456c997c2164c4c5e","observation_id":"76497343-3cc5-4a9a-be0f-0ba739fcdaae","resolution":{"observed_at":"2026-08-05T23:17:06.638132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:17:06.642480Z","title":"Sotta: Robust test-time adaptation on noisy data streams,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-06T15:48:30.505708Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:06.642480Z"},"links":{"citing_paper":"/paper/2508.05547"},"observation_digest":"sha256:52a17d8862836763d34198c519e95e993d26367561b703ff0b1e95ea87160bf1","observation_id":"dc774672-c694-45f1-a379-0a41fb77b784","resolution":{"observed_at":"2026-08-05T23:17:06.642480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:17:06.648686Z","title":"Continual test-time domain adaptation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-06T15:48:30.505708Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:06.648686Z"},"links":{"citing_paper":"/paper/2508.05547"},"observation_digest":"sha256:4f2563563fa894a69af82d64fe156f3922828498fd77244f8e4cae9c4c02c71e","observation_id":"62cbaaf8-0c64-44be-8665-0a97165148f2","resolution":{"observed_at":"2026-08-05T23:17:06.648686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:17:06.653156Z","title":"Ecotta: Memory- efficient continual test-time adaptation via self-distilled regularization,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-06T15:48:30.505708Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:06.653156Z"},"links":{"citing_paper":"/paper/2508.05547"},"observation_digest":"sha256:6b54ebf499589f7fc503d05ae8a8d53ec41475ff9db238099bf1b31ecf76533d","observation_id":"dac2b887-aefc-4861-b6b5-6dda7765fbf6","resolution":{"observed_at":"2026-08-05T23:17:06.653156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:17:06.657503Z","title":"Diverse data augmentation with diffusions for effective test-time prompt tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-06T15:48:30.505708Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:06.657503Z"},"links":{"citing_paper":"/paper/2508.05547"},"observation_digest":"sha256:ad71eb04c54d409339e22b5dabdd49d3c6779b583c2cdd601daa4955f4ef18b4","observation_id":"e4377699-4fc5-4b85-8662-e509ee2fe5ae","resolution":{"observed_at":"2026-08-05T23:17:06.657503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-05T23:17:06.662323Z","title":"Eva-clip: Improved training techniques for clip at scale,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-06T15:48:30.505708Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:06.662323Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2508.05547"},"observation_digest":"sha256:e338d6b48dce5f460f302bf0cf9799c9fb63db24a4cfa8fee6a20e5e4e6ab031","observation_id":"4b059712-fd22-4477-b17a-1ad35fee2618","resolution":{"observed_at":"2026-08-05T23:17:06.662323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:17:06.667461Z","title":"Sigmoid loss for language image pre-training,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-06T15:48:30.505708Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:06.667461Z"},"links":{"citing_paper":"/paper/2508.05547"},"observation_digest":"sha256:f7260604d9c98f9f7b12a6dcaed26d9c5364e986d0b592a7fd84a78f425a52d1","observation_id":"fde89f92-ca02-403b-80ba-a5ea5b6555bb","resolution":{"observed_at":"2026-08-05T23:17:06.667461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:17:06.671557Z","title":"Chils: Zero-shot image classification with hierarchical label sets,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-06T15:48:30.505708Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:06.671557Z"},"links":{"citing_paper":"/paper/2508.05547"},"observation_digest":"sha256:f1fbbd460d297670bc7db0ff304f77d3aa5016973dc4386b801618402b41bf59","observation_id":"1763b2da-8de3-4af7-83ce-b084a89c1661","resolution":{"observed_at":"2026-08-05T23:17:06.671557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:17:06.680502Z","title":"Sus-x: Training-free name- only transfer of vision-language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-06T15:48:30.505708Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:06.680502Z"},"links":{"citing_paper":"/paper/2508.05547"},"observation_digest":"sha256:66de40d90ba859be1f6061ee19b7424e587dd9a3076c8f60c43e372e0c11e0d5","observation_id":"fdef4187-3409-4253-91db-20dcf330a566","resolution":{"observed_at":"2026-08-05T23:17:06.680502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:17:06.685106Z","title":"Neural priming for sample- efficient adaptation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-06T15:48:30.505708Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:06.685106Z"},"links":{"citing_paper":"/paper/2508.05547"},"observation_digest":"sha256:54881217dd6b24be68ef30f2f5a2b55e39b209f8d6dffa8032bc7f30fb850c4b","observation_id":"fe24334b-0686-42d4-b91d-db55f481f4fc","resolution":{"observed_at":"2026-08-05T23:17:06.685106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2403.10853","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:17:14.650153Z","title":"Just say the name: Online continual learning with category names only via data generation,","venue":null,"work_id":"4cf64334-61a5-4e88-981d-aad0faac02d0","year":2024},"citing_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-06T15:48:30.505708Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:06.689789Z"},"links":{"citing_paper":"/paper/2508.05547"},"observation_digest":"sha256:3fbbb3ed3e3c3da69eace1f2d34e89ffc364d3e78672ce8a1b0af0c66b1c4abc","observation_id":"d0e8afd2-32b2-41d1-9647-5c5193546abc","resolution":{"observed_at":"2026-08-05T23:17:14.657902Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:17:06.693916Z","title":"Calip: Zero-shot enhancement of clip with parameter-free attention,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-06T15:48:30.505708Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:06.693916Z"},"links":{"citing_paper":"/paper/2508.05547"},"observation_digest":"sha256:6af359c0d0dda4f47280762598cc98c3483be20f1ee3f516d0641f4c54b2daf4","observation_id":"794fb8eb-5dba-4078-a90a-b01a70774e3d","resolution":{"observed_at":"2026-08-05T23:17:06.693916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:17:06.698630Z","title":"Sclip: Rethinking self-attention for dense vision-language inference,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-06T15:48:30.505708Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:06.698630Z"},"links":{"citing_paper":"/paper/2508.05547"},"observation_digest":"sha256:281aa59b40541d8a5cf94c2a7a2846555a987bd5d0463678cc2aab2b7bfe76c6","observation_id":"520db2c9-ed3c-4e35-baec-e294df52c37f","resolution":{"observed_at":"2026-08-05T23:17:06.698630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:17:06.702964Z","title":"Proxyclip: Proxy attention improves clip for open-vocabulary segmentation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-06T15:48:30.505708Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:06.702964Z"},"links":{"citing_paper":"/paper/2508.05547"},"observation_digest":"sha256:1b6e0af4ec23ce40cc7e3425ff0d2dc3031ecdd12b80b6c2550b9f8664ba5280","observation_id":"dd531c91-a9a6-473a-8f67-3bc93551ea42","resolution":{"observed_at":"2026-08-05T23:17:06.702964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:17:06.707303Z","title":"Language models are few-shot learners,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-06T15:48:30.505708Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:06.707303Z"},"links":{"citing_paper":"/paper/2508.05547"},"observation_digest":"sha256:ff274b5f07b86c3d65e4ba170f2e3ded003e6d40e25cfc0c59700693373926ad","observation_id":"6909462e-7405-4d0d-a95f-a8a0c478f0fd","resolution":{"observed_at":"2026-08-05T23:17:06.707303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:17:06.711448Z","title":"Meta-prompting for automating zero- shot visual recognition with llms,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-06T15:48:30.505708Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:06.711448Z"},"links":{"citing_paper":"/paper/2508.05547"},"observation_digest":"sha256:f10b3312b73d7d7b19331d457239359356dd954b488417915184e20688661db9","observation_id":"58118cb6-2a68-4a9c-985c-e96e0734f571","resolution":{"observed_at":"2026-08-05T23:17:06.711448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:17:06.715573Z","title":"The neglected tails in vision-language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-06T15:48:30.505708Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:06.715573Z"},"links":{"citing_paper":"/paper/2508.05547"},"observation_digest":"sha256:836a52427bfc9884a013fb63fa0bfea92f0cd8f14ca3f48250b7c00abcfa7cd3","observation_id":"0f584590-04b1-4ba6-841b-cf602dbaa2ac","resolution":{"observed_at":"2026-08-05T23:17:06.715573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:17:06.720336Z","title":"Introducing chatgpt,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-06T15:48:30.505708Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:06.720336Z"},"links":{"citing_paper":"/paper/2508.05547"},"observation_digest":"sha256:a1e1768558bf6f6a9ddbb6e2c127eeb67e005e355e93d347a89aaf1f2713e454","observation_id":"0a162a8a-de35-43ad-9d0c-ab0017399326","resolution":{"observed_at":"2026-08-05T23:17:06.720336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:17:06.724722Z","title":"Prompting scientific names for zero-shot species recognition,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-06T15:48:30.505708Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:06.724722Z"},"links":{"citing_paper":"/paper/2508.05547"},"observation_digest":"sha256:59a86d3b3e430a11938577c88c67846b7d22b898308e113f01db4b6bdbce6c7c","observation_id":"3dacc8ed-c96d-498c-8816-f21d7e5c368f","resolution":{"observed_at":"2026-08-05T23:17:06.724722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:17:06.729087Z","title":"Waffling around for performance: Visual classification with random words and broad concepts,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-06T15:48:30.505708Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:06.729087Z"},"links":{"citing_paper":"/paper/2508.05547"},"observation_digest":"sha256:c4088b2fa23dba4d0f73ea2012ee629057f01f517931525be891b4e6e2e11bc9","observation_id":"1470bece-a105-4470-b068-35d2358f5e17","resolution":{"observed_at":"2026-08-05T23:17:06.729087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-06T15:48:30.505708Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":95,"verified_exact":5,"verified_fuzzy":0},"total_outbound_references":299},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 100 of 299 outbound references and 4 inbound Pith citation observations for arXiv:2508.05547."}