{"as_of":"2026-08-13T15:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0dfd3b4d3204be11c799815d31999fff3d3cf7137b1adafb35c8caaa17c3d0d6","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T14:55:41.073787Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:26:34.671641Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T19:26:35.642817Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.11509","last_updated":"2025-03-14T06:12:38Z","snapshot_observed_at":"2026-08-12T22:35:12.560961Z","submitted_at":"2024-12-16T07:33:23Z","title":"Skip Tuning: Pre-trained Vision-Language Models are Effective and Efficient Adapters Themselves","version":2},"cited_work":{"arxiv_id":"2412.11509","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.11509","snapshot_observed_at":"2026-08-06T19:26:35.642817Z","title":"Skip Tuning: Pre-trained Vision-Language Models are Effective and Efficient Adapters Themselves","venue":"cs.CV","work_id":"e367388a-335a-4969-8aa8-024cf0964d25","year":2024},"citing_paper":{"arxiv_id":"2507.05668","last_updated":"2025-07-08T04:52:21Z","snapshot_observed_at":"2026-08-13T09:41:20.688656Z","submitted_at":"2025-07-08T04:52:21Z","title":"Dynamic Rank Adaptation for Vision-Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T19:26:34.671641Z"},"links":{"cited_paper":"/paper/2412.11509","citing_paper":"/paper/2507.05668"},"observation_digest":"sha256:533436b96487d308fb3665797d8e613efa556d4a80b293ac7c90dbb82cd5bda1","observation_id":"a41e6341-a21e-4246-aefd-e225f5a2fa8e","resolution":{"observed_at":"2026-08-06T19:26:35.649789Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.11509/citation-record","integrity":"/paper/2412.11509/integrity","json":"/paper/2412.11509/citation-record.json","paper":"/paper/2412.11509"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-11T14:55:40.866543Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.11509","last_updated":"2025-03-14T06:12:38Z","snapshot_observed_at":"2026-08-12T22:35:12.560961Z","submitted_at":"2024-12-16T07:33:23Z","title":"Skip Tuning: Pre-trained Vision-Language Models are Effective and Efficient Adapters Themselves","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T14:55:40.866543Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2412.11509"},"observation_digest":"sha256:2bd84aa79556d4e659835029d5cae6b408bcc9fb76d0086a57a9760199e752fa","observation_id":"50196bb7-1941-4002-848c-039290e6c9a1","resolution":{"observed_at":"2026-08-11T14:55:40.866543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:55:40.872498Z","title":"Food-101–mining discriminative components with random forests","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.11509","last_updated":"2025-03-14T06:12:38Z","snapshot_observed_at":"2026-08-12T22:35:12.560961Z","submitted_at":"2024-12-16T07:33:23Z","title":"Skip Tuning: Pre-trained Vision-Language Models are Effective and Efficient Adapters Themselves","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T14:55:40.872498Z"},"links":{"citing_paper":"/paper/2412.11509"},"observation_digest":"sha256:df730d27071de0176031fc10dabb29eac5729924a144e6c13254fee8f525012c","observation_id":"a5a51f63-df43-42ec-aba2-7c1ea5438fa4","resolution":{"observed_at":"2026-08-11T14:55:40.872498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:55:40.877302Z","title":"Describing textures in the wild","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.11509","last_updated":"2025-03-14T06:12:38Z","snapshot_observed_at":"2026-08-12T22:35:12.560961Z","submitted_at":"2024-12-16T07:33:23Z","title":"Skip Tuning: Pre-trained Vision-Language Models are Effective and Efficient Adapters Themselves","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T14:55:40.877302Z"},"links":{"citing_paper":"/paper/2412.11509"},"observation_digest":"sha256:284bebe2021ecf6ccaecfe5944a6b047318db545503b03c8d44c2c89044dbf82","observation_id":"f1d5b6ac-5348-4101-a2ea-f9d5e6efdd64","resolution":{"observed_at":"2026-08-11T14:55:40.877302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:55:40.882391Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2412.11509","last_updated":"2025-03-14T06:12:38Z","snapshot_observed_at":"2026-08-12T22:35:12.560961Z","submitted_at":"2024-12-16T07:33:23Z","title":"Skip Tuning: Pre-trained Vision-Language Models are Effective and Efficient Adapters Themselves","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T14:55:40.882391Z"},"links":{"citing_paper":"/paper/2412.11509"},"observation_digest":"sha256:5ce685b5b114f6521214e11e3fee6e49ac972645e83b8842d624c95ce5e6ba95","observation_id":"12676e42-8686-4727-899c-c51b06e29ad6","resolution":{"observed_at":"2026-08-11T14:55:40.882391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:55:41.653084Z","title":"Learning gener- ative visual models from few training examples: An incre- mental bayesian approach tested on 101 object categories","venue":null,"work_id":"0b27b88a-d1ea-493c-847e-816c1e1dda39","year":null},"citing_paper":{"arxiv_id":"2412.11509","last_updated":"2025-03-14T06:12:38Z","snapshot_observed_at":"2026-08-12T22:35:12.560961Z","submitted_at":"2024-12-16T07:33:23Z","title":"Skip Tuning: Pre-trained Vision-Language Models are Effective and Efficient Adapters Themselves","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T14:55:40.887409Z"},"links":{"citing_paper":"/paper/2412.11509"},"observation_digest":"sha256:935ead98f096c8e362ebdea38e1a3f8c99be3d197e0475fb8b2421597eaaa47f","observation_id":"fc7cf552-8be5-4f6f-ac23-fd1b29b84956","resolution":{"observed_at":"2026-08-11T14:55:41.658028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:55:41.636748Z","title":"Prompt- det: Towards open-vocabulary detection using uncurated im- ages","venue":null,"work_id":"ffc668c0-ad5f-48de-a806-fdfa059bb300","year":2022},"citing_paper":{"arxiv_id":"2412.11509","last_updated":"2025-03-14T06:12:38Z","snapshot_observed_at":"2026-08-12T22:35:12.560961Z","submitted_at":"2024-12-16T07:33:23Z","title":"Skip Tuning: Pre-trained Vision-Language Models are Effective and Efficient Adapters Themselves","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T14:55:40.892303Z"},"links":{"citing_paper":"/paper/2412.11509"},"observation_digest":"sha256:6d6c7eadecd7781e78f51fd3451278e7712d4657ce6d1efba407d7fb7fc59937","observation_id":"0f96c8ec-4c78-4462-81ce-30069592af70","resolution":{"observed_at":"2026-08-11T14:55:41.641803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:55:41.621258Z","title":"Generalized meta-fdmixup: Cross-domain few-shot learning guided by labeled target data","venue":null,"work_id":"000f87e2-fb71-47d1-b3db-2b74b4c03da2","year":2022},"citing_paper":{"arxiv_id":"2412.11509","last_updated":"2025-03-14T06:12:38Z","snapshot_observed_at":"2026-08-12T22:35:12.560961Z","submitted_at":"2024-12-16T07:33:23Z","title":"Skip Tuning: Pre-trained Vision-Language Models are Effective and Efficient Adapters Themselves","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T14:55:40.897467Z"},"links":{"citing_paper":"/paper/2412.11509"},"observation_digest":"sha256:704dad29c618e1b2474ebc5a537d5cba834f5aea96b1c37fb3b7355539bf64ab","observation_id":"c4eb3178-c79a-496d-a013-837de9c261ec","resolution":{"observed_at":"2026-08-11T14:55:41.626322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:55:41.605573Z","title":"Styleadv: Meta style adversarial training for cross-domain few-shot learning","venue":null,"work_id":"8cbcaf27-26d8-49c9-853f-2755486d6e09","year":2023},"citing_paper":{"arxiv_id":"2412.11509","last_updated":"2025-03-14T06:12:38Z","snapshot_observed_at":"2026-08-12T22:35:12.560961Z","submitted_at":"2024-12-16T07:33:23Z","title":"Skip Tuning: Pre-trained Vision-Language Models are Effective and Efficient Adapters Themselves","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T14:55:40.902416Z"},"links":{"citing_paper":"/paper/2412.11509"},"observation_digest":"sha256:1aa7c2a3e442dc3191106a38f2a79950c0cc8154c863ce76674d72aaa3523b26","observation_id":"36f32ad2-6175-4f97-90b5-2f35af77f568","resolution":{"observed_at":"2026-08-11T14:55:41.610661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:55:41.589570Z","title":"Cross-domain few-shot object detection via enhanced open-set object detector","venue":null,"work_id":"3532295e-f1c9-4bd7-abc8-83fffcfb77a0","year":2025},"citing_paper":{"arxiv_id":"2412.11509","last_updated":"2025-03-14T06:12:38Z","snapshot_observed_at":"2026-08-12T22:35:12.560961Z","submitted_at":"2024-12-16T07:33:23Z","title":"Skip Tuning: Pre-trained Vision-Language Models are Effective and Efficient Adapters Themselves","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T14:55:40.907812Z"},"links":{"citing_paper":"/paper/2412.11509"},"observation_digest":"sha256:75e430144fe25a1226abec2422d2735ed6f524e732b607f9504363a1ec0c679c","observation_id":"69625c8a-da00-4531-82f3-b721d9cf621f","resolution":{"observed_at":"2026-08-11T14:55:41.594743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:55:41.574167Z","title":"Clip-adapter: Better vision-language models with feature adapters","venue":null,"work_id":"89f8f135-40de-499d-911c-97462e984897","year":2024},"citing_paper":{"arxiv_id":"2412.11509","last_updated":"2025-03-14T06:12:38Z","snapshot_observed_at":"2026-08-12T22:35:12.560961Z","submitted_at":"2024-12-16T07:33:23Z","title":"Skip Tuning: Pre-trained Vision-Language Models are Effective and Efficient Adapters Themselves","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T14:55:40.912369Z"},"links":{"citing_paper":"/paper/2412.11509"},"observation_digest":"sha256:0148c3d5fd6ab9af71f7c724868fc4df99f12f359e98dd2bf8c6fedf02b19f36","observation_id":"39a99d8c-286a-44e7-a172-e881a96deafd","resolution":{"observed_at":"2026-08-11T14:55:41.579042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.13921","last_updated":"2022-05-12T01:27:40Z","snapshot_observed_at":"2026-08-08T10:08:57.896975Z","submitted_at":"2021-04-28T17:58:57Z","title":"Open-vocabulary Object Detection via Vision and Language Knowledge Distillation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.13921","snapshot_observed_at":"2026-08-11T14:55:40.917060Z","title":"Open-vocabulary object detection via vision and language knowledge distillation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.11509","last_updated":"2025-03-14T06:12:38Z","snapshot_observed_at":"2026-08-12T22:35:12.560961Z","submitted_at":"2024-12-16T07:33:23Z","title":"Skip Tuning: Pre-trained Vision-Language Models are Effective and Efficient Adapters Themselves","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T14:55:40.917060Z"},"links":{"cited_paper":"/paper/2104.13921","citing_paper":"/paper/2412.11509"},"observation_digest":"sha256:c2a9d69a31a6fa4c07f3d6ec5d1eaf2792448fc38058c2fc39698f24ac4921ae","observation_id":"038038e9-71d8-4733-8b9f-3a472b58f70f","resolution":{"observed_at":"2026-08-11T14:55:40.917060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:55:40.922596Z","title":"Eurosat: A novel dataset and deep learning benchmark for land use and land cover classification","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.11509","last_updated":"2025-03-14T06:12:38Z","snapshot_observed_at":"2026-08-12T22:35:12.560961Z","submitted_at":"2024-12-16T07:33:23Z","title":"Skip Tuning: Pre-trained Vision-Language Models are Effective and Efficient Adapters Themselves","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T14:55:40.922596Z"},"links":{"citing_paper":"/paper/2412.11509"},"observation_digest":"sha256:8b931e532d118d1781217275a1097d067ea2204372dac950581964d92c0ee1a2","observation_id":"31dd6fd7-3d72-4954-83e2-f2c83fff7ddc","resolution":{"observed_at":"2026-08-11T14:55:40.922596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:55:40.927495Z","title":"The many faces of robust- ness: A critical analysis of out-of-distribution generalization","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.11509","last_updated":"2025-03-14T06:12:38Z","snapshot_observed_at":"2026-08-12T22:35:12.560961Z","submitted_at":"2024-12-16T07:33:23Z","title":"Skip Tuning: Pre-trained Vision-Language Models are Effective and Efficient Adapters Themselves","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T14:55:40.927495Z"},"links":{"citing_paper":"/paper/2412.11509"},"observation_digest":"sha256:2f3b697493dca16658a4f41303cfbda5cd2d4ab1a317821d9cad68e1787ac46c","observation_id":"8e503ee4-dba8-447f-8507-3be414a1399c","resolution":{"observed_at":"2026-08-11T14:55:40.927495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:55:40.932178Z","title":"Natural adversarial examples","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.11509","last_updated":"2025-03-14T06:12:38Z","snapshot_observed_at":"2026-08-12T22:35:12.560961Z","submitted_at":"2024-12-16T07:33:23Z","title":"Skip Tuning: Pre-trained Vision-Language Models are Effective and Efficient Adapters Themselves","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T14:55:40.932178Z"},"links":{"citing_paper":"/paper/2412.11509"},"observation_digest":"sha256:005731f7c0d87b9e399aa9883726f9ce6d05daea2b0f29ded940ed8ec3023ee1","observation_id":"08e6694f-6f22-4b42-abc0-b67bd7c2c8eb","resolution":{"observed_at":"2026-08-11T14:55:40.932178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-11T14:55:40.937188Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.11509","last_updated":"2025-03-14T06:12:38Z","snapshot_observed_at":"2026-08-12T22:35:12.560961Z","submitted_at":"2024-12-16T07:33:23Z","title":"Skip Tuning: Pre-trained Vision-Language Models are Effective and Efficient Adapters Themselves","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T14:55:40.937188Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2412.11509"},"observation_digest":"sha256:99722192b933bc124b443e032c634555ef9f85f454ef13db6083fb6ab9189559","observation_id":"d7d6ad56-eb48-4648-be15-67e927630919","resolution":{"observed_at":"2026-08-11T14:55:40.937188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:55:40.941812Z","title":"Scaling up visual and vision-language representa- tion learning with noisy text supervision","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.11509","last_updated":"2025-03-14T06:12:38Z","snapshot_observed_at":"2026-08-12T22:35:12.560961Z","submitted_at":"2024-12-16T07:33:23Z","title":"Skip Tuning: Pre-trained Vision-Language Models are Effective and Efficient Adapters Themselves","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T14:55:40.941812Z"},"links":{"citing_paper":"/paper/2412.11509"},"observation_digest":"sha256:c82818995b0ff4fa9756b7d3b5d036ed254f8ba7316da4940b746e2eea77fe1d","observation_id":"c7bd8b7d-e88d-42fa-b6d5-1e4c6f88fcd4","resolution":{"observed_at":"2026-08-11T14:55:40.941812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:55:41.520960Z","title":"Maple: Multi-modal prompt learning","venue":null,"work_id":"8228900c-38e3-43fe-bb5f-82d708a8111d","year":2023},"citing_paper":{"arxiv_id":"2412.11509","last_updated":"2025-03-14T06:12:38Z","snapshot_observed_at":"2026-08-12T22:35:12.560961Z","submitted_at":"2024-12-16T07:33:23Z","title":"Skip Tuning: Pre-trained Vision-Language Models are Effective and Efficient Adapters Themselves","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T14:55:40.946668Z"},"links":{"citing_paper":"/paper/2412.11509"},"observation_digest":"sha256:db13680642a06905bd7794f20f6e4786b6faa4e87b14125588f80a74027a5fc7","observation_id":"218717cc-5862-437d-8a66-23f6df721752","resolution":{"observed_at":"2026-08-11T14:55:41.525993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:55:41.505437Z","title":"Self-regulating prompts: Foundational model adaptation without forgetting","venue":null,"work_id":"0ae1a7d3-0ff7-480e-9324-6a7e2e7cbeb9","year":2023},"citing_paper":{"arxiv_id":"2412.11509","last_updated":"2025-03-14T06:12:38Z","snapshot_observed_at":"2026-08-12T22:35:12.560961Z","submitted_at":"2024-12-16T07:33:23Z","title":"Skip Tuning: Pre-trained Vision-Language Models are Effective and Efficient Adapters Themselves","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T14:55:40.951194Z"},"links":{"citing_paper":"/paper/2412.11509"},"observation_digest":"sha256:4d0eb14ac6299e8104e5b0f8f8c5018282a36dd1d5b283496c2f61f3d0f1b841","observation_id":"b510d689-7869-45c0-ad7c-0fc0019fa416","resolution":{"observed_at":"2026-08-11T14:55:41.510474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:55:40.955491Z","title":"3d object representations for fine-grained categorization","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2412.11509","last_updated":"2025-03-14T06:12:38Z","snapshot_observed_at":"2026-08-12T22:35:12.560961Z","submitted_at":"2024-12-16T07:33:23Z","title":"Skip Tuning: Pre-trained Vision-Language Models are Effective and Efficient Adapters Themselves","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T14:55:40.955491Z"},"links":{"citing_paper":"/paper/2412.11509"},"observation_digest":"sha256:fd733c5da4452895b61154fafacd9e87c3eab07a5538d74980c63d42b6893fbb","observation_id":"cae21571-0a4d-46a5-9316-9ff8c2c0746c","resolution":{"observed_at":"2026-08-11T14:55:40.955491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:55:41.479730Z","title":"Image segmenta- tion using text and image prompts","venue":null,"work_id":"aee922f0-f87b-4bb8-9739-60edf75c7d09","year":2022},"citing_paper":{"arxiv_id":"2412.11509","last_updated":"2025-03-14T06:12:38Z","snapshot_observed_at":"2026-08-12T22:35:12.560961Z","submitted_at":"2024-12-16T07:33:23Z","title":"Skip Tuning: Pre-trained Vision-Language Models are Effective and Efficient Adapters Themselves","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T14:55:40.960226Z"},"links":{"citing_paper":"/paper/2412.11509"},"observation_digest":"sha256:133e857dbcd17c7bd008f3110b3dc828e9def5a8a6ae3790e83a39ba78511685","observation_id":"c4dedc22-9636-4ae1-8f2c-ddd769184ec5","resolution":{"observed_at":"2026-08-11T14:55:41.484465Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1306.5151","last_updated":"2013-06-21T14:31:57Z","snapshot_observed_at":"2026-08-12T17:35:23.022229Z","submitted_at":"2013-06-21T14:31:57Z","title":"Fine-Grained Visual Classification of Aircraft","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1306.5151","snapshot_observed_at":"2026-08-11T14:55:40.964760Z","title":"Fine-grained visual classi- fication of aircraft","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2412.11509","last_updated":"2025-03-14T06:12:38Z","snapshot_observed_at":"2026-08-12T22:35:12.560961Z","submitted_at":"2024-12-16T07:33:23Z","title":"Skip Tuning: Pre-trained Vision-Language Models are Effective and Efficient Adapters Themselves","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T14:55:40.964760Z"},"links":{"cited_paper":"/paper/1306.5151","citing_paper":"/paper/2412.11509"},"observation_digest":"sha256:d3ab4bc1b695f4eeba27b11955dc50be9ee35dfa14ff1af0391da714ac02f26c","observation_id":"fffef978-e826-4180-9f1e-bddedd282271","resolution":{"observed_at":"2026-08-11T14:55:40.964760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:55:40.969740Z","title":"Automated flower classification over a large number of classes","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2412.11509","last_updated":"2025-03-14T06:12:38Z","snapshot_observed_at":"2026-08-12T22:35:12.560961Z","submitted_at":"2024-12-16T07:33:23Z","title":"Skip Tuning: Pre-trained Vision-Language Models are Effective and Efficient Adapters Themselves","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T14:55:40.969740Z"},"links":{"citing_paper":"/paper/2412.11509"},"observation_digest":"sha256:b5867c7a65bbdbc64236d80796b045add6226ad5d078391cd647ebb41446e406","observation_id":"fb8a4d52-e292-41c2-818e-2e7e6c8b81a7","resolution":{"observed_at":"2026-08-11T14:55:40.969740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:55:40.973859Z","title":"Cats and dogs","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2412.11509","last_updated":"2025-03-14T06:12:38Z","snapshot_observed_at":"2026-08-12T22:35:12.560961Z","submitted_at":"2024-12-16T07:33:23Z","title":"Skip Tuning: Pre-trained Vision-Language Models are Effective and Efficient Adapters Themselves","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T14:55:40.973859Z"},"links":{"citing_paper":"/paper/2412.11509"},"observation_digest":"sha256:5491462de471ea8ede14c16391cd55f3483a854b7b34e5d2617814090f86b4bb","observation_id":"105a9afd-9f48-4627-ab4d-9f0d5c3b3872","resolution":{"observed_at":"2026-08-11T14:55:40.973859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:55:41.446497Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":"71f07bf1-516c-411e-a9dc-4d6942ffee23","year":2021},"citing_paper":{"arxiv_id":"2412.11509","last_updated":"2025-03-14T06:12:38Z","snapshot_observed_at":"2026-08-12T22:35:12.560961Z","submitted_at":"2024-12-16T07:33:23Z","title":"Skip Tuning: Pre-trained Vision-Language Models are Effective and Efficient Adapters Themselves","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T14:55:40.978466Z"},"links":{"citing_paper":"/paper/2412.11509"},"observation_digest":"sha256:c2369c01010d44056e011c6bb5732fb8bc29f0a0f2fb097e802902008733d19e","observation_id":"f9433952-39a0-483a-939d-ae6e48940013","resolution":{"observed_at":"2026-08-11T14:55:41.451261Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:55:41.431162Z","title":"Denseclip: Language-guided dense prediction with context- aware prompting","venue":null,"work_id":"a7c6f394-17b2-405d-a522-d6b308e480e7","year":2022},"citing_paper":{"arxiv_id":"2412.11509","last_updated":"2025-03-14T06:12:38Z","snapshot_observed_at":"2026-08-12T22:35:12.560961Z","submitted_at":"2024-12-16T07:33:23Z","title":"Skip Tuning: Pre-trained Vision-Language Models are Effective and Efficient Adapters Themselves","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T14:55:40.982944Z"},"links":{"citing_paper":"/paper/2412.11509"},"observation_digest":"sha256:9ab3bc39c874ac39bf6401ad3e7c21e0c46856e592a3d60b9f00fa0d7c70bfaf","observation_id":"6c0aa5d0-9c55-4141-a48f-25ba5ede9a99","resolution":{"observed_at":"2026-08-11T14:55:41.436276Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:55:40.987519Z","title":"Do imagenet classifiers generalize to im- agenet? In International conference on machine learning , pages 5389–5400","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.11509","last_updated":"2025-03-14T06:12:38Z","snapshot_observed_at":"2026-08-12T22:35:12.560961Z","submitted_at":"2024-12-16T07:33:23Z","title":"Skip Tuning: Pre-trained Vision-Language Models are Effective and Efficient Adapters Themselves","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T14:55:40.987519Z"},"links":{"citing_paper":"/paper/2412.11509"},"observation_digest":"sha256:df5b5dc2128cef80e3b31231b3a703cb463755c28f66f239cd5ce512b7ad296a","observation_id":"28f4a049-da1a-453c-be0c-ac38c72a895e","resolution":{"observed_at":"2026-08-11T14:55:40.987519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.01195","last_updated":"2024-08-03T18:48:43Z","snapshot_observed_at":"2026-08-13T11:26:47.468439Z","submitted_at":"2023-06-01T23:20:47Z","title":"Consistency-guided Prompt Learning for Vision-Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.01195","snapshot_observed_at":"2026-08-11T14:55:40.992129Z","title":"Consistency-guided prompt learning for vision-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11509","last_updated":"2025-03-14T06:12:38Z","snapshot_observed_at":"2026-08-12T22:35:12.560961Z","submitted_at":"2024-12-16T07:33:23Z","title":"Skip Tuning: Pre-trained Vision-Language Models are Effective and Efficient Adapters Themselves","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T14:55:40.992129Z"},"links":{"cited_paper":"/paper/2306.01195","citing_paper":"/paper/2412.11509"},"observation_digest":"sha256:03f55507f5d7d1f9180ee3d811f6b703ad1815d607d9aff63b414e2eea688111","observation_id":"9f46c994-a1c0-4747-b71a-05dc7bd05873","resolution":{"observed_at":"2026-08-11T14:55:40.992129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1212.0402","last_updated":"2012-12-03T14:45:31Z","snapshot_observed_at":"2026-08-12T17:34:19.526460Z","submitted_at":"2012-12-03T14:45:31Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1212.0402","snapshot_observed_at":"2026-08-11T14:55:40.997354Z","title":"Ucf101: A dataset of 101 human actions classes from videos in the wild","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2412.11509","last_updated":"2025-03-14T06:12:38Z","snapshot_observed_at":"2026-08-12T22:35:12.560961Z","submitted_at":"2024-12-16T07:33:23Z","title":"Skip Tuning: Pre-trained Vision-Language Models are Effective and Efficient Adapters Themselves","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T14:55:40.997354Z"},"links":{"cited_paper":"/paper/1212.0402","citing_paper":"/paper/2412.11509"},"observation_digest":"sha256:f3d1bdb6b8f1fd3fd733a908289b0fd846009ea22e0ce005d52b0047fc0ca23f","observation_id":"17a0e2ac-bd65-4368-9a73-64d9dbf85c5b","resolution":{"observed_at":"2026-08-11T14:55:40.997354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-11T14:55:41.002297Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11509","last_updated":"2025-03-14T06:12:38Z","snapshot_observed_at":"2026-08-12T22:35:12.560961Z","submitted_at":"2024-12-16T07:33:23Z","title":"Skip Tuning: Pre-trained Vision-Language Models are Effective and Efficient Adapters Themselves","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T14:55:41.002297Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2412.11509"},"observation_digest":"sha256:8d20f5bc436f889fde0db436c4fb2bcdd34d97229cbe87aee5cdcdd7aac2ed46","observation_id":"ee3d80c4-0f9e-4a51-a8e6-01f409d394a0","resolution":{"observed_at":"2026-08-11T14:55:41.002297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:55:41.006861Z","title":"Learning robust global representations by penalizing local predictive power.Advances in Neural Information Pro- cessing Systems, 32, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.11509","last_updated":"2025-03-14T06:12:38Z","snapshot_observed_at":"2026-08-12T22:35:12.560961Z","submitted_at":"2024-12-16T07:33:23Z","title":"Skip Tuning: Pre-trained Vision-Language Models are Effective and Efficient Adapters Themselves","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T14:55:41.006861Z"},"links":{"citing_paper":"/paper/2412.11509"},"observation_digest":"sha256:a7228a1a430c3d485875afae48d7d19cc88c95b6a313055290f3c66a452dac3c","observation_id":"feb61d8c-569c-4f08-9f2d-99e32086f4db","resolution":{"observed_at":"2026-08-11T14:55:41.006861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:55:41.011614Z","title":"Sun database: Large-scale scene recognition from abbey to zoo","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2412.11509","last_updated":"2025-03-14T06:12:38Z","snapshot_observed_at":"2026-08-12T22:35:12.560961Z","submitted_at":"2024-12-16T07:33:23Z","title":"Skip Tuning: Pre-trained Vision-Language Models are Effective and Efficient Adapters Themselves","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T14:55:41.011614Z"},"links":{"citing_paper":"/paper/2412.11509"},"observation_digest":"sha256:c8dcbcdfecb9a96f553b9bc6bef65eccf68ba6d2b3accbd77a8e6920781e1e1a","observation_id":"edecc4d4-a53d-48d8-9f9a-c9565a98389d","resolution":{"observed_at":"2026-08-11T14:55:41.011614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:55:41.016126Z","title":"Visual- language prompt tuning with knowledge-guided context op- timization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.11509","last_updated":"2025-03-14T06:12:38Z","snapshot_observed_at":"2026-08-12T22:35:12.560961Z","submitted_at":"2024-12-16T07:33:23Z","title":"Skip Tuning: Pre-trained Vision-Language Models are Effective and Efficient Adapters Themselves","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T14:55:41.016126Z"},"links":{"citing_paper":"/paper/2412.11509"},"observation_digest":"sha256:48356bec1a30a59dd2142e237a19bea95f98f3ac6de7e785f589939b3f1e5a84","observation_id":"12187ccf-abcf-4ef3-80e2-21c2c2f10cac","resolution":{"observed_at":"2026-08-11T14:55:41.016126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:55:41.377893Z","title":"Tcp: Textual- based class-aware prompt tuning for visual-language model","venue":null,"work_id":"d5bc4e35-43a3-487f-aca9-d10a97a55d67","year":2024},"citing_paper":{"arxiv_id":"2412.11509","last_updated":"2025-03-14T06:12:38Z","snapshot_observed_at":"2026-08-12T22:35:12.560961Z","submitted_at":"2024-12-16T07:33:23Z","title":"Skip Tuning: Pre-trained Vision-Language Models are Effective and Efficient Adapters Themselves","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T14:55:41.021112Z"},"links":{"citing_paper":"/paper/2412.11509"},"observation_digest":"sha256:535ce9fdf9105cdd543d6174a3008a03525bf912c3b50492270a58d91f67de93","observation_id":"4650617c-a3aa-4a58-ab49-1c8bd2c5f95b","resolution":{"observed_at":"2026-08-11T14:55:41.383096Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.07783","last_updated":"2021-11-09T17:15:38Z","snapshot_observed_at":"2026-08-13T15:16:57.345726Z","submitted_at":"2021-11-09T17:15:38Z","title":"FILIP: Fine-grained Interactive Language-Image Pre-Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.07783","snapshot_observed_at":"2026-08-11T14:55:41.025736Z","title":"Filip: Fine-grained interactive language-image pre-training","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.11509","last_updated":"2025-03-14T06:12:38Z","snapshot_observed_at":"2026-08-12T22:35:12.560961Z","submitted_at":"2024-12-16T07:33:23Z","title":"Skip Tuning: Pre-trained Vision-Language Models are Effective and Efficient Adapters Themselves","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T14:55:41.025736Z"},"links":{"cited_paper":"/paper/2111.07783","citing_paper":"/paper/2412.11509"},"observation_digest":"sha256:7585f0265be1463bb2110c72cef94659c573e1273c97aa04a4fff022d5b68c35","observation_id":"2c36153d-63d1-48ad-a815-2d6ffac7da70","resolution":{"observed_at":"2026-08-11T14:55:41.025736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:55:41.362187Z","title":"Open-vocabulary detr with conditional matching","venue":null,"work_id":"93a05673-950a-4012-8421-ee1c96a298e8","year":2022},"citing_paper":{"arxiv_id":"2412.11509","last_updated":"2025-03-14T06:12:38Z","snapshot_observed_at":"2026-08-12T22:35:12.560961Z","submitted_at":"2024-12-16T07:33:23Z","title":"Skip Tuning: Pre-trained Vision-Language Models are Effective and Efficient Adapters Themselves","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T14:55:41.030573Z"},"links":{"citing_paper":"/paper/2412.11509"},"observation_digest":"sha256:296ad1837b4d697e467139f57b14e45560483a6427a50f408fa712ac9d6fbf2a","observation_id":"4ac206f5-5e74-47ed-b819-89b882264cb8","resolution":{"observed_at":"2026-08-11T14:55:41.366888Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:55:41.346863Z","title":"Lit: Zero-shot transfer with locked-image text tuning","venue":null,"work_id":"b50002f1-564e-46e9-8a1e-2afd421055b1","year":2022},"citing_paper":{"arxiv_id":"2412.11509","last_updated":"2025-03-14T06:12:38Z","snapshot_observed_at":"2026-08-12T22:35:12.560961Z","submitted_at":"2024-12-16T07:33:23Z","title":"Skip Tuning: Pre-trained Vision-Language Models are Effective and Efficient Adapters Themselves","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T14:55:41.035892Z"},"links":{"citing_paper":"/paper/2412.11509"},"observation_digest":"sha256:c72736cd1e084b53d91a3da500fcb24ae345b173fbf2c510bd01b2a6bc4df1fa","observation_id":"e7e505bc-1423-44f1-8ed7-7dde50754993","resolution":{"observed_at":"2026-08-11T14:55:41.351706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:55:41.331021Z","title":"Free-lunch for cross-domain few-shot learning: Style-aware episodic training with robust contrastive learning","venue":null,"work_id":"40b2e8d7-1cdc-48cb-9c4a-4b3f1451b90c","year":2022},"citing_paper":{"arxiv_id":"2412.11509","last_updated":"2025-03-14T06:12:38Z","snapshot_observed_at":"2026-08-12T22:35:12.560961Z","submitted_at":"2024-12-16T07:33:23Z","title":"Skip Tuning: Pre-trained Vision-Language Models are Effective and Efficient Adapters Themselves","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T14:55:41.040584Z"},"links":{"citing_paper":"/paper/2412.11509"},"observation_digest":"sha256:dab013ed1db6b1f1bd0acc6ae8c23c4de44bb50f12dad60cef586b3a60093078","observation_id":"346028ab-2921-4926-8abb-299c6892f5be","resolution":{"observed_at":"2026-08-11T14:55:41.336546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:55:41.315588Z","title":"Deta: Denoised task adaptation for few-shot learning","venue":null,"work_id":"199321b5-24e1-4de1-927c-2eb27e714aac","year":2023},"citing_paper":{"arxiv_id":"2412.11509","last_updated":"2025-03-14T06:12:38Z","snapshot_observed_at":"2026-08-12T22:35:12.560961Z","submitted_at":"2024-12-16T07:33:23Z","title":"Skip Tuning: Pre-trained Vision-Language Models are Effective and Efficient Adapters Themselves","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T14:55:41.045210Z"},"links":{"citing_paper":"/paper/2412.11509"},"observation_digest":"sha256:2d455bae4c250406447e17d945fa3f4761c49f6374efee870d718d2246e6c7ea","observation_id":"6f45b139-4843-4ac7-82ec-1c8c5d73f536","resolution":{"observed_at":"2026-08-11T14:55:41.320563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:55:41.300023Z","title":"Dept: Decoupled prompt tuning","venue":null,"work_id":"f87d0336-dd68-4f9f-9177-a683ffd210f6","year":2024},"citing_paper":{"arxiv_id":"2412.11509","last_updated":"2025-03-14T06:12:38Z","snapshot_observed_at":"2026-08-12T22:35:12.560961Z","submitted_at":"2024-12-16T07:33:23Z","title":"Skip Tuning: Pre-trained Vision-Language Models are Effective and Efficient Adapters Themselves","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T14:55:41.049780Z"},"links":{"citing_paper":"/paper/2412.11509"},"observation_digest":"sha256:68ad1d4670426e8402f6172945c0deea01ca342b5e9fe02cdbedaeec987de1bd","observation_id":"d4ed0a32-f3a7-4109-9317-d6e362a5639b","resolution":{"observed_at":"2026-08-11T14:55:41.304739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.03930","last_updated":"2021-11-15T04:58:28Z","snapshot_observed_at":"2026-07-31T03:05:21.352948Z","submitted_at":"2021-11-06T18:09:22Z","title":"Tip-Adapter: Training-free CLIP-Adapter for Better Vision-Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.03930","snapshot_observed_at":"2026-08-11T14:55:41.054173Z","title":"Tip-adapter: Training-free clip-adapter for better vision- language modeling","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.11509","last_updated":"2025-03-14T06:12:38Z","snapshot_observed_at":"2026-08-12T22:35:12.560961Z","submitted_at":"2024-12-16T07:33:23Z","title":"Skip Tuning: Pre-trained Vision-Language Models are Effective and Efficient Adapters Themselves","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T14:55:41.054173Z"},"links":{"cited_paper":"/paper/2111.03930","citing_paper":"/paper/2412.11509"},"observation_digest":"sha256:fb24ebda1a80285c439a000877582012c4fb02e732920bfb32bc9aa8425ddaeb","observation_id":"4ca619a2-5012-4f47-8b5e-409ad5fb1973","resolution":{"observed_at":"2026-08-11T14:55:41.054173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:55:41.059049Z","title":"Conditional prompt learning for vision-language mod- els","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.11509","last_updated":"2025-03-14T06:12:38Z","snapshot_observed_at":"2026-08-12T22:35:12.560961Z","submitted_at":"2024-12-16T07:33:23Z","title":"Skip Tuning: Pre-trained Vision-Language Models are Effective and Efficient Adapters Themselves","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T14:55:41.059049Z"},"links":{"citing_paper":"/paper/2412.11509"},"observation_digest":"sha256:08067abc0ce75b4869b51b645263b49336d99e8eb056170734848e1fab5a3146","observation_id":"9e95b12f-2456-4299-8e55-fea5e2a463ae","resolution":{"observed_at":"2026-08-11T14:55:41.059049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:55:41.064119Z","title":"Learning to prompt for vision-language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.11509","last_updated":"2025-03-14T06:12:38Z","snapshot_observed_at":"2026-08-12T22:35:12.560961Z","submitted_at":"2024-12-16T07:33:23Z","title":"Skip Tuning: Pre-trained Vision-Language Models are Effective and Efficient Adapters Themselves","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T14:55:41.064119Z"},"links":{"citing_paper":"/paper/2412.11509"},"observation_digest":"sha256:9ac2498580ba4bf275dcb8deecf1847cbaab0968521d8024d011e199d41c6349","observation_id":"479f12e9-6d32-4f0b-8675-7875d882cb47","resolution":{"observed_at":"2026-08-11T14:55:41.064119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:55:41.264339Z","title":"Detecting twenty-thousand classes using image-level supervision","venue":null,"work_id":"98763beb-5046-4aee-88d7-5d308c842854","year":2022},"citing_paper":{"arxiv_id":"2412.11509","last_updated":"2025-03-14T06:12:38Z","snapshot_observed_at":"2026-08-12T22:35:12.560961Z","submitted_at":"2024-12-16T07:33:23Z","title":"Skip Tuning: Pre-trained Vision-Language Models are Effective and Efficient Adapters Themselves","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T14:55:41.069003Z"},"links":{"citing_paper":"/paper/2412.11509"},"observation_digest":"sha256:ecb3950b0a429b96bd05d3017a9891fa4ebf15b97ed7f1317cc1312d0210342f","observation_id":"c14771ea-0ddb-4fb0-9f07-08ce44532234","resolution":{"observed_at":"2026-08-11T14:55:41.269575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:55:41.246741Z","title":"Prompt-aligned gradient for prompt tuning","venue":null,"work_id":"d8970d9e-c989-48db-925e-b772eb3eabd5","year":2023},"citing_paper":{"arxiv_id":"2412.11509","last_updated":"2025-03-14T06:12:38Z","snapshot_observed_at":"2026-08-12T22:35:12.560961Z","submitted_at":"2024-12-16T07:33:23Z","title":"Skip Tuning: Pre-trained Vision-Language Models are Effective and Efficient Adapters Themselves","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T14:55:41.073787Z"},"links":{"citing_paper":"/paper/2412.11509"},"observation_digest":"sha256:d49836db9eb6640dc7a67e9f82eb4a134f352899cb2f109069e94fbae7aa491b","observation_id":"03474990-154b-415d-90fd-87ffdc0dd1b6","resolution":{"observed_at":"2026-08-11T14:55:41.253467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.11509","last_updated":"2025-03-14T06:12:38Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T22:35:12.560961Z","submitted_at":"2024-12-16T07:33:23Z","title":"Skip Tuning: Pre-trained Vision-Language Models are Effective and Efficient Adapters Themselves"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":0,"verified_fuzzy":19},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 1 inbound Pith citation observation for arXiv:2412.11509."}