{"as_of":"2026-08-08T12:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:12e86af99c09f2a6ce19d97145818769c24d969a9bf03611ecf6b2ab5742bcce","coverage":[{"denominator":93,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":93,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:43:59.305859Z","state":"measured"},{"denominator":93,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":93,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.23694/citation-record","integrity":"/paper/2505.23694/integrity","json":"/paper/2505.23694/citation-record.json","paper":"/paper/2505.23694"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1612.03801","last_updated":"2016-12-13T12:19:48Z","snapshot_observed_at":"2026-07-06T05:22:21.129782Z","submitted_at":"2016-12-12T17:32:49Z","title":"DeepMind Lab","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1612.03801","snapshot_observed_at":"2026-08-07T12:43:53.243230Z","title":"Deepmind lab","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-07T12:37:25.617891Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:53.243230Z"},"links":{"cited_paper":"/paper/1612.03801","citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:6b19aff1e7ea9224797a988523a46088ce468a266df136ec9be609d970a3eab2","observation_id":"677721b7-0231-4b2d-a17d-2abc1e478198","resolution":{"observed_at":"2026-08-07T12:43:53.243230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:53.354463Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-07T12:37:25.617891Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:53.354463Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:fba568bb6e06459292e462e86d7cd2aac328a7deb58c7246301b701db7e4b23f","observation_id":"aba3a180-d93f-47a1-9ec9-a81c3d7599b9","resolution":{"observed_at":"2026-08-07T12:43:53.354463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07967","last_updated":"2023-10-16T15:52:20Z","snapshot_observed_at":"2026-07-06T15:42:10.592303Z","submitted_at":"2023-06-13T17:59:32Z","title":"One-for-All: Generalized LoRA for Parameter-Efficient Fine-tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07967","snapshot_observed_at":"2026-08-07T12:43:53.447915Z","title":"One-for-all: Generalized lora for parameter- efficient fine-tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-07T12:37:25.617891Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:53.447915Z"},"links":{"cited_paper":"/paper/2306.07967","citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:2f1832c3c5673cb0f8ba195a8c845a35b320ce5b68506645ccd4ec55d3b93251","observation_id":"5b16eae0-3f85-4de5-b389-b9d959349518","resolution":{"observed_at":"2026-08-07T12:43:53.447915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:53.496800Z","title":"Adaptformer: Adapting vision transformers for scalable visual recognition","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-07T12:37:25.617891Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:53.496800Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:bfb5d030c551f19eb84d97c3171051b3a41cac39483c307ed2025413b9170cc9","observation_id":"1f7c3ce4-9231-4410-bda4-dfb1316dc0f7","resolution":{"observed_at":"2026-08-07T12:43:53.496800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:53.555873Z","title":"An empiri- cal study of training self-supervised vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-07T12:37:25.617891Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:53.555873Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:90f5aa3b613cabd23956290a933d450d58c7539b9e198156ba8321806c065464","observation_id":"9101cb3d-2e76-4184-813e-e2dd98ed3b5e","resolution":{"observed_at":"2026-08-07T12:43:53.555873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:53.650122Z","title":"Person re-identification by multi-channel parts-based cnn with improved triplet loss function","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-07T12:37:25.617891Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:53.650122Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:ef53e93be0c3f829a883babee1a2f353007a47d1c6eff6ee1824da23229b85a5","observation_id":"55393677-eef1-44cf-91f5-77fef663ab60","resolution":{"observed_at":"2026-08-07T12:43:53.650122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:53.693115Z","title":"Remote sensing image scene classification: Benchmark and state of the art","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-07T12:37:25.617891Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:53.693115Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:bcf4a4e5c378f1065c1b210d148679b691346cf0b4ca44f6cdb3561f53ff19b4","observation_id":"38fed550-e6dd-4a28-8f3d-1d513f94dd84","resolution":{"observed_at":"2026-08-07T12:43:53.693115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:53.720239Z","title":"Learning a similarity metric discriminatively, with application to face verification","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-07T12:37:25.617891Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:53.720239Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:193b498191c2c72cc62dc0ceca27e7c622f205517d1b91aac191b65a9437c697","observation_id":"d38f0733-6bb2-4b21-b284-d502b3f9809a","resolution":{"observed_at":"2026-08-07T12:43:53.720239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:53.746741Z","title":"Describing textures in the wild","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-07T12:37:25.617891Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:53.746741Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:bed48aee906176aedd75b2575ac14c9862c41678721df90258c99c22e9f87cd5","observation_id":"01464c45-02f8-4daa-a081-c3463431fa40","resolution":{"observed_at":"2026-08-07T12:43:53.746741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16362","last_updated":"2021-05-20T14:48:30Z","snapshot_observed_at":"2026-08-05T17:26:35.093147Z","submitted_at":"2020-06-29T20:28:52Z","title":"Multi-Head Attention: Collaborate Instead of Concatenate","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.16362","snapshot_observed_at":"2026-08-07T12:43:53.773851Z","title":"Multi-head attention: Collaborate instead of concatenate","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-07T12:37:25.617891Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:53.773851Z"},"links":{"cited_paper":"/paper/2006.16362","citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:d9b7a874f30f8b377d37787fb093520a5cb15ea0777349f5742af585005ca74e","observation_id":"bfb516be-3d0d-46e4-ad9f-a67f2da0f139","resolution":{"observed_at":"2026-08-07T12:43:53.773851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:53.849916Z","title":"Vision transformers need registers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-07T12:37:25.617891Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:53.849916Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:daa5df88c46f4929c2de08888785d2cf687a5de45c6e05688caa9528538b43ae","observation_id":"f6e9cff6-7c0f-4680-9a3b-d68047f984aa","resolution":{"observed_at":"2026-08-07T12:43:53.849916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:53.933032Z","title":"Scaling vision transformers to 22 billion pa- rameters","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-07T12:37:25.617891Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:53.933032Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:8a9f00307e5546379e3d59bf05e261a7d31f9dac18fb1c6482ba9d5395c5c511","observation_id":"4ca9728c-5bd6-4971-a7c8-89cf203d7b4b","resolution":{"observed_at":"2026-08-07T12:43:53.933032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:54.005721Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-07T12:37:25.617891Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:54.005721Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:1259d75a0c22ff6b95b27dd35cb7742bcc7b5037711f5ecdb2245ca3241669ce","observation_id":"c90eedad-4459-445e-8d37-d015af179ace","resolution":{"observed_at":"2026-08-07T12:43:54.005721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-07T12:43:54.117861Z","title":"An image is worth 16x16 words: Trans- formers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-07T12:37:25.617891Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:54.117861Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:511a00ac98a5d4c5dbd57e6f5b4fa6a890a06beb9a21135f7283e861d9722aa1","observation_id":"6bbfe65f-800c-4823-be42-26f0dc4a3a02","resolution":{"observed_at":"2026-08-07T12:43:54.117861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:54.227208Z","title":"Diabetic retinopathy detection, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-07T12:37:25.617891Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:54.227208Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:9fea76dbc0c8b9a9e6befbdb609b346fd332462f239348f6a10c19b4d4275e40","observation_id":"a90df567-ae71-49c8-8718-f87a7d02dccc","resolution":{"observed_at":"2026-08-07T12:43:54.227208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:54.465274Z","title":"Hyperbolic vision transform- ers: Combining improvements in metric learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-07T12:37:25.617891Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:54.465274Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:33233ce8c0a2d572c9aad1e076e7e9996a7dd42ec683c3372da621ad033e397f","observation_id":"f44c77ca-ec96-40d6-b631-60804d4c8e1e","resolution":{"observed_at":"2026-08-07T12:43:54.465274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:54.643366Z","title":"One-shot learn- ing of object categories","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-07T12:37:25.617891Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:54.643366Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:326e79a43adf3347c342d0d1d3079e8072d801a020317edfa46e5230a1005495","observation_id":"bdf2baef-c4b4-4e98-aac1-73ed51acda74","resolution":{"observed_at":"2026-08-07T12:43:54.643366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:10.445959Z","title":"Compositional prompt tuning with motion cues for open-vocabulary video relation detection","venue":null,"work_id":"e35bc29a-7eda-4eb9-b4fc-6c2cb9eaf528","year":2023},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-07T12:37:25.617891Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:54.841027Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:7f7bbe496576eb37fb72e71bfdf880d0e042a7feeb15c28101227a016158a360","observation_id":"e2fa0ccb-83e0-441e-869b-7f84b3b6db64","resolution":{"observed_at":"2026-08-07T12:44:10.553202Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:10.107244Z","title":"Tuning pre-trained model via moment probing","venue":null,"work_id":"5a398b5f-432b-47bf-b3e6-fadf4d556a45","year":2023},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-07T12:37:25.617891Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:55.032302Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:0b0513d7f3b4637e52c38181c55e3f505fbbef624f2e363b9b400417ffbfc48a","observation_id":"c7613d4e-f0a6-43ea-8c2b-140b3af03e98","resolution":{"observed_at":"2026-08-07T12:44:10.238548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.04831","last_updated":"2022-11-30T19:22:22Z","snapshot_observed_at":"2026-08-04T13:02:31.952282Z","submitted_at":"2022-10-10T16:45:13Z","title":"Visual Prompt Tuning for Test-time Domain Adaptation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.04831","snapshot_observed_at":"2026-08-07T12:43:55.097072Z","title":"Vi- sual prompt tuning for test-time domain adaptation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-07T12:37:25.617891Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:55.097072Z"},"links":{"cited_paper":"/paper/2210.04831","citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:2603823214808eeb66fb9d33779f59008a3b256de343548a9995e2bbcc4d99f3","observation_id":"860ad188-954c-49d5-8fca-2bc260b339fd","resolution":{"observed_at":"2026-08-07T12:43:55.097072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:09.759460Z","title":"Fine-grained car detection for visual census estimation","venue":null,"work_id":"d5a09ce8-7fc3-4f41-954c-b35e382b81d2","year":2017},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-07T12:37:25.617891Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:55.153690Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:fbfd9722f00e0bfd7828175703fcd2c974fad3654e4a1c119e56d2d5df41a924","observation_id":"3b436858-e9b8-4d65-aa87-96054e12f293","resolution":{"observed_at":"2026-08-07T12:44:09.940305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:09.643839Z","title":"Vision meets robotics: The kitti dataset","venue":null,"work_id":"b9fa955b-052f-4052-a3d6-bd7ba10ecb9a","year":null},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-07T12:37:25.617891Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:55.197595Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:d3928d141b1abffc9972b7b506ad83855687236d8491a7a919dfc04a7b0a84b8","observation_id":"a55a0541-7aa2-44c9-8f3e-0aa5a2929e66","resolution":{"observed_at":"2026-08-07T12:44:09.687778Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:09.579172Z","title":"Dimension- ality reduction by learning an invariant mapping","venue":null,"work_id":"d3a42aca-e524-4d17-a221-e6d096d83a78","year":2006},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-07T12:37:25.617891Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:55.232085Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:491a84750084b138b9443e5fa982fb978902add36a0a126fee6650cc6f2f76a7","observation_id":"e12a67d2-b294-4f1a-86cb-7d86ba1dcbbd","resolution":{"observed_at":"2026-08-07T12:44:09.604559Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.13770","last_updated":"2023-07-25T19:03:21Z","snapshot_observed_at":"2026-07-06T15:58:31.756298Z","submitted_at":"2023-07-25T19:03:21Z","title":"E^2VPT: An Effective and Efficient Approach for Visual Prompt Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.13770","snapshot_observed_at":"2026-08-07T12:43:55.265616Z","title":"Eˆ 2vpt: An effec- tive and efficient approach for visual prompt tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-07T12:37:25.617891Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:55.265616Z"},"links":{"cited_paper":"/paper/2307.13770","citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:2b0ce0949ad4e883b679d0f212373718b444d5c06b45e36b7c4fb4fcde63110a","observation_id":"77a4a302-746c-4f4a-b635-0e337b623cec","resolution":{"observed_at":"2026-08-07T12:43:55.265616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:09.243116Z","title":"Sensitivity-aware visual parameter-efficient fine- tuning","venue":null,"work_id":"9f5ab056-854e-4972-b1a9-367774ca3090","year":2023},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-07T12:37:25.617891Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:55.330859Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:297dbd321c92c88c26c3de5b2ce161c7d047710089ce9b7c2943ef0eaa878aba","observation_id":"0d863e50-386c-45ad-8be9-1ec35774e043","resolution":{"observed_at":"2026-08-07T12:44:09.444254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:09.137297Z","title":"Momentum contrast for unsupervised visual repre- sentation learning","venue":null,"work_id":"b16855cd-45f8-486d-9a05-f5e33b1f039d","year":2020},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-07T12:37:25.617891Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:55.458686Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:43da89376291ee5038ac8fd2acb7e106fb840254a2e1f5bc4cf6074ba4db1775","observation_id":"b48e7034-f3e5-4563-b719-2334906f7148","resolution":{"observed_at":"2026-08-07T12:44:09.148989Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:08.936144Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":"8bcdb9ea-905b-4c18-a2de-ca2a0f3f50da","year":2022},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-07T12:37:25.617891Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:55.601452Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:8a692b247a99bba9a0a2451d0279e108e5dc22313efb9d84714a7f19470e9981","observation_id":"21759ce3-9d1f-4acc-b2d7-95ca9c39af52","resolution":{"observed_at":"2026-08-07T12:44:09.050087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:08.744172Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":"afcc38cb-7728-4b63-aec8-0973515cf587","year":2022},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-07T12:37:25.617891Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:55.724042Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:f7d4d3e28b57706074463a5ab5eaa418cfe0547f0715bff49cffbe64ee1c8736","observation_id":"0e816183-ed07-4c8d-85a9-64742e0f8b09","resolution":{"observed_at":"2026-08-07T12:44:08.814671Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:08.536247Z","title":"Eurosat: A novel dataset and deep learning benchmark for land use and land cover classification","venue":null,"work_id":"55c7bcb5-f63d-4663-a6f7-03a9355e3d87","year":2019},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-07T12:37:25.617891Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:55.877820Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:214629fafb79fcfacf40a8bfdde0e07e8fb52d6f98d06836c35eff95ed614fa3","observation_id":"b977ee6b-06f6-4073-882e-9886bfd1031d","resolution":{"observed_at":"2026-08-07T12:44:08.641837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1703.07737","last_updated":"2017-11-21T15:35:07Z","snapshot_observed_at":"2026-08-04T09:19:45.912586Z","submitted_at":"2017-03-22T16:34:29Z","title":"In Defense of the Triplet Loss for Person Re-Identification","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1703.07737","snapshot_observed_at":"2026-08-07T12:43:55.983473Z","title":"In defense of the triplet loss for person re-identification","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-07T12:37:25.617891Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:55.983473Z"},"links":{"cited_paper":"/paper/1703.07737","citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:51f94a7cb52fb743a266227f208423ac556d0ee920ebaefb8630617aa61404cd","observation_id":"a1cf976c-002a-4184-b844-dba8d49839a2","resolution":{"observed_at":"2026-08-07T12:43:55.983473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:08.380731Z","title":"Parameter-efficient transfer learning for nlp","venue":null,"work_id":"8cc02338-7f56-4d67-8387-9d2c6d6a9623","year":2019},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-07T12:37:25.617891Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:56.095416Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:8fd4aa433a836a3a157b7925d1add6139167c3fe4e60560225708e93f20199b4","observation_id":"560b98a4-436c-4765-9d16-308fd35a0479","resolution":{"observed_at":"2026-08-07T12:44:08.446640Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-07T12:43:56.160452Z","title":"Lora: Low-rank adaptation of large language models.arXiv preprint arXiv:2106.09685, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-07T12:37:25.617891Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:56.160452Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:650fa8a954385826e7f50207c2d50901ea9613bd3e62ce50f8b594203824ef40","observation_id":"2872f899-0a69-4ade-8716-682d8e621b8d","resolution":{"observed_at":"2026-08-07T12:43:56.160452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:08.178782Z","title":"Visual prompt tuning","venue":null,"work_id":"223b2028-02d4-4aca-bb7e-645b98baa2ef","year":2022},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-07T12:37:25.617891Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:56.239481Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:34c885e056141239487e3f33a031472bdcc1603f5b72145df91215289a4d45fd","observation_id":"c28fb6db-b620-46d1-8d34-05dffb05625d","resolution":{"observed_at":"2026-08-07T12:44:08.274239Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:07.997326Z","title":"Clevr: A diagnostic dataset for compositional language and elementary visual reasoning","venue":null,"work_id":"58ce373a-fb4e-471c-98dd-a840d9f46f85","year":2017},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-07T12:37:25.617891Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:56.305926Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:1dcdb83836061394d5cf5b0e123e3d914171e82484772587576c343f2c90cdad","observation_id":"98a688f4-09c0-463a-a810-a8c9ea480bcb","resolution":{"observed_at":"2026-08-07T12:44:08.092087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:07.837787Z","title":"Novel dataset for fine-grained image cat- egorization: Stanford dogs","venue":null,"work_id":"a637a2b7-ca61-4546-a247-6c1a141626ba","year":2011},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-07T12:37:25.617891Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:56.340283Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:bf01842bd333e543baa12325c83c06b8769234eb9244354172d830585a58de76","observation_id":"1df2de5d-40d4-4e26-ad80-7eedeef21e08","resolution":{"observed_at":"2026-08-07T12:44:07.914276Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:07.683913Z","title":"Proxy anchor loss for deep metric learning","venue":null,"work_id":"9af21371-546d-4883-a4a7-e522f3849e10","year":2020},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-07T12:37:25.617891Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:56.372914Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:0bc2042f349f8af785e31cbbbb0c5368c1c1f0a66a83f867a7f83df538998778","observation_id":"fa9c95c4-a588-4818-9234-1754c5517054","resolution":{"observed_at":"2026-08-07T12:44:07.748700Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:07.525496Z","title":"Segment any- thing","venue":null,"work_id":"58311b61-e24c-45ab-af33-6a41c0a517f7","year":2023},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-07T12:37:25.617891Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:56.411533Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:64703df6c1d8fb5d828f49212dc7ce586b734d5896941ed935113a19762377bc","observation_id":"3d871d69-f182-4ea7-a7f1-83cc138b3ab0","resolution":{"observed_at":"2026-08-07T12:44:07.595671Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:07.407863Z","title":"Do better imagenet models transfer better? In CVPR, pages 2661–2671,","venue":null,"work_id":"4abf98af-fdcb-469d-a75f-147cd41641bb","year":null},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-07T12:37:25.617891Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:56.446524Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:2375f77b0817d6afbbdae0e17bc04ad16ca40ddf6e4f28ee4c76220c35149b36","observation_id":"45bc8ba1-88f6-4371-83c0-613f625a3b2f","resolution":{"observed_at":"2026-08-07T12:44:07.464445Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:07.264033Z","title":"Cross-image-attention for conditional embeddings in deep metric learning","venue":null,"work_id":"8cce1d8e-d9a4-4f28-9cee-f6e07485e9e5","year":2023},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-07T12:37:25.617891Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:56.478169Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:b400edbf27e50d09669ea8854b22c76aa7f9f31dd59f64190b964eda0f28d6c1","observation_id":"81d218bf-06ed-45c5-b984-2e6a919a41a4","resolution":{"observed_at":"2026-08-07T12:44:07.346793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:56.515803Z","title":"Learning multiple layers of features from tiny images","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-07T12:37:25.617891Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:56.515803Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:56ffdc76f38048c39bb82e624224eb927d76bbec6d586777780e3b860009ecf9","observation_id":"f56611e8-5d4e-443d-a5cc-3975ab908f6c","resolution":{"observed_at":"2026-08-07T12:43:56.515803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:07.058514Z","title":"M-adda: Unsuper- vised domain adaptation with deep metric learning","venue":null,"work_id":"9268fd09-0433-4b5a-9b3a-e1870d0200eb","year":2020},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-07T12:37:25.617891Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:56.546889Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:0845534feb47ba63e98b13cf6001be62240bc01da9865f55cacdc07eac42be4d","observation_id":"f891f798-fecc-421b-b1d7-d0f7cba37879","resolution":{"observed_at":"2026-08-07T12:44:07.150161Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:06.890669Z","title":"Learning methods for generic object recognition with invariance to pose and lighting","venue":null,"work_id":"5c5c0289-0c73-43aa-8e4e-707b5c77c4a5","year":2004},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-07T12:37:25.617891Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:56.599382Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:f2af5addd338f74ace35e8ee08263bde9420bdbd2f74f34291036df2ab5f1e99","observation_id":"5accebdf-bc18-481b-b06c-a6615fb4bf6d","resolution":{"observed_at":"2026-08-07T12:44:06.972304Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08691","last_updated":"2021-09-02T17:34:41Z","snapshot_observed_at":"2026-08-06T15:24:34.790850Z","submitted_at":"2021-04-18T03:19:26Z","title":"The Power of Scale for Parameter-Efficient Prompt Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08691","snapshot_observed_at":"2026-08-07T12:43:56.638598Z","title":"The power of scale for parameter-efficient prompt tuning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-07T12:37:25.617891Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:56.638598Z"},"links":{"cited_paper":"/paper/2104.08691","citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:6e9555a82517dd49774cbb20923f7c84950823d83dffae8cf3cb747d0a872df5","observation_id":"94779d85-ddee-4ab5-85b9-3ab3fb1da5b6","resolution":{"observed_at":"2026-08-07T12:43:56.638598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00190","last_updated":"2021-01-01T08:00:36Z","snapshot_observed_at":"2026-07-06T10:29:18.734092Z","submitted_at":"2021-01-01T08:00:36Z","title":"Prefix-Tuning: Optimizing Continuous Prompts for Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00190","snapshot_observed_at":"2026-08-07T12:43:56.691492Z","title":"Prefix-tuning: Optimiz- ing continuous prompts for generation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-07T12:37:25.617891Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:56.691492Z"},"links":{"cited_paper":"/paper/2101.00190","citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:5d80b090d4443743a7828634a3dc3d370860f6e6dbe8bce395faa3b225b905c7","observation_id":"5ed6b904-758c-4590-b9fe-82027cec05b6","resolution":{"observed_at":"2026-08-07T12:43:56.691492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:06.729249Z","title":"Scaling & shifting your features: A new baseline for efficient model tuning","venue":null,"work_id":"2dce7551-5685-4fa9-abff-8e4deb491f14","year":2022},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-07T12:37:25.617891Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:56.733224Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:0a4d8a7265f4f7b5d58875934a2f53af0d7f6e562278f06f04a5932039383679","observation_id":"2aa51a31-b82e-4ee7-8b3c-8c0ca3b93693","resolution":{"observed_at":"2026-08-07T12:44:06.804835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:06.590794Z","title":"Pre-train, prompt, and predict: A systematic survey of prompting methods in natural language processing","venue":null,"work_id":"0f0f04e0-8b94-4885-a510-4ad451ca54f3","year":null},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-07T12:37:25.617891Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:56.773153Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:a1d3eceedabc512d4599e0aed634f06e068476533aea692a93a1095eedd13fa4","observation_id":"3e4c7e2f-463e-4d39-b96d-caa93dc2f92c","resolution":{"observed_at":"2026-08-07T12:44:06.649551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.07602","last_updated":"2022-03-20T15:13:08Z","snapshot_observed_at":"2026-08-08T11:15:37.346201Z","submitted_at":"2021-10-14T17:58:47Z","title":"P-Tuning v2: Prompt Tuning Can Be Comparable to Fine-tuning Universally Across Scales and Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.07602","snapshot_observed_at":"2026-08-07T12:43:56.805456Z","title":"P-tuning v2: Prompt tuning can be comparable to fine-tuning universally across scales and tasks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-07T12:37:25.617891Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:56.805456Z"},"links":{"cited_paper":"/paper/2110.07602","citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:d0f9b7ff69492880c419a52fc463f58d36c40250efa939b32397ae23ed2a224d","observation_id":"59ffbfd6-90e6-462a-ac1c-d60ac9294238","resolution":{"observed_at":"2026-08-07T12:43:56.805456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1608.03983","last_updated":"2017-05-03T16:28:09Z","snapshot_observed_at":"2026-07-06T05:06:55.589962Z","submitted_at":"2016-08-13T13:46:05Z","title":"SGDR: Stochastic Gradient Descent with Warm Restarts","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1608.03983","snapshot_observed_at":"2026-08-07T12:43:56.839516Z","title":"Sgdr: Stochastic gradient descent with warm restarts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-07T12:37:25.617891Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:56.839516Z"},"links":{"cited_paper":"/paper/1608.03983","citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:7895058cf66a1f228204e97da2a9743cc6dd8bc84f00ffedf85b76f8e3dfe0cc","observation_id":"b04d707d-e211-40f1-9299-50d17a0d36fe","resolution":{"observed_at":"2026-08-07T12:43:56.839516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-07T12:43:56.876584Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-07T12:37:25.617891Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:56.876584Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:3a8b3325c92664716ce5a618ccd66929dd8e457017fb52ed8eb357462c986357","observation_id":"5ac4a9f1-e8d3-447b-889e-376cfcb5dc70","resolution":{"observed_at":"2026-08-07T12:43:56.876584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:06.385983Z","title":"Exploring the limits of weakly supervised pretraining","venue":null,"work_id":"46eb717f-5f1a-45bc-8a0b-a6f576089bbe","year":2018},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-07T12:37:25.617891Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:56.921079Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:66f01a908750d772d0cf6063f8f757287b02476726bccac01e554f8d0fa85512","observation_id":"95f17a0e-16bb-45e7-9885-5886444dbbe7","resolution":{"observed_at":"2026-08-07T12:44:06.487771Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:06.221958Z","title":"dsprites: Disentanglement testing sprites dataset,","venue":null,"work_id":"08d0194d-d5da-452c-a1cd-93e0ecb6a72b","year":null},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-07T12:37:25.617891Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:56.986635Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:fdd49f0dfb9c1a4a46e2303972443df3f788a958bf592a81b23328e5392b3dc3","observation_id":"7beb16f4-ca5b-4c08-ab69-95f76d6f4e25","resolution":{"observed_at":"2026-08-07T12:44:06.303365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:06.099418Z","title":"The role of context for object detection and semantic segmentation in the wild","venue":null,"work_id":"da90ae61-779e-4d9e-a189-bf43ed244d65","year":null},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-07T12:37:25.617891Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:57.050977Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:b9c96d0b25edfc7ac4d004fe0f506042e96f07bc69cb435ec71ac1e9571e7e4e","observation_id":"14352b09-ced2-4a7a-824e-0fef3f6720b6","resolution":{"observed_at":"2026-08-07T12:44:06.156880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:05.975366Z","title":"No fuss distance metric learning using proxies","venue":null,"work_id":"d2816b97-3168-423f-b28f-8e306a7dff84","year":2017},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-07T12:37:25.617891Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:57.108039Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:cb70d7921e869d8d46438311cdbd4e71fc43f8cc5edff136cf82b33fc6495870","observation_id":"39208091-70fc-40ca-8fdd-a1ede07b6a38","resolution":{"observed_at":"2026-08-07T12:44:06.027412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:05.834231Z","title":"Reading digits in natural images with unsupervised feature learning","venue":null,"work_id":"08d404ad-406f-44df-9389-4451bb5b52a0","year":2011},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-07T12:37:25.617891Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:57.169398Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:da2a2b6ecc91492a1d497ee1f06c57a8bce923ee8051a29952cc3e1cac9afb84","observation_id":"bb22cf29-5a4f-41c4-9f1a-789e52ec2397","resolution":{"observed_at":"2026-08-07T12:44:05.908203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.01091","last_updated":"2019-08-02T23:30:35Z","snapshot_observed_at":"2026-07-06T08:12:08.245649Z","submitted_at":"2019-08-02T23:30:35Z","title":"Toward Understanding Catastrophic Forgetting in Continual Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.01091","snapshot_observed_at":"2026-08-07T12:43:57.260298Z","title":"Toward under- standing catastrophic forgetting in continual learning","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-07T12:37:25.617891Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:57.260298Z"},"links":{"cited_paper":"/paper/1908.01091","citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:86a9dcf38385e437a020dae03b52d48d845e6738e2e3e5455c6c848cc0f249ca","observation_id":"62ab5cc6-0682-454f-88f7-952e83e54441","resolution":{"observed_at":"2026-08-07T12:43:57.260298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:05.741751Z","title":"A visual vocabulary for flower classification","venue":null,"work_id":"7ab17935-eddc-4759-a886-f9fc190a8b16","year":null},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-07T12:37:25.617891Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:57.353812Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:232ee750dddfd4f6ea3c5b7db89cff931051699f4d92e99f65eca70a748eea53","observation_id":"85d8cfd5-9614-4163-a4df-14ba9c80a046","resolution":{"observed_at":"2026-08-07T12:44:05.785326Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:05.553852Z","title":"Automated flower classification over a large number of classes","venue":null,"work_id":"71105b5c-af10-4592-a7f7-e589ceb1226e","year":2008},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-07T12:37:25.617891Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:57.431854Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:287bc9cac3a6fd0e6cf993eda0138762d692cec16ef6462309bc2d0d5ef586c0","observation_id":"f6063565-0416-49d9-9545-2eb9d3fe613a","resolution":{"observed_at":"2026-08-07T12:44:05.648466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:05.367420Z","title":"Cats and dogs","venue":null,"work_id":"d73eed79-8791-423a-b0ae-ba2755a3daa6","year":2012},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-07T12:37:25.617891Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:57.464661Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:2df8c8ad097fe755e50fed69b7206335d4a32d113cabb875444ea56351256da3","observation_id":"3b3802c3-5e01-435e-ba75-31ec905dc8fc","resolution":{"observed_at":"2026-08-07T12:44:05.455728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:05.189837Z","title":"Recall@ k surro- gate loss with large batches and similarity mixup","venue":null,"work_id":"d0ba80cb-acea-4134-83db-ad7c0b10d0c2","year":2022},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-07T12:37:25.617891Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:57.504160Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:a1ae1c5bcac7950f8104ea21e4df0070998492095c29dc82d831791b230a46e2","observation_id":"638631f6-5034-4032-8264-c92f1063b966","resolution":{"observed_at":"2026-08-07T12:44:05.227498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:05.071225Z","title":"Sa 2vp: Spatially aligned-and- adapted visual prompt","venue":null,"work_id":"ead48550-cbea-4d3f-8e2e-c58aa1342abd","year":2024},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-07T12:37:25.617891Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:57.542876Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:ccb7b4bcc1cda181f237bf0bad7cd2092dcb5a351a47b242155e5210516e10fc","observation_id":"20375748-78a4-4755-8066-e0fde2e2b664","resolution":{"observed_at":"2026-08-07T12:44:05.127723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2007.07779","last_updated":"2020-10-06T10:16:39Z","snapshot_observed_at":"2026-07-06T09:38:29.271727Z","submitted_at":"2020-07-15T15:56:05Z","title":"AdapterHub: A Framework for Adapting Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.07779","snapshot_observed_at":"2026-08-07T12:43:57.582656Z","title":"Adapterhub: A framework for adapting transformers","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-07T12:37:25.617891Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:57.582656Z"},"links":{"cited_paper":"/paper/2007.07779","citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:fb47d7af4a73a631a0f8714269ea631c63526452e5934245addf2311a3978d5b","observation_id":"ef3f914b-6a1b-4d1e-a6ef-692c83799c53","resolution":{"observed_at":"2026-08-07T12:43:57.582656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:04.913545Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"97ccb3cb-b9f9-4db0-b7d1-2870aa1b12aa","year":2021},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-07T12:37:25.617891Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:57.638434Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:a18788d12d5ac1831bd67cab5dabbec3eddc316869d10676d3287775e4c34798","observation_id":"5f65fb55-2faf-475c-a312-8474482af3b2","resolution":{"observed_at":"2026-08-07T12:44:04.988040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:04.842660Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"259c80b6-a86e-4564-9c49-c23e9337fde0","year":2021},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-07T12:37:25.617891Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:57.685560Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:9f34f9ec07665bbb1399f0b9618beedc107f015ee68d541bf4f66de948939e74","observation_id":"6e3b81fc-d614-44b9-a1fa-e55281b0c542","resolution":{"observed_at":"2026-08-07T12:44:04.875175Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:04.748891Z","title":"Beyond the deep metric learning: enhance the cross-modal matching with adversarial discriminative domain regularization","venue":null,"work_id":"c3d696c6-7391-474e-ac25-347b03d0d7f2","year":2021},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-07T12:37:25.617891Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:57.752742Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:02fa40440bce27bf7f42c899a3aa4b0cc9595dd25245228315becbcbf3403b00","observation_id":"35c46f83-d155-438c-8658-0ad72192e968","resolution":{"observed_at":"2026-08-07T12:44:04.783326Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:04.632485Z","title":"To- wards improved proxy-based deep metric learning via data- augmented domain adaptation","venue":null,"work_id":"a7595e9e-c9f7-4da5-a60b-cbfbb3e8f7b1","year":2024},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-07T12:37:25.617891Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:57.894242Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:4c1d6d27df26d4b84cd9e5fe076c48ab7b64da056015ff5b10d395eb0a168407","observation_id":"d539e582-2bee-4d2d-8936-320823f2d455","resolution":{"observed_at":"2026-08-07T12:44:04.701564Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:04.538595Z","title":null,"venue":null,"work_id":"530cd589-0c00-4ebd-9bf8-9909110c1d82","year":2024},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-07T12:37:25.617891Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:57.963389Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:39a7c43d30e84ee7d4f61d896206cb65e8ddc79b57b5669b37951d9c8e9e2073","observation_id":"2909f1e1-31bc-4a3a-a54c-c184117a9a4d","resolution":{"observed_at":"2026-08-07T12:44:04.597578Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:04.341812Z","title":"Non-isotropy regularization for proxy-based deep metric learning","venue":null,"work_id":"cdf0ec17-0cc4-4cb7-94dd-7176d4dd703e","year":2022},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-07T12:37:25.617891Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:58.037731Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:743442d5a22b0b744fcc493e91dc8a6dc8f73a9fef5c3a86cc2467f344ec5f0c","observation_id":"13199643-c972-4b8b-b7db-812a8a4feeae","resolution":{"observed_at":"2026-08-07T12:44:04.442806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:04.233075Z","title":"Neighbourhood component analysis","venue":null,"work_id":"8466c531-6983-43f9-9904-cd09bbd86e2b","year":2004},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-07T12:37:25.617891Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:58.117052Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:030539920b6ddbd91721e979e968250427997d4501eaaae6ab05e84365d2a147","observation_id":"1a197767-ac52-4906-8c01-364866ecb7a9","resolution":{"observed_at":"2026-08-07T12:44:04.262626Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:04.141639Z","title":"Revisiting unreasonable effectiveness of data in deep learning era","venue":null,"work_id":"8be10997-ea7f-4308-a8f1-278870ba1886","year":2017},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-07T12:37:25.617891Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:58.207924Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:423cc73453ae6890e9b90c783928123f3fc2af78dab97d5a77745a7d7d0a063e","observation_id":"6bf84f99-8294-4cf8-9a3a-e0987fb56e56","resolution":{"observed_at":"2026-08-07T12:44:04.181635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:04.032793Z","title":"Prox- ynca++: Revisiting and revitalizing proxy neighborhood com- ponent analysis","venue":null,"work_id":"75e39201-53ea-4311-9b1c-db55fa94f201","year":2020},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-07T12:37:25.617891Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:58.270734Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:c064fdecf98de6b25aae291527eb684b09e8d3b03d78d96d981fed7bf2ef284c","observation_id":"f13ad1b3-d11b-412a-bfa7-563e41e65a92","resolution":{"observed_at":"2026-08-07T12:44:04.068765Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T12:43:58.348098Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-07T12:37:25.617891Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:58.348098Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:abf17796c5d2d1c0b6a1ef1ff7a5422ab2652c91c35f0b37c9afdbd4c30690a3","observation_id":"795cae06-0ac5-4079-b8e7-ccce4b753b23","resolution":{"observed_at":"2026-08-07T12:43:58.348098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:03.888819Z","title":"Convolu- tional visual prompt for robust visual perception","venue":null,"work_id":"1fcbe890-a6f1-49ce-b3bc-4ed3910ff836","year":2024},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-07T12:37:25.617891Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:58.401879Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:19658243b41de26e8f4a818531a7e8bba0fdbe47f622a267e3799fc9b9aae5c4","observation_id":"064a62a5-787a-4eb2-8d9c-ab8b2528391e","resolution":{"observed_at":"2026-08-07T12:44:03.975586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:03.685723Z","title":"Visual query tuning: Towards effective usage of intermediate representa- tions for parameter and memory efficient transfer learning","venue":null,"work_id":"3b56936d-438f-4fe6-bdca-77a33a4cde58","year":2023},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-07T12:37:25.617891Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:58.420135Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:16df627419ce0b583e68528d6b914df0e2d53d7e16fad8e45b99e9c5d5e75c9a","observation_id":"6aeaedea-3b1b-4696-85e2-880a042e876e","resolution":{"observed_at":"2026-08-07T12:44:03.765035Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:03.496630Z","title":"Building a bird recognition app and large scale dataset with citizen scientists: The fine print in fine-grained dataset collection","venue":null,"work_id":"25ff0e59-2724-48c8-958f-4ea60a46b565","year":2015},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-07T12:37:25.617891Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:58.445079Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:953823a72aee625194fe6594546055a1c5ad0f61450df346b8a9812478e0531c","observation_id":"edd13ea8-5f36-4ad2-a6ef-83228107f8d0","resolution":{"observed_at":"2026-08-07T12:44:03.586310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:58.533969Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-07T12:37:25.617891Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:58.533969Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:892f236a0d408d657f1308cd64c19d4a589ca9946e6cb6a73ce380c982757fab","observation_id":"bb474718-aeb9-41ef-b302-66ee56ae6d30","resolution":{"observed_at":"2026-08-07T12:43:58.533969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:03.353558Z","title":"Attention is all you need","venue":null,"work_id":"996445df-d8a7-4f7c-a837-658bcb85a95e","year":2017},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-07T12:37:25.617891Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:58.617207Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:882f66dca000d69f117dca68e8b2cfd349f6a565ea8759ff2d1dba052912f86c","observation_id":"e3e37212-54a7-4fa5-addf-7776594f692b","resolution":{"observed_at":"2026-08-07T12:44:03.403516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:03.235653Z","title":"Rotation equivariant cnns for digital pathology","venue":null,"work_id":"6d56037d-3d8d-4986-afb0-c70ec0affa34","year":2018},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-07T12:37:25.617891Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:58.661155Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:e30040c10d2b7ebf06be05dd1dc0e8db868835c8c5b132c773f7da0f7c34a59c","observation_id":"e6c03e8a-3381-46c3-84c1-da10df9ed95b","resolution":{"observed_at":"2026-08-07T12:44:03.286024Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:02.995746Z","title":"It takes two to tango: Mixup for deep metric learning","venue":null,"work_id":"363a4e99-a4d7-4f28-b871-2ed984c4f467","year":null},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-07T12:37:25.617891Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:58.742058Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:b45d317ce57de51a6704e4d440186ee71d74154319ad17aa84178b34cfc6385f","observation_id":"fe4f1499-1119-41f5-81b6-dbfaf48214b9","resolution":{"observed_at":"2026-08-07T12:44:03.114534Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:58.794340Z","title":"The caltech-ucsd birds-200-2011 dataset","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-07T12:37:25.617891Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:58.794340Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:af9d33a1d9a7301ca6df871933f56cffb478be78b91f2bfce4613d0eb20ffb77","observation_id":"71989702-ac17-4644-9177-28b6f42d1399","resolution":{"observed_at":"2026-08-07T12:43:58.794340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:02.815088Z","title":"Adversarial cross-modal retrieval","venue":null,"work_id":"95221236-b04d-4d80-80fc-7ead35b6001c","year":2017},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-07T12:37:25.617891Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:58.829691Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:7665b229193654a1f15ab17dd6fb63b24e4ea6c755189f5e34ba68648ccff553","observation_id":"2802b62e-4073-477b-846c-863a19d2b1bd","resolution":{"observed_at":"2026-08-07T12:44:02.910397Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:02.594539Z","title":"Adapting shortcut with normalizing flow: An efficient tuning framework for visual recognition","venue":null,"work_id":"149b25d7-4170-4783-a056-ddef65ca1776","year":2023},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-07T12:37:25.617891Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:58.859656Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:bbe41e81d59e8809e13cb88eb087474ead4200a8130c04565801772ba9ffa265","observation_id":"121ecaa6-8624-466e-852c-2fe27aff9edb","resolution":{"observed_at":"2026-08-07T12:44:02.688257Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02382","last_updated":"2024-05-27T06:51:07Z","snapshot_observed_at":"2026-07-06T17:25:01.583656Z","submitted_at":"2024-02-04T07:49:02Z","title":"Revisiting the Power of Prompt for Visual Tuning","version":3},"cited_work":{"arxiv_id":"2402.02382","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.02382","snapshot_observed_at":"2026-08-07T12:43:59.765810Z","title":"Revisiting the Power of Prompt for Visual Tuning","venue":"cs.CV","work_id":"5974c883-76f8-4087-93ac-cda3d48d6e44","year":2024},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-07T12:37:25.617891Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:58.898286Z"},"links":{"cited_paper":"/paper/2402.02382","citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:a79aed012593618079e301fa41a637d96e62768d9b3ab25f987ffc69c68f34b2","observation_id":"d58333dd-d6d5-4f9e-962f-b6572ea21bae","resolution":{"observed_at":"2026-08-07T12:43:59.898846Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:02.359819Z","title":"Sun database: Large-scale scene recog- nition from abbey to zoo","venue":null,"work_id":"53190057-df3b-4a97-8032-a94bda463613","year":null},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-07T12:37:25.617891Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:58.932692Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:37270d4025989f6a12aaa16276f1ceb55068d343dbaa1aca5d2b26bbb57eb1a5","observation_id":"4ef1c72f-3318-4e12-a6fc-a05406ccc4e6","resolution":{"observed_at":"2026-08-07T12:44:02.473664Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:02.108854Z","title":"Difffit: Unlocking transferability of large diffusion models via simple parameter- efficient fine-tuning","venue":null,"work_id":"d3617196-8775-4863-9294-94c9ee976e58","year":2023},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-07T12:37:25.617891Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:58.968391Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:90e6fbdace5f2288f93d6832b0e2aa227a6f26f8e41b7c1591ba72034dec8f41","observation_id":"3d4a4cb1-c67b-4e3e-9a61-19ada5a00833","resolution":{"observed_at":"2026-08-07T12:44:02.209062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:01.879745Z","title":"Improving visual prompt tuning for self- supervised vision transformers","venue":null,"work_id":"53ea8484-a3df-4529-915e-51c1266fb05a","year":2023},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-07T12:37:25.617891Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:59.010365Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:3a5294422ffd3bb67f4ed53ef67282ea93e6e282a363ad4bf63cc6dad1ea3001","observation_id":"217538ae-4c07-4814-821b-e1266942bfaf","resolution":{"observed_at":"2026-08-07T12:44:01.993968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:59.077581Z","title":"Bitfit: Simple parameter-efficient fine-tuning for transformer-based masked language-models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-07T12:37:25.617891Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:59.077581Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:07ccdc423985e0461d5ccad751af5bb520db2f1a15784a869ab834107361f7a0","observation_id":"a8fa3316-c4d5-4be6-9af2-ce089c30e13f","resolution":{"observed_at":"2026-08-07T12:43:59.077581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.04867","last_updated":"2020-02-21T13:36:15Z","snapshot_observed_at":"2026-08-03T18:52:32.049047Z","submitted_at":"2019-10-01T17:06:29Z","title":"A Large-scale Study of Representation Learning with the Visual Task Adaptation Benchmark","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.04867","snapshot_observed_at":"2026-08-07T12:43:59.110572Z","title":"A large-scale study of representation learning with the visual task adaptation benchmark","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-07T12:37:25.617891Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:59.110572Z"},"links":{"cited_paper":"/paper/1910.04867","citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:b5c08d4bb3f23239c9f66c985c9200d51b46f77991678f75c3e730fcc59dcaed","observation_id":"f94d2271-bb75-477f-9bd4-bd2af16650cf","resolution":{"observed_at":"2026-08-07T12:43:59.110572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02923","last_updated":"2024-03-23T07:00:15Z","snapshot_observed_at":"2026-07-06T16:57:17.747414Z","submitted_at":"2023-12-05T17:50:55Z","title":"MoSA: Mixture of Sparse Adapters for Visual Efficient Tuning","version":2},"cited_work":{"arxiv_id":"2312.02923","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.02923","snapshot_observed_at":"2026-08-07T12:43:59.414609Z","title":"MoSA: Mixture of Sparse Adapters for Visual Efficient Tuning","venue":"cs.CV","work_id":"a0fa3b12-bce5-4d9e-a078-c0bd43b1cd45","year":2023},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-07T12:37:25.617891Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:59.143965Z"},"links":{"cited_paper":"/paper/2312.02923","citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:218cce64f1fcedd4b04fff27076f0c2dc3264cdf21486ebbc7aaecd65ab4b56d","observation_id":"ad13b19e-d4e7-4cbf-94b6-779e0353a143","resolution":{"observed_at":"2026-08-07T12:43:59.489971Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04673","last_updated":"2022-06-14T12:15:55Z","snapshot_observed_at":"2026-08-07T11:36:51.183489Z","submitted_at":"2022-06-09T17:59:58Z","title":"Neural Prompt Search","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.04673","snapshot_observed_at":"2026-08-07T12:43:59.183930Z","title":"Neural prompt search","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-07T12:37:25.617891Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:59.183930Z"},"links":{"cited_paper":"/paper/2206.04673","citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:fb50879abf67247d58eaa4c6934d9855bfa59190befb568d240a2f72bd0eb18c","observation_id":"59f6711e-d790-4f7b-83bd-f9871dddc24c","resolution":{"observed_at":"2026-08-07T12:43:59.183930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:01.615941Z","title":"Rethinking semantic segmentation from a sequence-to-sequence perspective with transformers","venue":null,"work_id":"08ddad76-3c35-4f10-ad0c-dded8655a195","year":2021},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-07T12:37:25.617891Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:59.219335Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:282d384ba5541e4f5f261c5dfc9f6f4cadd77b9ea33f8c33826b7d147615d3d6","observation_id":"94d388f2-9bd8-437c-905e-fb0747c06713","resolution":{"observed_at":"2026-08-07T12:44:01.747707Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:01.415094Z","title":"Semantic understand- ing of scenes through the ade20k dataset","venue":null,"work_id":"01db1984-955e-43c0-b2bf-965969cc92a1","year":null},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-07T12:37:25.617891Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:59.264040Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:fa178cc515eb889b237a5ef3537b9879dae5e93f7402e9add9bdd2619e2d406c","observation_id":"811e8f89-4a3e-4436-92f7-2f1f736aeee5","resolution":{"observed_at":"2026-08-07T12:44:01.507329Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:00.433523Z","title":"Following established proto- cols [19, 33, 45], we report mean accuracy across three runs with different random seeds","venue":null,"work_id":"1c230fe8-3433-478b-b720-348cfcf517e7","year":null},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-07T12:37:25.617891Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:59.305859Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:379d456b402bbe14a6a8284ee2f3644d1757f04f6d66e1fa5792f9b7cfa2d9b4","observation_id":"2c3afc00-9444-4efb-b502-3968220f89c6","resolution":{"observed_at":"2026-08-07T12:44:00.987071Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:01.321966Z","title":"Details About the Experiments A.1","venue":null,"work_id":"5a578948-a43d-475c-85ab-ec5710359321","year":2011},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-07T12:37:25.617891Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:59.285066Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:101cf1d77989a89b4d25e1f42e127200b100cee44806606e1aa4e4ddfda27935","observation_id":"9c340b43-ab4b-4411-8eef-674f2ebf55a1","resolution":{"observed_at":"2026-08-07T12:44:01.361118Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T12:37:25.617891Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers"},"reference_resolution":{"displayed":93,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":36,"verified_exact":2,"verified_fuzzy":54},"total_outbound_references":93},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 93 of 93 outbound references and 0 inbound Pith citation observations for arXiv:2505.23694."}