{"as_of":"2026-08-07T18:05:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:83dd6bb821af75e88120e1b270d598d74dd9a5336e83c0d5c3db627f4637a748","coverage":[{"denominator":67,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":67,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:37:30.225257Z","state":"measured"},{"denominator":68,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":68,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-26T00:32:35.119143Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T16:29:57.636038Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2506.23856","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.23856","snapshot_observed_at":"2026-07-04T16:29:57.636038Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models,","venue":null,"work_id":"e53e7851-75de-4186-a856-846dbd2570c8","year":2025},"citing_paper":{"arxiv_id":"2606.24248","last_updated":"2026-06-23T07:35:49Z","snapshot_observed_at":"2026-08-03T00:41:42.999699Z","submitted_at":"2026-06-23T07:35:49Z","title":"M^2C-EvDet: Multi-Domain Multi-Order Cross-Modal Knowledge Distillation for Event-based Object Detection","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-26T00:32:35.119143Z"},"links":{"cited_paper":"/paper/2506.23856","citing_paper":"/paper/2606.24248"},"observation_digest":"sha256:4e4aaaf7ea036f6eebf49f2d10e0ab9f2fe1531183a36c24dca85b7a71df3558","observation_id":"a9dd6569-f00e-439d-a9a9-0f6aff9a755a","resolution":{"observed_at":"2026-07-04T16:29:57.637515Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.23856/citation-record","integrity":"/paper/2506.23856/integrity","json":"/paper/2506.23856/citation-record.json","paper":"/paper/2506.23856"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:31.362652Z","title":"Dept: Decoupled prompt tuning","venue":null,"work_id":"8b7e57ea-eba7-4a51-9751-6234d48f6913","year":2024},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:29.931500Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:4097890424176e0229d72c299d0a39c9e5a70fe729cb304295ab2f6c04607523","observation_id":"42a143cf-56cf-44eb-9e66-373d11fc3027","resolution":{"observed_at":"2026-08-06T21:37:31.367045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:31.347931Z","title":"Learning trans- ferable visual models from natural language supervision","venue":null,"work_id":"e27f9a70-6e98-44c6-a7dd-5aa7b028bd58","year":2021},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:29.936191Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:d7bb7e5bf49735d3b26102d34b729049e8331293501536840c83bd5fde8732dd","observation_id":"10c8f469-62c6-48aa-b788-e2d006debfc9","resolution":{"observed_at":"2026-08-06T21:37:31.352496Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:31.331263Z","title":"A closer look at few-shot classification again","venue":null,"work_id":"81ddbc1f-d4e8-4e02-a551-3a44af9c7b39","year":2023},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:29.940883Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:06a1d76a531ad0d784e3ff08d8e6a749355a2df8a600edf9e06edf932a860275","observation_id":"e88ac3bc-595d-44ca-a87d-cb3cfa98fab0","resolution":{"observed_at":"2026-08-06T21:37:31.336067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:31.316093Z","title":"Bayesian prompt learning for image- language model generalization","venue":null,"work_id":"12e8705c-f69b-40de-9ffc-dee57b12cad3","year":null},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:29.945572Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:8d3815f5c27208db520e1bff1210e7196b4e3989e3e7082cf97ddaeae0d9e0de","observation_id":"ee9246f5-154e-415d-bccf-3430d116f005","resolution":{"observed_at":"2026-08-06T21:37:31.320946Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:31.299770Z","title":"Maple: Multi-modal prompt learning","venue":null,"work_id":"549c9b63-15ca-471b-b479-707131dfb82b","year":2023},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:29.949965Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:dc5df6b25fbd255ca8738351f282a7f3c8a9ac0672b62d95989631f0355db226","observation_id":"1bf7febd-f5f0-42b3-86db-42c1ae529c13","resolution":{"observed_at":"2026-08-06T21:37:31.304116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:31.284010Z","title":"Conditional prompt learning for vision-language models","venue":null,"work_id":"157f5ef2-1e60-4268-b5fd-d72dd1ed3c05","year":2022},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:29.954150Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:5ae37589f4c2aa5cbfece690fff87a7b0625063a36fcb3fd88f413396649a109","observation_id":"36ef0ed2-b19e-4c7b-89fb-e0c761633f5a","resolution":{"observed_at":"2026-08-06T21:37:31.289366Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:31.254210Z","title":"Visual-language prompt tuning with knowledge-guided con- text optimization","venue":null,"work_id":"ca2add24-9387-4567-8262-d2bb750c00f2","year":2023},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:29.963320Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:3e5f3d8e7f845f37a566596bc1d8873c423906e7baf074d681cb31dc118ddbc5","observation_id":"51dcf074-8db9-47ef-baee-2a403d94a32a","resolution":{"observed_at":"2026-08-06T21:37:31.258623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:31.239202Z","title":"Prompt-aligned gradient for prompt tuning","venue":null,"work_id":"8fc56659-3a56-44d8-885b-3ad2f6f79f61","year":2023},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:29.967622Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:4247bc2a536133a094ab355f8290f35723e46211f3992bfe5b61b0022c317bd8","observation_id":"078bdf5b-3200-48c4-af67-2de18b03526b","resolution":{"observed_at":"2026-08-06T21:37:31.243884Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:31.223045Z","title":"Distribution-aware prompt tuning for vision-language models","venue":null,"work_id":"717b9fde-6382-4825-9385-449102c487c9","year":2023},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:29.971651Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:107812bd40514d19be8441c365a66d7582e6c3eab541a4ecf652eb2a1afce1d9","observation_id":"d558fa0b-5c62-48de-8d20-a3bf83cfcfde","resolution":{"observed_at":"2026-08-06T21:37:31.228317Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:31.206747Z","title":"Context-aware Alignment and Mutual Mask- ing for 3D-Language Pre-training","venue":null,"work_id":"62ca0e94-8b48-43fe-bf96-c3b7613123c0","year":null},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:29.975996Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:bbc5833eac34f3a6f538ae46d764bab1d7bb16cfeb2b97a6f8a022557d4b57da","observation_id":"bc2cdb00-bc92-494b-98bf-7e3c56bc0edc","resolution":{"observed_at":"2026-08-06T21:37:31.211644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:31.189853Z","title":"Recent advances in natural language processing via large pre- trained language models: A survey","venue":null,"work_id":"8b8227c0-3f91-4975-89c6-9e208b12c58b","year":2023},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:29.980348Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:8eca2276b25f140cf6d4547cfbf0de406c02a10dc8b782b84da44db96ae8452a","observation_id":"02749759-2fa5-4cd4-af91-d8f9b3fc15ba","resolution":{"observed_at":"2026-08-06T21:37:31.194747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:31.171502Z","title":"Nat- ural language processing: State of the art, current trends and challenges","venue":null,"work_id":"6b8a18ce-3695-4c6b-9894-8d9d39cbb592","year":2023},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:29.984647Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:8c81d03b5e25a1d27d00bb9ba3709ae272e252fe5d06cc414d709e2489bec8e1","observation_id":"331cfc70-9bf6-4f40-b869-43c69c894a17","resolution":{"observed_at":"2026-08-06T21:37:31.176710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:31.156691Z","title":"Vilt: Vision-and- language transformer without convolution or region supervision","venue":null,"work_id":"34b5b7eb-fe5e-42de-bbaf-57f5041ee199","year":2021},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:29.988859Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:860a983092f274ecc96a99596e83e489d1dc7255abc55e9758d59fcdfd14b3a8","observation_id":"db735bfb-72d4-4aba-9778-9b0b3d7c90b9","resolution":{"observed_at":"2026-08-06T21:37:31.161326Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:31.142632Z","title":"Scaling up visual and vision- language representation learning with noisy text supervision","venue":null,"work_id":"4c6747f6-b4c5-4d16-94ef-4a10dd3f48e7","year":2021},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:29.993396Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:0f619a044b142ebd2f8c72ada9246af3b1b284da5b0d1c6396ea1edbd9f38aa0","observation_id":"a8938f1c-a23c-4734-b879-22de8c45f1a0","resolution":{"observed_at":"2026-08-06T21:37:31.147022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:31.128079Z","title":"WenLan: Bridging vision and language by large-scale multi-modal pre- training","venue":null,"work_id":"4b85494e-0496-4391-b420-f176dbeb8b9d","year":2021},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:29.997872Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:5be30869629da445134a8706aa25d7421b70b7349fc9697e5ba004bacba8571a","observation_id":"b5d0aceb-a5b8-4986-9948-5b846aa4f352","resolution":{"observed_at":"2026-08-06T21:37:31.132706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:31.112786Z","title":"Align before fuse: Vision and language representation learn- ing with momentum distillation","venue":null,"work_id":"b7085724-02ed-4c61-a3c5-979dc6079e1e","year":2021},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:30.002407Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:ae0f7fbd8c6820b39632e22df5fd8b8a1a46dd74c335e2e300c0273685c966e1","observation_id":"93208d3e-066f-41ca-bb24-9498c922d608","resolution":{"observed_at":"2026-08-06T21:37:31.118090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:31.098229Z","title":"Disentangled Multiplex Graph Represen- tation Learning","venue":null,"work_id":"e7bac521-d9c9-4b2e-95ee-bc6bba26be5f","year":2023},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:30.007257Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:dbf0cfe7a8825bf6fc544a802d6220f5373a7376266574c84e5d7e15d897494b","observation_id":"e669899b-a506-4ba9-b199-cada8ba773c7","resolution":{"observed_at":"2026-08-06T21:37:31.102803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:31.083389Z","title":"Vilbert: Pretraining task-agnostic visiolinguistic rep- resentations for vision-and-language tasks","venue":null,"work_id":"c4d05fdb-542e-451b-b79f-2012f72fd77f","year":2019},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:30.011553Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:69d455420196a3ddbfd6fa5f3610d0ba2df72856dd3344185f82cc03e59bfea3","observation_id":"443e8130-b339-4d0e-a49b-96c56f8ffb51","resolution":{"observed_at":"2026-08-06T21:37:31.087941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:31.068938Z","title":"X-clip: End-to-end multi-grained contrastive learning for video-text retrieval","venue":null,"work_id":"042f6edb-113d-458c-9d87-4ad6d9b561f0","year":2022},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:30.015886Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:0188beeba322c6271d45798eb72b0f69d958eccb0b18d42878f75db5ae913d7c","observation_id":"cb02161e-0026-44d3-953b-af180183361d","resolution":{"observed_at":"2026-08-06T21:37:31.073453Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:31.053496Z","title":"Complementarity-aware space learning for video-text retrieval","venue":null,"work_id":"a2de21ff-b8bf-4b6a-b138-64d774870034","year":2023},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:30.020212Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:937359f0f9a56f4089d25aa87d636e7811a8160adc81b05601d399ceb500fc4a","observation_id":"8f69235b-9b31-48ea-967e-4e982dd4542d","resolution":{"observed_at":"2026-08-06T21:37:31.058055Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:31.038832Z","title":"Denseclip: Language- guided dense prediction with context-aware prompting","venue":null,"work_id":"80a22336-ee91-4955-84bc-98df20100a7f","year":2022},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:30.024848Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:e1304aa99c3e0153c470fa2a2f5636f64b05efcae083185dd3f4b4709e9204ae","observation_id":"b1b0de1f-ac36-4a21-9a62-6a395843b727","resolution":{"observed_at":"2026-08-06T21:37:31.043497Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:31.023345Z","title":"Extract free dense labels from clip","venue":null,"work_id":"7f635bdd-1417-4d50-9459-de11aa9f6f64","year":2022},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:30.029020Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:36263f1c5f634ba39958dc8a2e5578f9cb94c1c92f0ed74369303de5705f2fa4","observation_id":"8f864528-e0aa-4af5-8cb6-e74c775337d3","resolution":{"observed_at":"2026-08-06T21:37:31.028234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:31.009233Z","title":"Clip-nerf: Text-and-image driven manipula- tion of neural radiance fields","venue":null,"work_id":"6bf535a5-b250-4f8a-9d60-5f4386cdf2c5","year":null},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:30.033133Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:c9b348da4439264aae26c355ba24d2cce18cc4a2da6cf5740410965f038ec449","observation_id":"bed7ca1b-cf45-4380-9772-cc5b841bc717","resolution":{"observed_at":"2026-08-06T21:37:31.013589Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:30.992911Z","title":"Styleclip: Text-driven manipulation of stylegan imagery","venue":null,"work_id":"5d07e89b-3c90-42a9-9da0-6067823d53ce","year":null},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:30.037572Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:828ddec1f844743949992b14d9268233a5d71348fa274e40d1e73f0a14f60e76","observation_id":"a4cb55e4-90d6-4568-b21f-eb9ee2d7d48e","resolution":{"observed_at":"2026-08-06T21:37:30.998539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:30.978520Z","title":"Parameter-efficient transfer learning for NLP","venue":null,"work_id":"7e3cbb1e-9843-463e-b06f-936cfbd77698","year":2019},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:30.042063Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:ebf5f3f59bd532501a88de750408fbd536e903e2abe28e6f41948068ed030071","observation_id":"705724cd-72a8-49c2-b018-56e5ca3ffd8a","resolution":{"observed_at":"2026-08-06T21:37:30.982886Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:30.963342Z","title":"Learning a universal tem- plate for few-shot dataset generalization","venue":null,"work_id":"54b6f8f2-ac36-4d7d-a546-9955b353d0ad","year":2021},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:30.046681Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:043bee8f9aec9af282d3e2b902db86a16975d98c7ce3ef41181e5a3b2057a231","observation_id":"d5674e47-e6c9-4c04-942d-a74b5670c08c","resolution":{"observed_at":"2026-08-06T21:37:30.968078Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:30.948812Z","title":"Reliable Few-shot Learning under Dual Noises","venue":null,"work_id":"f9627c8e-ae70-4495-9308-28325539c63e","year":2025},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:30.052009Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:6088c003f33fd0e1600d66d9924b76a70d8146e493df038e147596804b5b1bc6","observation_id":"480c1647-b762-425d-a5cf-994d7e30d472","resolution":{"observed_at":"2026-08-06T21:37:30.953004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:30.934742Z","title":"Prefix-Tuning: Optimiz- ing Continuous Prompts for Generation","venue":null,"work_id":"391dc1b8-292b-4b9b-a229-0419829cdeaa","year":2021},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:30.056349Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:f680001b115d1f4bb66a670d6ea63ff8a687b4bb64edf5ee53cd9e2b51fdbadb","observation_id":"ee68335c-474d-41d7-b3c2-006ad3b17063","resolution":{"observed_at":"2026-08-06T21:37:30.939262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:30.919619Z","title":"Skip Tuning: Pre-trained Vision- Language Models are Effective and Efficient Adapters Themselves","venue":null,"work_id":"a25c3d6c-bfc3-4db6-9487-7c7111356f64","year":2025},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:30.060822Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:c4c4ada4dd949b964e41bb1a256c96bf20fe23de2320b874f672de332be34282","observation_id":"f1598afd-3a49-40a5-9ed7-b39261f22984","resolution":{"observed_at":"2026-08-06T21:37:30.924802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:30.905086Z","title":"Lora: Low-rank adapta- tion of large language models","venue":null,"work_id":"66d715c9-d44b-41b2-a74b-faf356ce4aef","year":2021},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:30.065096Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:31675500b2427bf753c27be8504499fe809d8731e81d7b4ea6ef32701d067635","observation_id":"60f427b5-a497-4c2f-bcab-f211532013d6","resolution":{"observed_at":"2026-08-06T21:37:30.909348Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:30.891194Z","title":"Learning to decompose visual features with latent textual prompts","venue":null,"work_id":"1efe8ab1-05c1-45c6-8ee0-7961fdd77f4c","year":2022},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:30.069160Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:de0d39f1efe74abe39a1b3355098143cbc136666e91d506add35d0fd4527536f","observation_id":"e8ce2f53-e69d-4b28-b94d-4f21f944307d","resolution":{"observed_at":"2026-08-06T21:37:30.895517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:30.875870Z","title":"Prompt learning with optimal transport for vision-language models","venue":null,"work_id":"e07ede23-fe95-428c-866c-f3994e8384f3","year":2022},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:30.073564Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:b4e06acd9e80266478bd74a9d481f23606b8165b3f18b367e63b0b56f420daf6","observation_id":"4478a318-60e6-48e8-b33f-3fae6c334823","resolution":{"observed_at":"2026-08-06T21:37:30.881264Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:30.860676Z","title":"Consistent Prompt Tuning for Generalized Category Discovery","venue":null,"work_id":"35a39ebc-66dd-4bcf-9f1c-f18d227e9821","year":2025},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:30.077671Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:d7e144e8377c2c7373297a0640f118924647bcd93e1c3528edccb12c620dba8a","observation_id":"af539285-740e-42f7-b81f-4020ddae8e05","resolution":{"observed_at":"2026-08-06T21:37:30.865519Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:30.846472Z","title":"Progressive visual prompt learn- ing with contrastive feature re-formation","venue":null,"work_id":"574e117b-5a50-42da-bb58-5332d56f728f","year":2025},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:30.081839Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:659ba9d61a99ef82c87f1d57cb8136899bd733d02bef5693357a29198c65c587","observation_id":"0f1fca09-a50e-4fac-94c8-cd61ccb67226","resolution":{"observed_at":"2026-08-06T21:37:30.850748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:30.831681Z","title":"HybridPrompt: Domain-Aware Prompting for Cross-Domain Few-Shot Learning","venue":null,"work_id":"b2602b8e-ced2-4b55-9375-e823ce6622ce","year":2024},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:30.086447Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:537f47e1cd24ac80e76a914b383bea58086f1083b95dcf9be308656ef3a3bd87","observation_id":"bd326d7c-1da3-498a-bd16-a395faa968e7","resolution":{"observed_at":"2026-08-06T21:37:30.836301Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:30.816504Z","title":"DETA: Denoised Task Adaptation for Few- Shot Learning","venue":null,"work_id":"0bb30784-2ee8-4f79-89b9-c8a73177aa66","year":2024},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:30.090759Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:714bceb2d49bc6ed9d116f2c9bc7783fc158a10201c378483322f017fac8b4d1","observation_id":"f3770958-619b-4d86-9596-660fe212a0f4","resolution":{"observed_at":"2026-08-06T21:37:30.821226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:30.801743Z","title":"Meta-fdmixup: Cross- domain few-shot learning guided by labeled target data","venue":null,"work_id":"a24a819d-f06b-497e-8fdc-bd74b9bb80c3","year":2021},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:30.094863Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:f55dd43b74cfc20d9e1c6f169e84a26e05b31761bd219372de967200e9b47b9d","observation_id":"f5c2de13-800a-4f7c-95ba-73f8579489c8","resolution":{"observed_at":"2026-08-06T21:37:30.806719Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:30.786441Z","title":"StyleAdv: Meta Style Adversarial Training for Cross- Domain Few-Shot Learning","venue":null,"work_id":"7fb62ebb-a5eb-4c89-abec-6bbf1376645e","year":2023},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:30.099718Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:d2bb0f16c8690a349ae9aa2f2d41d1cb4aa8641e607c2081867dbc4e6a266c2c","observation_id":"5f6c5ee2-111f-43c9-afdb-6bb457702b20","resolution":{"observed_at":"2026-08-06T21:37:30.791554Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:30.771186Z","title":"Tip-adapter: Training-free adaption of clip for few-shot classification","venue":null,"work_id":"0d6e57fa-b6f8-4490-afe4-4ba6c87fa7dc","year":2022},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:30.104180Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:0b957cc5039c3d4e81cb2e9f78ad4ab80a73f0abd46b66c30f065b258fcb7d4f","observation_id":"1c6bea8b-0247-452b-b50d-04995c25ba88","resolution":{"observed_at":"2026-08-06T21:37:30.775458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:30.756767Z","title":"Prompt, generate, then cache: Cascade of foundation models makes strong few-shot learners","venue":null,"work_id":"9b2f20c9-df39-4853-a663-1926cd0b7ca4","year":2023},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:30.108730Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:1b0faa36379103eb90d0b549e7b3c6de91beb8db2ed1d9009ec24df4f1366887","observation_id":"c63402ce-65f7-428e-88c5-d2c1a37ad210","resolution":{"observed_at":"2026-08-06T21:37:30.761137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:30.741920Z","title":"Visual prompt tuning","venue":null,"work_id":"e44588d0-659d-43e9-8f9c-eaa00d26ff7a","year":2022},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:30.112906Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:e7876f1f4b95b0e3b156d181e996346827a2b75d7d546f14c0c4d01cd2bc4e1b","observation_id":"c5ce0667-06f8-4374-8ad7-d835396504fa","resolution":{"observed_at":"2026-08-06T21:37:30.745982Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:30.727583Z","title":"Diversity-Aware Meta Visual Prompting","venue":null,"work_id":"a49ac064-1ec3-4381-bbbd-e4c908e6dd79","year":2023},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:30.117304Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:5f3dbe5b06fd24a7fb7dcb3aa059008e7914388d9a126971b9f551728f68c01f","observation_id":"4a4e4f27-5f3a-44b5-99cc-26804a2d49d9","resolution":{"observed_at":"2026-08-06T21:37:30.732034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:30.710936Z","title":"Self-regulating Prompts: Foundational Model Adaptation without For- getting","venue":null,"work_id":"5821dc06-0c6b-4330-a82b-15bfd337cd33","year":2023},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:30.122007Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:e041f652e132cbb2ec707a075bc7aad0481364a22c1e3d9697e3987bb765e129","observation_id":"79a15588-09d9-4db5-b08e-f4e22987960e","resolution":{"observed_at":"2026-08-06T21:37:30.716086Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:31.269121Z","title":"Learn- ing to prompt for vision-language models","venue":null,"work_id":"1f1c08ab-60bb-4c78-b402-705b81e8f15d","year":2022},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:30.126140Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:12318503a2272fecb18c1827e59d124cc6e680c0d31a4169729fc05031966928","observation_id":"abf237a6-6657-46ff-8161-eaa9f78ebafb","resolution":{"observed_at":"2026-08-06T21:37:31.273491Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:30.694937Z","title":"FastText.zip: Compress- ing text classification models","venue":null,"work_id":"42e6a867-6a32-4299-8e43-9fca5872506c","year":2016},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:30.130492Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:3d6b9633273863e9ab2d2e57e5617808ba18ce36f59d16cc9464a4e8970a37a1","observation_id":"0fee4f5e-cf6d-415c-a3da-d8332fc03501","resolution":{"observed_at":"2026-08-06T21:37:30.699715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:30.679745Z","title":"Wikipedia2Vec: An Efficient Toolkit for Learning and Visual- izing the Embeddings of Words and Entities from Wikipedia","venue":null,"work_id":"c80f9608-6f48-4e00-aa10-67c3836f24be","year":2020},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:30.134583Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:21d87425db692cd2e5cf82800f3eaa06adee01b7ba6fa399a06c36a61a14f671","observation_id":"350e753a-4400-484b-ac1a-5eb67e9b7f73","resolution":{"observed_at":"2026-08-06T21:37:30.684776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:30.664545Z","title":"Glove: Global vectors for word representation","venue":null,"work_id":"4546090a-5f9d-4ef0-8d70-ce8f05295422","year":2014},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:30.138582Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:b8489473ef869c7344f411a7ed4be4f76c4374e195c6fcdde8a3e248c9015d97","observation_id":"c260c1fe-87de-4dca-9927-95eb05589038","resolution":{"observed_at":"2026-08-06T21:37:30.669294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:30.649089Z","title":"Clip-adapter: Bet- ter vision-language models with feature adapters","venue":null,"work_id":"12b5e582-1a69-4f48-8801-b98ba51ad6b5","year":2024},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:30.142734Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:2f463f45553df2bc86c111d9f2363d6ae7c240df33a1d489298cda0ff084e69a","observation_id":"57ce1808-9b63-465f-b022-496190804d30","resolution":{"observed_at":"2026-08-06T21:37:30.654120Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:30.633573Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":"d38d3475-d047-48c8-b565-d454ccb760de","year":2009},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:30.146701Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:1aac385e77227341aaabdd14fd875467994eac93b89576c92e547e521bcef1d7","observation_id":"6f27647e-a206-418b-8e45-9bf4f2bf7371","resolution":{"observed_at":"2026-08-06T21:37:30.638243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:30.618172Z","title":"Learning generative visual models from few training examples: An incremental bayesian approach tested on 101 object categories","venue":null,"work_id":"bde93e65-2af8-4e9f-8692-5dc63991fcd2","year":2004},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:30.151526Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:d7f96209756b6c2ead7462a9c7e38887ff6ff7f1402197861771ba7ccc4c8d8d","observation_id":"1b176023-3367-4a47-8ab1-0c7f44b3df28","resolution":{"observed_at":"2026-08-06T21:37:30.623077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:30.603392Z","title":"Cats and dogs","venue":null,"work_id":"7267b5e8-11c1-458e-b65d-115469f91396","year":2012},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:30.156617Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:59fc773dc5b4ad5ea0b2d71b3c2f4b201c8e74d1c0d3caaef1fdf415b09b4062","observation_id":"9a042d4f-8691-4172-b24d-3b4633719ce5","resolution":{"observed_at":"2026-08-06T21:37:30.608315Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:30.589289Z","title":"3d object representations for fine-grained cate- gorization","venue":null,"work_id":"0fd695da-eb2c-46e3-9228-6737b218efab","year":2013},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:30.160814Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:8a9b3045f0d8624ca989d5257ba033800a0aae341770787000572b2e24fec758","observation_id":"f7430805-a9f0-488d-8c1e-a8628d17988b","resolution":{"observed_at":"2026-08-06T21:37:30.593568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:30.574323Z","title":"Automated flower classification over a large number of classes","venue":null,"work_id":"6e87086b-fb3b-4980-8bf8-8fc4b23c028e","year":2008},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:30.164688Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:6ca35f3e32cb01e8edb9d2d5a290cb26c3aa6ab64c7eb07c66ab68ad75adf9cb","observation_id":"02f2ed06-dc1d-4303-9342-39a78b69ddd3","resolution":{"observed_at":"2026-08-06T21:37:30.578974Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:30.560979Z","title":"Food- 101–mining discriminative components with random forests","venue":null,"work_id":"d1e77bd8-9b81-496e-9d72-f4e2cec3d789","year":2014},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:30.168784Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:3fa0885d862b469bbe9cfae8f82c1f765585ca79b70f1f97443600ef41095b61","observation_id":"832a59e4-bc31-4c18-80db-fdf0f360847b","resolution":{"observed_at":"2026-08-06T21:37:30.565191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:30.546487Z","title":"Fine-grained visual classification of aircraft","venue":null,"work_id":"449a7f63-783a-4606-9b39-dc257cd90cce","year":2013},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:30.172939Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:d582d70f45df8f119090911a0655776e832971d31ecb299c7e8dabb5db085524","observation_id":"015b16ee-8ea4-4553-b6ba-443c9a3e154b","resolution":{"observed_at":"2026-08-06T21:37:30.551062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:30.532475Z","title":"Eurosat: A novel dataset and deep learning benchmark for land use and land cover clas- sification","venue":null,"work_id":"a47f5244-8e89-4247-b65e-a3129af5f415","year":2019},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:30.177505Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:b10ffc74a27df8625753484b79949e76138a926ca5acd32574b234d6f66d7e3a","observation_id":"2d800825-dc08-47ca-a7ad-ff67b1ac93c0","resolution":{"observed_at":"2026-08-06T21:37:30.537081Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:30.518050Z","title":"UCF101: A dataset of 101 human actions classes from videos in the wild","venue":null,"work_id":"7e0c44e4-568e-4484-8597-083c94b263dd","year":2012},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:30.181627Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:ac45969d0527e88bbbd4439d5c382c0eb8965cb977a11066e40225db405d778b","observation_id":"f6a0116f-583d-40f5-bfe6-51c21753d908","resolution":{"observed_at":"2026-08-06T21:37:30.522367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:30.503184Z","title":"Describing textures in the wild","venue":null,"work_id":"e49f33e3-e917-44b8-9165-8dd6a6e11451","year":2014},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:30.185820Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:39938e2f3c806cee174a7e6518b6b6bb9e3b7cf477e94d5f4bf75350f75e7c34","observation_id":"4f69ec35-4baf-462d-bb9e-77979fcc612c","resolution":{"observed_at":"2026-08-06T21:37:30.507329Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:30.488996Z","title":"Sun database: Large-scale scene recognition from abbey to zoo","venue":null,"work_id":"2d2ba389-44f6-4b97-902c-78dbeded909f","year":2010},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:30.190482Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:eb9f2f8594ccfc448d5f72a595078a516bf471027cb6b6421a905334787161b5","observation_id":"8cc07c26-2837-415e-a9fc-2cb61bfa1372","resolution":{"observed_at":"2026-08-06T21:37:30.493351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:30.473961Z","title":"Do imagenet classifiers generalize to ima- genet? In: ICML","venue":null,"work_id":"9f99d4fc-54c8-498a-8bce-9b717aa1bc7a","year":2019},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:30.194741Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:45488ea1e65119f80377c6cb6b11d4e81f7d6e36bdc27e6a61fd57738d29b6cd","observation_id":"3c50391b-a103-4d08-95b0-bca52642ed36","resolution":{"observed_at":"2026-08-06T21:37:30.478310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:30.459703Z","title":"Learning robust global representations by penalizing local predictive power","venue":null,"work_id":"2553d123-ba2a-4b15-bdf1-13a7d8e7c181","year":2019},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:30.198893Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:3ed614c0b3b43eb1b9e667fa1b90a1a84b0173c8d5db34e517a246d3f95c7c27","observation_id":"a86bfedb-ea4f-4ecd-adf1-076560e3ea95","resolution":{"observed_at":"2026-08-06T21:37:30.463982Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:30.444299Z","title":"Generating natural adversarial examples with universal perturbations for text classifi- cation","venue":null,"work_id":"3ff9bd0c-0415-4bcc-86fe-83c90c456c99","year":2022},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:30.203178Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:5ca0eea613f02c361eff645b0dcb64536252c1e8de051f7de5127586277c0357","observation_id":"d38aec91-3c1b-440e-a579-6897d1ddcc06","resolution":{"observed_at":"2026-08-06T21:37:30.449439Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:30.429653Z","title":"The many faces of robustness: A critical analysis of out-of- distribution generalization","venue":null,"work_id":"e7c5aea6-efae-4d4c-a380-365749dd8109","year":2021},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:30.207338Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:57ee98d54a5b4a7c627122d4bed645d56bedb62b1c61383a16428ff510b11b43","observation_id":"50480c85-a5d9-43cb-bb90-4759a3a55d65","resolution":{"observed_at":"2026-08-06T21:37:30.434073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:30.415006Z","title":"Self-regulating prompts: Foundational model adaptation without for- getting","venue":null,"work_id":"2dcb6420-620a-4402-8da2-c17667ed8d23","year":2023},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:30.211638Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:9135251ef8a3bf2bc8cbf316f54a3985af22ccf8128e523822e9951dfff045bf","observation_id":"cc3ac732-1f26-4196-9457-1185694f221f","resolution":{"observed_at":"2026-08-06T21:37:30.419746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:30.398902Z","title":"Prompt distribution learning","venue":null,"work_id":"04e333e2-76ab-4541-8e60-8a4dcb33afc4","year":2022},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:30.215822Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:2a029f5ad138289e33c4999b2a4669ac69f98cc17ec40418b1797415334b0a68","observation_id":"d2dddb92-a4f7-4687-8abe-2f0122007eba","resolution":{"observed_at":"2026-08-06T21:37:30.403407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:30.383682Z","title":"Black box few-shot adaptation for vision- language models","venue":null,"work_id":"3db66fab-ac76-4c22-92f2-1b0365c1d0d0","year":2023},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:30.220870Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:91d01e7a22aab15b06726c7f9c94037af0f8ca953a80dc461ef6b4b355dc7822","observation_id":"12256246-c546-4514-bd14-aa92e610ee22","resolution":{"observed_at":"2026-08-06T21:37:30.388579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"0050.6776","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:30.361755Z","title":"Read-only prompt optimization for vision- language few-shot learning","venue":null,"work_id":"46583d0a-abe8-4ecd-99e7-8bd281eb87b2","year":2023},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:30.225257Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:ec97dbfa2ec9e12bb08e51676a9de665efbfa653a8c6cfaacdf4e628de94ebdc","observation_id":"34bbdeb4-00de-4106-bb4a-63bd56f8f5e9","resolution":{"observed_at":"2026-08-06T21:37:30.372993Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models"},"reference_resolution":{"displayed":67,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":1,"verified_fuzzy":66},"total_outbound_references":67},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 67 of 67 outbound references and 1 inbound Pith citation observation for arXiv:2506.23856."}