{"as_of":"2026-08-07T19:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f693d7b1693212ad9ee013ed25c0f2aca8321289c4e0e5ae20ffd627bf2e1fab","coverage":[{"denominator":67,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":67,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:00:31.793739Z","state":"measured"},{"denominator":67,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":67,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.09615/citation-record","integrity":"/paper/2507.09615/integrity","json":"/paper/2507.09615/citation-record.json","paper":"/paper/2507.09615"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T18:00:31.578274Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-06T17:49:19.839616Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.578274Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:132e0bf5fc39869bd33885e0e681c8ade7422bcd372b4f93c29e811e58f0e28b","observation_id":"79e205f0-ecce-4568-890a-16885b5f701d","resolution":{"observed_at":"2026-08-06T18:00:31.578274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:31.582097Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-06T17:49:19.839616Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.582097Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:e06bd5f6aea43244901f476a749bbf6f8e5de983f16b642207ec8ac3d0267da6","observation_id":"7b1fdebe-9eaa-493a-b054-f104ddbdb6d5","resolution":{"observed_at":"2026-08-06T18:00:31.582097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:48.129354Z","title":"Dpa: Dual prototypes alignment for unsupervised adaptation of vision-language models","venue":null,"work_id":"3ddb921d-c6bf-4576-9a93-83bd039dcc16","year":2025},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-06T17:49:19.839616Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.585637Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:f46d53dadf3050c756e22d71033f76837575e675f5dadb3b143da44f1df5f466","observation_id":"6a5415d6-04ea-45ee-8119-866eb49c6b1d","resolution":{"observed_at":"2026-08-06T18:00:48.132976Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-06T18:00:31.590153Z","title":"Layer normalization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-06T17:49:19.839616Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.590153Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:2dbf9ba2b1f9abfebab89f8f38cf133be2e213c15192d93508a49c6663d27b5b","observation_id":"cbd47111-fbb9-4fdb-8833-42cbeed3568d","resolution":{"observed_at":"2026-08-06T18:00:31.590153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:48.058783Z","title":"Food-101–mining discriminative components with random forests","venue":null,"work_id":"4dc3505e-318d-4360-beef-7a3e54811502","year":2014},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-06T17:49:19.839616Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.593840Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:a7201171f4e48fffc7b75420ea35c29f7ed86c4d6fb6df5aae1a5273f1dc4ade","observation_id":"a5512491-c663-4db5-ae11-20dedcfaf51f","resolution":{"observed_at":"2026-08-06T18:00:48.114909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:31.597300Z","title":"Lan- guage models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-06T17:49:19.839616Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.597300Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:8b213e9b96b098b07dffe60eccdf7043d16efd10f59e426f7b29070ba032326d","observation_id":"ace2ce56-843d-440d-b772-84807d0caf1e","resolution":{"observed_at":"2026-08-06T18:00:31.597300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:47.586545Z","title":"Emerg- ing properties in self-supervised vision transformers","venue":null,"work_id":"17cfd81c-fd3c-415a-9f5f-af5c1dd8a41c","year":2021},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-06T17:49:19.839616Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.600420Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:836471e0f35a0baa61e02b60ebd7b38f1ff11e72f9852c65a63473968b81a106","observation_id":"ed33b855-a438-4791-98d6-ce15d6803ed2","resolution":{"observed_at":"2026-08-06T18:00:47.971557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:40.555024Z","title":"Remote sens- ing image scene classification: Benchmark and state of the art","venue":null,"work_id":"2c2e6ea4-48b5-43ef-9196-1cb8b788085e","year":2017},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-06T17:49:19.839616Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.603507Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:070d8d92d1b8c75c89dcbf82a1e34c55f218c913946a9a97cee6bdc9ccf15b3c","observation_id":"485d8ceb-e661-4dd2-bc57-357f0385a646","resolution":{"observed_at":"2026-08-06T18:00:41.128504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:39.475883Z","title":"Distribution-aware prompt tuning for vision-language mod- els","venue":null,"work_id":"932a5508-64ec-429e-bac6-a05769da4da5","year":2023},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-06T17:49:19.839616Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.606726Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:6a6c4156c1f12fb21067fd6519b54b5f34cc25396f9a9d4a3d016dd8c04ec82a","observation_id":"92de0686-018a-4a4d-84fe-68d94dce94cb","resolution":{"observed_at":"2026-08-06T18:00:40.021432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:37.967783Z","title":"Describing textures in the wild","venue":null,"work_id":"f598ff28-e222-4e94-8738-52c051cf9f87","year":2014},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-06T17:49:19.839616Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.610582Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:ce04f03278f61938a2e8f1e2d844349e9912c077da4d0dfec6c04980e2ceee44","observation_id":"979bc9d2-d280-441d-82f4-54cb061b8e2a","resolution":{"observed_at":"2026-08-06T18:00:39.076639Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:37.377851Z","title":"Randaugment: Practical automated data augmen- tation with a reduced search space","venue":null,"work_id":"8b5a65af-2150-4b6f-a75e-27676da83473","year":2020},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-06T17:49:19.839616Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.613881Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:9e60c4951cbe445f4733b43d2d84ed6ee1509fe51a195caf9a593b85ff833748","observation_id":"394e09b0-237e-4daf-9234-c31d5cbc7a95","resolution":{"observed_at":"2026-08-06T18:00:37.621766Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:31.617017Z","title":"Improving clip training with language rewrites","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-06T17:49:19.839616Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.617017Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:ed2a6b2b84cf8c569a6044792993f8c2b6a6c62e7ec63fc143c30289b7e1f760","observation_id":"656a29f7-b13f-4c54-b155-8ca53831e369","resolution":{"observed_at":"2026-08-06T18:00:31.617017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:31.620299Z","title":"Learning gener- ative visual models from few training examples: An incre- mental bayesian approach tested on 101 object categories","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-06T17:49:19.839616Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.620299Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:a708134123e8da1fa952d2344ef628f0b65e5531d2fe50f808c64305bc000e8c","observation_id":"0f95cd84-16d6-4d58-8193-fa8802a1c336","resolution":{"observed_at":"2026-08-06T18:00:31.620299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:37.044420Z","title":"Gpt-3: Its nature, scope, limits, and consequences","venue":null,"work_id":"0a99194d-3740-4ed1-a366-b20dc3933bb9","year":2020},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-06T17:49:19.839616Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.623602Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:107da1b90a66e9835b7542c8718d0da804648606dfb6a13965ba9b03f829a549","observation_id":"65913c6e-e78a-4af6-96ef-91f519c03ee8","resolution":{"observed_at":"2026-08-06T18:00:37.162329Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:36.795849Z","title":"Perceptron-based learning algo- rithms","venue":null,"work_id":"f278d452-c67b-489c-96cf-3672620300e9","year":1990},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-06T17:49:19.839616Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.626521Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:7b206db4884ff7d43d6fda03885a228e1fa92fcae3f5b7bf23837a01f535bc57","observation_id":"70e8545d-9d3f-4954-8284-2763ee765e32","resolution":{"observed_at":"2026-08-06T18:00:36.922923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:36.599524Z","title":null,"venue":null,"work_id":"ab5acb5d-fb0b-4640-8f87-00f03d9752ee","year":2021},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-06T17:49:19.839616Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.629523Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:221e768af34196dcfad9d4aff9d4c709c41ab9462f3945451376c9c05e58fd64","observation_id":"79fed6b7-45ae-4068-a4ec-3f41f18ce05d","resolution":{"observed_at":"2026-08-06T18:00:36.697822Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:36.137367Z","title":"Open-vocabulary object detection via vision and language knowledge distillation","venue":null,"work_id":"9da68288-375a-489b-a2f9-9de3e758c657","year":2021},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-06T17:49:19.839616Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.632814Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:91024602f7577569f76c57a5c9c05659ddb8ce9799377895420a6237754764e6","observation_id":"f7c32b89-cd12-43fa-b1d7-32e9e4ea1092","resolution":{"observed_at":"2026-08-06T18:00:36.445314Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:35.364730Z","title":"Parameter-efficient model adaptation for vision transformers","venue":null,"work_id":"001f45d0-38a2-4a96-b892-46a5d94f6aa4","year":2023},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-06T17:49:19.839616Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.636225Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:722f1de03360a1909a6848fa61ae474bcd41f4527e0b1b2718d44a0d1e70390b","observation_id":"180fed66-0730-4a74-be02-6688e6159f84","resolution":{"observed_at":"2026-08-06T18:00:35.801606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:34.479601Z","title":"Eurosat: A novel dataset and deep learning benchmark for land use and land cover classification","venue":null,"work_id":"1dd95cff-fc1a-4627-870b-cecf19428ff2","year":2019},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-06T17:49:19.839616Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.639317Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:8a48c624fbf3223b2baa410e8f7ca3652481f39d6f550e9a4069effc0597a9f2","observation_id":"d048d510-6bd8-4160-81f9-df2b6e03d7f2","resolution":{"observed_at":"2026-08-06T18:00:34.909999Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:33.862832Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":"e1df650c-6b18-4b93-9685-00c0e4fb0c4f","year":null},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-06T17:49:19.839616Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.642414Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:8fb5a69f3ffac46e0b76a46d0294bdf06f05c68fdaa6e3a45796a0a37ae36535","observation_id":"1791a035-7e8b-4c1e-b104-74c4cb178305","resolution":{"observed_at":"2026-08-06T18:00:34.078815Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:33.538094Z","title":"Reclip: Refine contrastive language image pre-training with source free domain adaptation","venue":null,"work_id":"3b64ea41-3d06-4bb3-858a-7a36a20d3b0d","year":2024},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-06T17:49:19.839616Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.645861Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:9bebfccd37c4e5e660bedc6d57b293a5562d9e868e56e986cd4165eda7bbdbb1","observation_id":"7b719fc3-c289-45c4-b065-2079ba40adf1","resolution":{"observed_at":"2026-08-06T18:00:33.659160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:33.367141Z","title":null,"venue":null,"work_id":"59aecc1d-8d2d-441a-aca0-894bfc2b415b","year":null},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-06T17:49:19.839616Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.649283Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:a5d89c304c8006b387e7423110135781bca9374625b9f4809951660dcd12761f","observation_id":"fe4deb7d-5b2d-432e-b098-eb343015940b","resolution":{"observed_at":"2026-08-06T18:00:33.480601Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:33.240253Z","title":null,"venue":null,"work_id":"c77a246e-4f08-4880-b9db-88ef6a7af45f","year":null},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-06T17:49:19.839616Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.652124Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:d381e814c79c43401905f713cc779a07b2928ac7a857cd966eed16f1284eb5dc","observation_id":"56e7a5d4-43be-4891-b553-0aea7b719fe3","resolution":{"observed_at":"2026-08-06T18:00:33.310928Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:33.082011Z","title":"Adapting visual-language models for generalizable anomaly detection in medical im- ages","venue":null,"work_id":"3ae1c7dc-9296-46e4-823f-206ef22e713a","year":null},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-06T17:49:19.839616Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.655641Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:ccb36fc8813a1d111ea5e97558c3684670d831e14014988656e50a9d44bce66e","observation_id":"982c8e1c-d73d-4bad-97d6-b0c96d50782a","resolution":{"observed_at":"2026-08-06T18:00:33.150754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.03649","last_updated":"2022-08-22T08:45:33Z","snapshot_observed_at":"2026-07-06T12:57:58.716731Z","submitted_at":"2022-04-07T17:59:57Z","title":"Unsupervised Prompt Learning for Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.03649","snapshot_observed_at":"2026-08-06T18:00:31.658407Z","title":"Unsupervised prompt learning for vision-language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-06T17:49:19.839616Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.658407Z"},"links":{"cited_paper":"/paper/2204.03649","citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:69e43de0025d68674f48685849bd959d3c770ceb6342939de053a42a1d63cc9d","observation_id":"e5ba3e4d-2e7e-4bf6-bda4-1ead158abbc5","resolution":{"observed_at":"2026-08-06T18:00:31.658407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:32.929180Z","title":"Scaling up visual and vision-language representa- tion learning with noisy text supervision","venue":null,"work_id":"874e476a-adf3-4384-8ee4-2cec4d1a586a","year":null},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-06T17:49:19.839616Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.661594Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:a32343bde7246f8750e50158e025a18767742b50b089503314f89a7b37d9c653","observation_id":"a8602394-960a-46ab-b943-75eab1bb27e4","resolution":{"observed_at":"2026-08-06T18:00:32.963582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:32.756692Z","title":"Learning to prompt with text only supervision for vision- language models","venue":null,"work_id":"8214eb3c-f2fa-49b4-b3df-94ebde15d611","year":2025},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-06T17:49:19.839616Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.664429Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:980739e5dae82cd3f42c32177c2a82b09f9f9ffff25bd8ffa7c2fb488e7234bd","observation_id":"3bc2c75e-43fc-4222-b5cc-4ff9bf067757","resolution":{"observed_at":"2026-08-06T18:00:32.856613Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:32.638635Z","title":"Maple: Multi-modal prompt learning","venue":null,"work_id":"57afe1e0-3872-4a88-86f1-5eac80403006","year":2023},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-06T17:49:19.839616Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.668129Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:3c1edc4dfc916451944c33eb9267ef5ee8e7ee4b09f5aa0f087bc2bdf058ab70","observation_id":"74cbbb46-ca1f-49a6-9a47-751acf0b59ee","resolution":{"observed_at":"2026-08-06T18:00:32.717699Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:32.514256Z","title":"3d object representations for fine-grained categorization","venue":null,"work_id":"d3e5b0ae-8f8f-4198-805c-20148e5ad071","year":2013},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-06T17:49:19.839616Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.671469Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:eb479a1dea5a9b37b7e487a85eddf54ccae10a34f398acb313ab48d6aa2d9264","observation_id":"41bc28ee-386e-41c1-adfa-de32a484d263","resolution":{"observed_at":"2026-08-06T18:00:32.581788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:31.674245Z","title":"Learning multiple layers of features from tiny images","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-06T17:49:19.839616Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.674245Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:dfaa6c9f29ed86bacbc96a848c20bbdab493ae7ad8ded26815693f63583ef12c","observation_id":"6e63a22f-ad22-48f0-9b0a-38b2e67e4813","resolution":{"observed_at":"2026-08-06T18:00:31.674245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:32.440378Z","title":"Language-driven semantic seg- mentation","venue":null,"work_id":"2311780f-c203-461f-8585-e6a02491f7dc","year":2022},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-06T17:49:19.839616Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.677141Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:6b31ce46df5eaa1d21a1a5586b984c1486fa8abc2ceba5652b9d8bfb624490a1","observation_id":"d8a1f0da-c252-49c3-b750-fac5561df7fe","resolution":{"observed_at":"2026-08-06T18:00:32.458270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:31.679900Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-06T17:49:19.839616Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.679900Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:ca14a61a4c843e9c59e01e8e805f52f2b69f623f1a383e01e5177ad825b548d9","observation_id":"73579cf1-fa10-4bef-82b2-bd71be44c17f","resolution":{"observed_at":"2026-08-06T18:00:31.679900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:32.403506Z","title":"Visual-text cross alignment: Refining the similarity score in vision-language models","venue":null,"work_id":"cee94d32-5d06-4bbd-9faa-3eb4c9c6747e","year":2024},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-06T17:49:19.839616Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.682743Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:61a5a6d986217dd4fae6601517685fd2d5b466704e2e3f1f272982b9d8d6edc4","observation_id":"8faac6ef-67fe-46d0-beed-8d8329a52c20","resolution":{"observed_at":"2026-08-06T18:00:32.419435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:32.366884Z","title":"Masked unsupervised self-training for label-free image classifica- tion","venue":null,"work_id":"a7841cf8-4d36-4798-b16f-4b2b3b29dddb","year":null},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-06T17:49:19.839616Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.685585Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:f1288aa65bea3e1de6502d8564dc83cad66eb5671a25dc84c9e52f1f32f9a276","observation_id":"ed775e83-1abe-4f8a-bf21-b4af6b0d760e","resolution":{"observed_at":"2026-08-06T18:00:32.383725Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:31.689196Z","title":"Align before fuse: Vision and language representation learn- ing with momentum distillation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-06T17:49:19.839616Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.689196Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:662610fbc729973bdf5f720eea641dba4dd225d6602d2aa73767954a5d2a5fd7","observation_id":"7b0b31b6-7410-402c-b8b8-759db0e3a227","resolution":{"observed_at":"2026-08-06T18:00:31.689196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:32.328539Z","title":"Promptkd: Unsupervised prompt distillation for vision-language models","venue":null,"work_id":"a8e49ad8-cdb5-441b-9e2d-96ff7bbc1cf1","year":2024},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-06T17:49:19.839616Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.692163Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:ac540e58737bfcde52ff63abe4c19a447a257216a3fafb68b047f3d783ef41d6","observation_id":"ee1ea375-1198-4e30-b99b-9fb98566ba80","resolution":{"observed_at":"2026-08-06T18:00:32.343106Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:32.295122Z","title":"Clip is also an efficient segmenter: A text-driven approach for weakly supervised semantic segmentation","venue":null,"work_id":"93399390-0b75-4575-8c17-d606183c576e","year":2023},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-06T17:49:19.839616Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.695185Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:612e08d0b3e1a01ffb15642f45dffd093d91f1bd2b2ebaf849f5dc38c43b3eff","observation_id":"202df6ea-64c8-43f9-ac34-2dba144e4cbb","resolution":{"observed_at":"2026-08-06T18:00:32.308495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:32.262239Z","title":"Decoupled weight de- cay regularization","venue":null,"work_id":"d6c4a2b3-36df-43be-9c74-926757a4c0de","year":2017},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-06T17:49:19.839616Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.698095Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:23d2dffc94ee04cfaf4ba1cb18ebf2d7b47f2801a97ef0d2444fac5fe79ad14a","observation_id":"1827d0cd-f261-4640-a897-eb088f709497","resolution":{"observed_at":"2026-08-06T18:00:32.278601Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:31.701788Z","title":"Prompt distribution learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-06T17:49:19.839616Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.701788Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:4f63a3f4aab0bc8c16efa60984b4322b06cce5f83c2c49b13757bcf3cc6750b6","observation_id":"f32ab6fe-2a9f-49e3-a242-aa913b32d224","resolution":{"observed_at":"2026-08-06T18:00:31.701788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:32.224418Z","title":"Lafter: Label-free tuning of zero-shot clas- sifier using language and unlabeled image collections","venue":null,"work_id":"6e9326ce-7b75-4c30-9bf0-3a8571a76707","year":2023},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-06T17:49:19.839616Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.704735Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:3ed5a9f16dc8d1412a4c0d818c94d34e7361134c8ed18d5c49ca15101fa336d9","observation_id":"5cc4c2a8-7367-4246-ba86-bc7f4c10fefd","resolution":{"observed_at":"2026-08-06T18:00:32.237722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:32.190545Z","title":"Automated flower classification over a large number of classes","venue":null,"work_id":"37c0c834-432c-42b4-a51b-2e5533a0ad57","year":2008},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-06T17:49:19.839616Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.708317Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:32137e81e575512cc45d3e5cb828b204902221496047e9fe048be03241436828","observation_id":"5cfe96ac-acb1-4f57-901d-2d48338343be","resolution":{"observed_at":"2026-08-06T18:00:32.204964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:32.157108Z","title":"Valse: A task- independent benchmark for vision and language models cen- tered on linguistic phenomena","venue":null,"work_id":"1bb6f569-5c5a-46fb-8b44-d42675d7d859","year":2022},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-06T17:49:19.839616Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.711700Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:1ab7e3a64bd583f28b4e406c61f8bb55d322967e7bade57af07ec5c5b9cb0327","observation_id":"d10282c8-8334-4ede-bb57-6f4e2f9c17f1","resolution":{"observed_at":"2026-08-06T18:00:32.169214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:31.715225Z","title":"Cats and dogs","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-06T17:49:19.839616Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.715225Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:ec16d688499b8d55419c1f198df200c53fb6f25a4663d40efe25a5f9dbc39567","observation_id":"66825e8a-9afa-4745-999d-c6d0192393ca","resolution":{"observed_at":"2026-08-06T18:00:31.715225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:32.123996Z","title":"What does a platypus look like? generating customized prompts for zero-shot image classification","venue":null,"work_id":"be1bad14-0c39-4f8c-a736-2579b6938391","year":2023},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-06T17:49:19.839616Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.718576Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:f2a9a2ebd72d666d6d349aeea3fc5fadc559ceaa9916ddd6bd8cfa44b464c9a7","observation_id":"0038cdbd-f8e9-49ad-8985-3fbb38c1a255","resolution":{"observed_at":"2026-08-06T18:00:32.134732Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:32.103859Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":"107454fd-005a-4bcc-98f4-7192b596e953","year":2021},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-06T17:49:19.839616Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.721668Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:4f95268fae6c3f559ee8ee918cda7d7416286f9bce8b1a83821f00913b368c38","observation_id":"42624763-e39f-4487-9b18-9ba7fcc64e89","resolution":{"observed_at":"2026-08-06T18:00:32.109810Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:32.062610Z","title":"Flava: A foundational language and vision alignment model","venue":null,"work_id":"dcef7e87-4b2b-4c3e-a622-95894b98bc7a","year":2022},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-06T17:49:19.839616Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.724951Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:f72852ab42c31b49a617cfcc11e79e3efff34687c504be347ed5a894252be56a","observation_id":"b7b611f0-c2e0-48f8-90c4-d0129691857a","resolution":{"observed_at":"2026-08-06T18:00:32.078177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:32.028799Z","title":"Ucf101: A dataset of 101 human actions classes from videos in the wild","venue":null,"work_id":"650134c9-9a54-4692-85a5-cc78839baec9","year":2012},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-06T17:49:19.839616Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.727916Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:cccb94d9d3f0f601aad289790e165e1dc783eddf4e8e43554980f8b6240cecf5","observation_id":"56e30ede-9e7a-4366-b262-cc780a661c48","resolution":{"observed_at":"2026-08-06T18:00:32.043348Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:32.014412Z","title":"Pouf: Prompt-oriented unsupervised fine-tuning for large pre-trained models","venue":null,"work_id":"ca7e62d5-370b-482c-a2fc-fcc80ad98eda","year":2023},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-06T17:49:19.839616Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.730962Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:0f4e50de74f360450ac167b20a289c772aa642b192312812e5075130e10e022a","observation_id":"ff89abd8-f48f-4518-8880-349e63f980e7","resolution":{"observed_at":"2026-08-06T18:00:32.018115Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:32.006052Z","title":"Clip the gap: A single domain generalization approach for object detection","venue":null,"work_id":"e3454aa5-2f65-4505-83da-e94d4e3b0982","year":null},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-06T17:49:19.839616Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.734511Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:6c57e4a217131f280ecf824275f041d2b9f84ef6b758cfadc14a4674ca2b2ee9","observation_id":"d0953c9e-28d4-4b8b-b18c-539778e2fc56","resolution":{"observed_at":"2026-08-06T18:00:32.009428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:31.997337Z","title":"The caltech-ucsd birds-200-2011 dataset","venue":null,"work_id":"38982dc7-85c6-4950-97c6-0807a0a17be0","year":2011},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-06T17:49:19.839616Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.737504Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:1d01ffdd3d780f3d69c177873ed25801437225ee5f9928f32aa798926028a3e6","observation_id":"a694403d-ef77-4df9-8599-a5562d97768c","resolution":{"observed_at":"2026-08-06T18:00:32.000745Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:31.988471Z","title":"Tent: Fully test-time adaptation by entropy minimization","venue":null,"work_id":"e13590b5-8d14-489f-afd4-0e8ceb23e272","year":2021},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-06T17:49:19.839616Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.740497Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:702fd167674028e5f449e02ad96fbad6f2891e7ddef8b934192890fbfede72ee","observation_id":"9735b591-1b8d-423b-a5d9-d74a508b6b3b","resolution":{"observed_at":"2026-08-06T18:00:31.991474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:31.979887Z","title":"Debiased learning from naturally imbalanced pseudo-labels","venue":null,"work_id":"23419d8a-3c3b-47ae-907c-f0d2cad739a4","year":2022},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-06T17:49:19.839616Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.743685Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:3c4aec264c908437201a1e994758212eecdb00a0598f31fca4894f19ba8230a9","observation_id":"15261457-3c75-4e0e-9c5a-e5b7f855b58c","resolution":{"observed_at":"2026-08-06T18:00:31.983127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:31.971116Z","title":"Cora: Adapting clip for open-vocabulary detection with region prompting and anchor pre-matching","venue":null,"work_id":"827caa46-9e7a-4b82-80b3-7f8e564c25f7","year":2023},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-06T17:49:19.839616Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.746809Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:72b51dbade46c5f91ca919cf8c90514018ab4ee07dcb39b3d45d421185b2330d","observation_id":"9598e3ed-8a95-473a-83e3-4fa0267077cc","resolution":{"observed_at":"2026-08-06T18:00:31.974225Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:31.962492Z","title":"Aid: A benchmark data set for performance evaluation of aerial scene classification","venue":null,"work_id":"bbdfc0ac-d673-4bdb-831e-18aa879dfb3e","year":2017},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-06T17:49:19.839616Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.749883Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:defbdeec0c8b0b3f94a7bd51e81a7dece67f7dc46121ec19a06e4584e640702e","observation_id":"e6e5bd0e-d4e7-4196-9e9c-a8abc1cc1428","resolution":{"observed_at":"2026-08-06T18:00:31.965642Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:31.952097Z","title":"Sun database: Large-scale scene recognition from abbey to zoo","venue":null,"work_id":"28b54440-6121-4844-b827-a22cf95fb03b","year":2010},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-06T17:49:19.839616Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.753154Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:c39ac41a5c5352f82a6d8375213da2c441abd9266135d0fb29cdf400d9d6933d","observation_id":"279d2b8f-d5d3-4501-9fa3-1a38e5adba0d","resolution":{"observed_at":"2026-08-06T18:00:31.955970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16671","last_updated":"2025-11-23T00:34:43Z","snapshot_observed_at":"2026-08-02T18:24:11.208164Z","submitted_at":"2023-09-28T17:59:56Z","title":"Demystifying CLIP Data","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16671","snapshot_observed_at":"2026-08-06T18:00:31.755954Z","title":"Demystify- ing clip data","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-06T17:49:19.839616Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.755954Z"},"links":{"cited_paper":"/paper/2309.16671","citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:0616fcf9889e6a9e48da9c59e3445076469280b5bfaa4c1b4dff31b1dfa18771","observation_id":"5616dde8-9a62-406a-b7f2-097f2697f444","resolution":{"observed_at":"2026-08-06T18:00:31.755954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:31.943245Z","title":"Groupvit: Semantic segmentation emerges from text supervision","venue":null,"work_id":"744e1590-62b5-49e3-b536-370f2d0417a2","year":2022},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-06T17:49:19.839616Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.759535Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:ac4923e95cfbc795353c92c8ad0e0705121e9ea814bb7909d306bc94c9948baf","observation_id":"98575ec9-0d5f-47d7-9047-1a5703b2179c","resolution":{"observed_at":"2026-08-06T18:00:31.946697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:31.934081Z","title":"Lever- aging cross-modal neighbor representation for improved clip classification","venue":null,"work_id":"ebb277eb-821f-4bc9-b248-48c257555b4e","year":2024},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-06T17:49:19.839616Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.762821Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:213132475c6e7bef3938060d28c424b4af36f4889b0cac2c7f6b1f57fd8443fb","observation_id":"80e44ed2-8cdc-4f7d-aaf8-3bd1b58eb878","resolution":{"observed_at":"2026-08-06T18:00:31.937415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.11432","snapshot_observed_at":"2026-08-06T18:00:31.766827Z","title":"Florence: A new foundation model for computer vision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-06T17:49:19.839616Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.766827Z"},"links":{"cited_paper":"/paper/2111.11432","citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:67dcba6c3197622131deb1b18add08b627f4016cb34c4c2a7db5f7b0f1341b8a","observation_id":"defbc4fe-7c63-4deb-8414-e981028221de","resolution":{"observed_at":"2026-08-06T18:00:31.766827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:31.923563Z","title":"When and why vision- language models behave like bags-of-words, and what to do about it? In International Conference on Learning Repre- sentations, 2023","venue":null,"work_id":"66102c58-a210-4831-b340-fc9e1bdbc558","year":2023},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-06T17:49:19.839616Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.770741Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:835fe67ed22b695ce951c2b1a9d3561db485b42e967f1d88e43365f7183dafa3","observation_id":"5d1c9f41-27fe-4607-abed-98fd44903b6c","resolution":{"observed_at":"2026-08-06T18:00:31.927830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:31.914246Z","title":"Boost- ing vision-language models with transduction","venue":null,"work_id":"fccdd52f-d602-4958-8971-e6736e501790","year":null},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-06T17:49:19.839616Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.774760Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:6141ea759a73ee64317955cef74e119c85b7cdffa5a30765def6d6ccb3e8a58e","observation_id":"d70ea8bb-a120-44c6-8267-56cfe698725a","resolution":{"observed_at":"2026-08-06T18:00:31.918023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:31.904746Z","title":"Candidate pseudolabel learning: Enhancing vision-language models by prompt tuning with unlabeled data.International Conference on Machine Learning, 2024","venue":null,"work_id":"8250ce5e-5bb6-447e-8ce8-99da2dcfa033","year":2024},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-06T17:49:19.839616Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.777795Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:140fe6be9c957bdbeef7c48cde409975a0bd8ac5e728356e75643b0930c55275","observation_id":"07062fc6-0403-4b6c-a1d8-5293407d2482","resolution":{"observed_at":"2026-08-06T18:00:31.908386Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:31.895138Z","title":"Prompt, generate, then cache: Cascade of foundation models makes strong few-shot learners","venue":null,"work_id":"52bc29c9-755b-4d28-b58f-cad99f3128ac","year":2023},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-06T17:49:19.839616Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.780899Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:2d34a361c3dcd224ee5759e36458a4f63f9089f95c485017ba7d26f6ef8bc134","observation_id":"d1c336b6-34fc-4121-b33c-f8248c34c39e","resolution":{"observed_at":"2026-08-06T18:00:31.898969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:31.885216Z","title":"Mediclip: Adapting clip for few-shot medical image anomaly detection","venue":null,"work_id":"384d9029-76cc-467f-b65b-206d54c7fc4f","year":2024},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-06T17:49:19.839616Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.784147Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:1e5ce3dca101372906ea3b1914e1153462a940c8a20aecfade082b954a451de3","observation_id":"526443bb-fdc9-46f5-b5cb-5ee7bb89c047","resolution":{"observed_at":"2026-08-06T18:00:31.889355Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:31.787539Z","title":"Conditional prompt learning for vision-language mod- els","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-06T17:49:19.839616Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.787539Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:2c95683f04d4c5467d6a19faa55e64d6b1fde605c4d2e18536a08ae3f779be78","observation_id":"520e91b5-7b14-4a86-93d3-508d886d42b1","resolution":{"observed_at":"2026-08-06T18:00:31.787539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:31.790759Z","title":"Learning to prompt for vision-language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-06T17:49:19.839616Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.790759Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:cdc54f40ef3e06a58164fcbdeadcc237dd82c0bfff1c33a8685e1853a6cdac0f","observation_id":"3e64f725-ad24-4d13-b39a-14f9c4e3d653","resolution":{"observed_at":"2026-08-06T18:00:31.790759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:31.864540Z","title":"Not all features mat- ter: Enhancing few-shot clip with adaptive prior refinement","venue":null,"work_id":"878d6152-43bd-454f-99e4-516ce3f1c899","year":2023},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-06T17:49:19.839616Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.793739Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:3000000f8f8a5ffb783945f07e1e0fbf5b7b6bb86484878de65b4c301778bd2a","observation_id":"d3b6211f-cfaf-4675-b5c0-6eab7820fc98","resolution":{"observed_at":"2026-08-06T18:00:31.869263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T17:49:19.839616Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score"},"reference_resolution":{"displayed":67,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":19,"verified_exact":0,"verified_fuzzy":48},"total_outbound_references":67},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 67 of 67 outbound references and 0 inbound Pith citation observations for arXiv:2507.09615."}