{"as_of":"2026-08-11T06:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cdea771cecf790823e4735672e664b2de86821ffdb0971f895e28a90685be1cc","coverage":[{"denominator":60,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":60,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T23:19:02.251395Z","state":"measured"},{"denominator":60,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":60,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.20682/citation-record","integrity":"/paper/2412.20682/integrity","json":"/paper/2412.20682/citation-record.json","paper":"/paper/2412.20682"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:02.849653Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":"3c7c7d5e-59b2-4cde-b286-8dd9b6bbaae2","year":2021},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-10T23:11:44.064277Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.062335Z"},"links":{"citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:b97896dbf461b624ba938b696687424af2e674f96154afcd1f0ea7a6c5065164","observation_id":"c6080f1f-968c-4258-abc4-92ad33c29ca7","resolution":{"observed_at":"2026-08-10T23:19:02.853203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:02.840583Z","title":"Scaling up visual and vision-language representation learning with noisy text supervision,","venue":null,"work_id":"65a3a66b-c1e3-402a-a0f0-354a27e0ca3c","year":2021},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-10T23:11:44.064277Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.067085Z"},"links":{"citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:0e6ca569313500a63a4b3de3ae8938001c72053ec40fe6e5290ee9e7a0fabaeb","observation_id":"24a9c0f8-f2fe-4376-a37e-59c0a3822ab3","resolution":{"observed_at":"2026-08-10T23:19:02.844441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:02.833606Z","title":"Sigmoid loss for language image pre-training,","venue":null,"work_id":"aeff6827-70ca-4da3-a83f-96a278fdb1be","year":2023},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-10T23:11:44.064277Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.070476Z"},"links":{"citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:028c1e0b128105284c559ac80551ee9f3a92d98134e626a97c42c4d5fe186f4f","observation_id":"1496bf16-a508-4a7d-9e0c-b9a0d8b127c3","resolution":{"observed_at":"2026-08-10T23:19:02.836193Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:02.824907Z","title":"Sgva-clip: Semantic- guided visual adapting of vision-language models for few-shot image classification,","venue":null,"work_id":"9ae64090-3a53-490e-ad08-458cdd33002a","year":2023},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-10T23:11:44.064277Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.074512Z"},"links":{"citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:f03128fdd28b7ad14355e31db00675cd57702ca8ccd125a0ef28d12b5ff9fe08","observation_id":"1d7dc89c-8759-4ea7-bd9f-7f6e10e24a54","resolution":{"observed_at":"2026-08-10T23:19:02.827397Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:02.816085Z","title":"Clip-vg: Self-paced curriculum adapting of clip for visual grounding,","venue":null,"work_id":"4492f863-a3f3-4ea3-a4f0-262c20fdc2ab","year":2023},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-10T23:11:44.064277Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.078024Z"},"links":{"citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:4dafc5d3a3dd70d196366386a8e69f5422ee1e2acfbfa3a9cab30e788836afb7","observation_id":"f125e2cf-d345-4ff8-8bf6-1d65bf841a07","resolution":{"observed_at":"2026-08-10T23:19:02.818810Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:02.805881Z","title":"Effective end-to-end vision language pre- training with semantic visual loss,","venue":null,"work_id":"6f561e14-f784-47a4-8920-410746a54d91","year":2023},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-10T23:11:44.064277Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.081342Z"},"links":{"citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:d710e20b63027429b6a906bdf995d3d365284b02ca4daea681fb32d9f8a50f59","observation_id":"4f0ff8ac-de93-4d10-bae8-4f677414e50c","resolution":{"observed_at":"2026-08-10T23:19:02.809768Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:02.796031Z","title":"Neural logic vision language explainer,","venue":null,"work_id":"57f888d3-5ecf-473e-8aa6-79216d5c9728","year":2024},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-10T23:11:44.064277Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.085792Z"},"links":{"citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:56d0b0b42b9e47befe402bfced989f6787c85b5e5abc914f10265479106240ea","observation_id":"39e2d1f9-77ae-45d4-8827-e40e13faa139","resolution":{"observed_at":"2026-08-10T23:19:02.799422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:02.785349Z","title":"Lovm: Language- only vision model selection,","venue":null,"work_id":"691004ce-3472-47f9-b420-f3955333cb0a","year":2024},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-10T23:11:44.064277Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.088657Z"},"links":{"citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:757188c7bcda1cf9c00f103c2612cf879950f05501208b6dc8c87fbc5544e91a","observation_id":"45f4ac16-7638-4079-96fe-a911d77bd1f4","resolution":{"observed_at":"2026-08-10T23:19:02.788305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13797","last_updated":"2025-05-18T16:13:47Z","snapshot_observed_at":"2026-07-06T17:47:51.284226Z","submitted_at":"2024-03-20T17:54:58Z","title":"Bridge the Modality and Capability Gaps in Vision-Language Model Selection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13797","snapshot_observed_at":"2026-08-10T23:19:02.092268Z","title":"Bridge the modality and capacity gaps in vision-language model selection,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-10T23:11:44.064277Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.092268Z"},"links":{"cited_paper":"/paper/2403.13797","citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:993041d79047659200ff6366318b85c6a9b01efccb9a13b2e3e61c8658e53a2a","observation_id":"ed98bd14-cf8f-4e55-a8c6-7b2f33da4b48","resolution":{"observed_at":"2026-08-10T23:19:02.092268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:02.096576Z","title":"Imagenet large scale visual recognition challenge,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-10T23:11:44.064277Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.096576Z"},"links":{"citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:984e8ba576f583d6a89d29262a9fb84f61cf9b35412236e74bf382b76f2dd551","observation_id":"a9663b70-939f-42e3-b691-b47a749e5d47","resolution":{"observed_at":"2026-08-10T23:19:02.096576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-10T23:19:02.099108Z","title":"Gpt-4 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-10T23:11:44.064277Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.099108Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:4f9cac2389952b25bded41ca27f5c667893ead65df8afc34ab01aaae507ffbbd","observation_id":"59c80df0-e92e-4a65-bf70-fb67a9d8e0d8","resolution":{"observed_at":"2026-08-10T23:19:02.099108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:02.773710Z","title":"Leveraging unlabeled data to predict out-of-distribution performance,","venue":null,"work_id":"68a6a046-e4d4-46c4-854f-9c1f4a74a5fe","year":2022},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-10T23:11:44.064277Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.102861Z"},"links":{"citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:b3b84c709d5e70675502c70f6e0b89469985d78c40e75d501a630364247fea27","observation_id":"a1291799-f858-46f5-b114-950b4b26af82","resolution":{"observed_at":"2026-08-10T23:19:02.776644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:02.765825Z","title":"Are labels always necessary for classifier accuracy evaluation?","venue":null,"work_id":"bcb5e95d-8ac2-4f29-840d-174fe6e47bf0","year":2021},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-10T23:11:44.064277Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.106942Z"},"links":{"citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:f264344dfc2fbb97bf54b7714800b4bf366be99b9620878782c63fe53370d376","observation_id":"a13c2413-be53-44db-b299-acae43f47066","resolution":{"observed_at":"2026-08-10T23:19:02.769117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:02.756629Z","title":"Predicting out-of- distribution error with the projection norm,","venue":null,"work_id":"29f9845c-32d7-4ee6-be04-f3d73a959a16","year":2022},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-10T23:11:44.064277Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.109667Z"},"links":{"citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:cdc6522503fab36f5f5861b37e04f73061decbb6d7cf1b39fe8e63994443b954","observation_id":"327ab1b6-d597-49f8-b18e-7b59a2ddeee1","resolution":{"observed_at":"2026-08-10T23:19:02.760868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:02.748837Z","title":"Data determines distributional robustness in contrastive language image pre-training (clip),","venue":null,"work_id":"54d937a8-bcba-4da6-8ed4-ec513a427da5","year":2022},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-10T23:11:44.064277Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.112361Z"},"links":{"citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:39cb33f4c8d20fd450db1e1c2071655315180838ccfec51999da243f6b423bc0","observation_id":"c3384c91-811e-458a-8cee-ce8ae80128a6","resolution":{"observed_at":"2026-08-10T23:19:02.752385Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:02.741642Z","title":"Does clip’s generalization performance mainly stem from high train- test similarity?","venue":null,"work_id":"0fe65da8-3f87-4dca-b420-020c70fd87f8","year":2024},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-10T23:11:44.064277Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.115218Z"},"links":{"citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:b4258628e8b6576ff7293ed9e935e2aab655a97ee1c1b8345ad9511d9a0320c1","observation_id":"18584f6a-cff5-4044-b263-60498db4077c","resolution":{"observed_at":"2026-08-10T23:19:02.744442Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.01874","last_updated":"2024-03-04T09:30:35Z","snapshot_observed_at":"2026-07-06T17:39:03.755444Z","submitted_at":"2024-03-04T09:30:35Z","title":"A Survey on Evaluation of Out-of-Distribution Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.01874","snapshot_observed_at":"2026-08-10T23:19:02.117741Z","title":"A survey on evaluation of out-of-distribution generalization,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-10T23:11:44.064277Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.117741Z"},"links":{"cited_paper":"/paper/2403.01874","citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:2a32b4a715902f99726e0fdc34b7376a460f22f00f7e77e2df9761be8a6b9212","observation_id":"3bde1082-2188-4a4f-a509-69890d4088ec","resolution":{"observed_at":"2026-08-10T23:19:02.117741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15231","last_updated":"2024-02-23T09:47:27Z","snapshot_observed_at":"2026-08-10T03:24:13.848913Z","submitted_at":"2024-02-23T09:47:27Z","title":"Which Model to Transfer? A Survey on Transferability Estimation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15231","snapshot_observed_at":"2026-08-10T23:19:02.120616Z","title":"Which model to transfer? a survey on transferability estimation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-10T23:11:44.064277Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.120616Z"},"links":{"cited_paper":"/paper/2402.15231","citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:77e9829a07f1013e8c9dd43aa74206da77a6f0dc3b3e9dd40a726d3cf8fa44a4","observation_id":"23247191-a828-4b72-9d61-913dc3761483","resolution":{"observed_at":"2026-08-10T23:19:02.120616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:02.732882Z","title":"Rankme: Assessing the downstream performance of pretrained self-supervised representations by their rank,","venue":null,"work_id":"41309b85-fdf1-4f95-b14d-e7568184032e","year":2023},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-10T23:11:44.064277Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.123697Z"},"links":{"citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:b3fdd72f5e88dc1bacdbec4230f1d4d9dcf39b04a1613d45a345a16cc56a3de6","observation_id":"67e21d47-42b9-47c7-841a-68ede3983428","resolution":{"observed_at":"2026-08-10T23:19:02.736740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:02.725000Z","title":"Identifying useful learnwares for heterogeneous label spaces,","venue":null,"work_id":"3bd00dbb-b375-4076-aec7-c6aa535dfe28","year":2023},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-10T23:11:44.064277Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.126635Z"},"links":{"citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:50bcb40587e7f5141fc2016b378c8a156a43bcf34e5fbb7a5045198a104b17dd","observation_id":"1a5b9b43-afd2-4f53-83e0-2523ef975313","resolution":{"observed_at":"2026-08-10T23:19:02.727669Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:02.717446Z","title":"Etran: Energy-based transferability estimation,","venue":null,"work_id":"b7a04c80-2a00-4f19-beeb-1ecfc5509953","year":2023},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-10T23:11:44.064277Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.129072Z"},"links":{"citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:ce4b81499eff678fc2f7fbbc29180f3ff1dd060700240b9cd89e501a432bb60d","observation_id":"bac8c173-40be-4e03-930c-158b51cd1e34","resolution":{"observed_at":"2026-08-10T23:19:02.720403Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:02.710983Z","title":"Predicting out-of-distribution error with confidence optimal transport,","venue":null,"work_id":"2ad39ca6-ab41-440b-b958-20e39c6f67a1","year":2023},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-10T23:11:44.064277Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.132874Z"},"links":{"citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:e62ae455742b39a9affe3e38cd207d05e35e18b43d757569f9bcec2c42d08692","observation_id":"27d233fe-7d78-4b5d-a545-499a6c8ed392","resolution":{"observed_at":"2026-08-10T23:19:02.713537Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:02.704078Z","title":"Data analysis and regression. a second course in statistics,","venue":null,"work_id":"000267f6-398b-4e79-b79a-27eb4fa9512d","year":1977},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-10T23:11:44.064277Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.136115Z"},"links":{"citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:bd3f0d6792761e352f13ff2a31287cec81cfa99b35d501ac66414b81a8ea944e","observation_id":"e3096a9c-fbdd-48cf-9bb4-7fa431d6cd33","resolution":{"observed_at":"2026-08-10T23:19:02.706480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:02.696154Z","title":"Tune it the right way: Unsupervised validation of domain adaptation via soft neighborhood density,","venue":null,"work_id":"e1faf778-ac1a-403e-95ff-088898184ca0","year":2021},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-10T23:11:44.064277Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.138546Z"},"links":{"citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:cb3229157521c68977428d94d23b75515bae0c6de4fa106ba7662ba04c2abec2","observation_id":"07e1f4b7-5bf3-4985-9975-d8648163fea9","resolution":{"observed_at":"2026-08-10T23:19:02.699122Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:02.686073Z","title":"Covariate shift adap- tation by importance weighted cross validation","venue":null,"work_id":"b63852a5-cdd6-4f36-b48b-5a058fe850ad","year":2007},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-10T23:11:44.064277Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.142516Z"},"links":{"citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:cf296552260564f8692c98fc4c7025723063a3f657ae110c6d8c10d34ed88c62","observation_id":"50eff583-92e6-4574-bb0a-40ebbff8ca86","resolution":{"observed_at":"2026-08-10T23:19:02.689740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:02.676986Z","title":"Towards accurate model selection in deep unsupervised domain adaptation,","venue":null,"work_id":"f170e7e1-dc81-4de1-9f7f-b7fd415e9a30","year":2019},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-10T23:11:44.064277Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.146091Z"},"links":{"citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:d140a980a6ab50db784524a6c66a41ab80b9f2869ff9c0efc3ec1cecd0a5b434","observation_id":"591eb3d8-46f2-42c8-9f10-df2da74637e7","resolution":{"observed_at":"2026-08-10T23:19:02.680320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:02.669041Z","title":"Stochastic gradient methods for dis- tributionally robust optimization with f-divergences,","venue":null,"work_id":"2f030ced-be9c-4b42-ad31-b1a7dd794d61","year":2016},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-10T23:11:44.064277Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.148593Z"},"links":{"citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:6ed5848353025027d78bc19522cec516b8cbfd7940c1d1e1c5cf26c1e0e48c39","observation_id":"7b35aab9-69dc-4412-a0f5-3156d5e7e5c2","resolution":{"observed_at":"2026-08-10T23:19:02.672181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.02893","last_updated":"2020-03-27T19:07:58Z","snapshot_observed_at":"2026-07-06T08:05:24.076802Z","submitted_at":"2019-07-05T15:26:26Z","title":"Invariant Risk Minimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.02893","snapshot_observed_at":"2026-08-10T23:19:02.151663Z","title":"Invariant risk minimization,","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-10T23:11:44.064277Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.151663Z"},"links":{"cited_paper":"/paper/1907.02893","citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:4276ecebd9782b232dd06ef1450555dc6c90e59a0169dbd6afa9c42cbe2c0785","observation_id":"add8cb75-5990-468f-ae31-0288f3206bb9","resolution":{"observed_at":"2026-08-10T23:19:02.151663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:02.660913Z","title":"Stable learning via sample reweighting,","venue":null,"work_id":"11c56542-d3ce-4721-8219-a19207230297","year":2020},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-10T23:11:44.064277Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.155701Z"},"links":{"citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:10a80e8fb18b591937513a854d57d50e275c81961a4b640fc3879a77785e35cf","observation_id":"4c547453-dc72-408a-92b8-62b718f6e057","resolution":{"observed_at":"2026-08-10T23:19:02.664007Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:02.652544Z","title":"A baseline for detecting misclassified and out-of-distribution examples in neural networks,","venue":null,"work_id":"8b2c4444-0232-43df-84f1-c8fccb3202fb","year":2017},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-10T23:11:44.064277Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.159008Z"},"links":{"citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:4020abd50f163a5c2d4c4c0a4112f5e5f928b8d858d5380fc329c72b24790789","observation_id":"a61de187-c254-4af9-8795-bcda9ebcb386","resolution":{"observed_at":"2026-08-10T23:19:02.655597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:02.644680Z","title":"What does rotation prediction tell us about classifier accuracy under varying testing environments?","venue":null,"work_id":"1dace6be-52b3-4be5-907f-7a40751a5d6e","year":2021},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-10T23:11:44.064277Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.161587Z"},"links":{"citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:61d85a8980e12325533ef57ed77c4574305dc7b780d6ef663b021d2523f22dd9","observation_id":"b578e508-0b05-421a-8fdb-39e58819caf8","resolution":{"observed_at":"2026-08-10T23:19:02.647830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:02.634880Z","title":"Agreement-on-the- line: Predicting the performance of neural networks under distribution shift,","venue":null,"work_id":"a4320117-9bfc-4d70-8ddd-3af8b730c8aa","year":2022},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-10T23:11:44.064277Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.164953Z"},"links":{"citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:889f7f13417ff1373c1c198b6e77f09a55b582a28f2e8f103d90f9402af0cfcf","observation_id":"42141123-3547-4e66-940d-9e732916013f","resolution":{"observed_at":"2026-08-10T23:19:02.637822Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:02.626670Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation,","venue":null,"work_id":"ce1d1622-8a63-4cf2-ac97-93b29f01fabc","year":2022},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-10T23:11:44.064277Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.168153Z"},"links":{"citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:21323d539053050a2b9f04477b3d18a1c21d213db0b97e6f081a8d18dbc68cff","observation_id":"69d6d889-6245-47ff-84ed-d09684bf3972","resolution":{"observed_at":"2026-08-10T23:19:02.630112Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:02.617941Z","title":"I. mathematical contributions to the theory of evolu- tion.—vii. on the correlation of characters not quantitatively measur- able,","venue":null,"work_id":"1858c40b-2464-47b9-bed4-bae7160a893d","year":1900},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-10T23:11:44.064277Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.171155Z"},"links":{"citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:51cb8a264975705e085843c156ce554c49509b1ec48770657047c26f7bea20ff","observation_id":"d0258e10-b13b-47bd-aa46-36d5a80fa574","resolution":{"observed_at":"2026-08-10T23:19:02.621254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:02.173527Z","title":"Learning multiple layers of features from tiny images,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-10T23:11:44.064277Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.173527Z"},"links":{"citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:9b58110070f56c31e1c21c7ae68f7af4ed3a2928c3a5fe8174fa33e0e030e79c","observation_id":"3a956975-6cb9-4cde-a6d6-06c8787a739b","resolution":{"observed_at":"2026-08-10T23:19:02.173527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:02.607852Z","title":"Cats and dogs,","venue":null,"work_id":"882dd088-6c6a-4259-84c4-b6ca32ccf04d","year":2012},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-10T23:11:44.064277Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.176231Z"},"links":{"citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:e40b92610820a96808fd48044a56f455e236946ff388b6409e116cb4da967787","observation_id":"7101e1b9-9972-4dd6-9fd8-8c9d9db1b391","resolution":{"observed_at":"2026-08-10T23:19:02.610138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:02.600733Z","title":"Automated flower classification over a large number of classes,","venue":null,"work_id":"2ecef7c0-5ca1-4504-81a0-b4fb8cdf27d5","year":2008},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-10T23:11:44.064277Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.178912Z"},"links":{"citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:aeaf5b7312e0164d585fcf4181d4070bf94a8515715abedf3608532ba368beca","observation_id":"2c700529-10b4-4c1e-8269-d91c1adf3467","resolution":{"observed_at":"2026-08-10T23:19:02.603200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:02.591175Z","title":"Reading digits in natural images with unsupervised feature learning,","venue":null,"work_id":"bec7c4b5-0f5f-48b0-9e2a-67a20e8dbe9c","year":2011},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-10T23:11:44.064277Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.181346Z"},"links":{"citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:79570c73c3b32042e91d6ca5971fdda68a4a66fa9f16f30c57e73eb6e57bdf48","observation_id":"ba33f10b-0d1f-43da-aa42-52ceab64c3e8","resolution":{"observed_at":"2026-08-10T23:19:02.595212Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:02.581957Z","title":"Detection of traffic signs in real-world images: The german traffic sign detection benchmark,","venue":null,"work_id":"23f06d70-0c27-4134-9e47-2e446228aa1e","year":2013},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-10T23:11:44.064277Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.185130Z"},"links":{"citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:0ae1d59ad10bc18be74940fd259d45cd71f9528b4501a6729cef4638253508ff","observation_id":"fc7e523e-c7f9-45ea-ac45-d9a27606758f","resolution":{"observed_at":"2026-08-10T23:19:02.585413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:02.572919Z","title":"Describing textures in the wild,","venue":null,"work_id":"aef616e6-9c11-4054-98f3-d3e254241efa","year":2014},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-10T23:11:44.064277Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.189062Z"},"links":{"citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:fd4f8c6440c5c59cbd9b3f027ed8a48c76fe483ef59e1d87a2e877be93ca5696","observation_id":"7ca0654a-f47a-4828-81f5-6b5bfc88c71a","resolution":{"observed_at":"2026-08-10T23:19:02.576201Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:02.563008Z","title":"Yfcc100m: The new data in multimedia research,","venue":null,"work_id":"5e66926a-33bb-4ac1-b04a-35c1c3ab2f2e","year":2016},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-10T23:11:44.064277Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.192584Z"},"links":{"citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:98f26298cf31ce8ab50eec86b6cf42cf7d8b64545d290ff2b4fcc2518e3fbefd","observation_id":"e08b47f2-ef10-484a-b07f-6fc1400b7c45","resolution":{"observed_at":"2026-08-10T23:19:02.566206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:02.550267Z","title":"Sun database: Large-scale scene recognition from abbey to zoo,","venue":null,"work_id":"c46b9754-31b6-47fb-8115-eb448c7e0655","year":2010},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-10T23:11:44.064277Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.198741Z"},"links":{"citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:564f81942681295ed2873d538bbe47ab3326bc2d67b2d0739910300e4a1403d2","observation_id":"0c4880aa-d471-4885-a240-66142a8a7251","resolution":{"observed_at":"2026-08-10T23:19:02.554864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:02.540618Z","title":"Gradient-based learning applied to document recognition,","venue":null,"work_id":"df127f1e-4ed6-4a7f-b5f8-03a048636091","year":1998},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-10T23:11:44.064277Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.201847Z"},"links":{"citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:dfe9f8a4ac86bbdfcefde63bb83f070426cfd885df6cded43834839111a529f8","observation_id":"2ad95db0-05d0-42b8-b66c-0ea03d373dca","resolution":{"observed_at":"2026-08-10T23:19:02.544234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:02.532013Z","title":"Challenges in representation learning: Facial expression recognition challenge,","venue":null,"work_id":"60e87541-4a1a-4194-8dca-dcc3a05a87c1","year":2013},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-10T23:11:44.064277Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.205503Z"},"links":{"citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:f09750c25b1ab4af0aa71bdf2d25f3fe87b01bdb7520a629451dfa616785bf2e","observation_id":"a387ba64-2dae-4eb9-a1ef-9d21e78f5e04","resolution":{"observed_at":"2026-08-10T23:19:02.535101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:02.523849Z","title":"On the importance of feature separability in predicting out-of-distribution error,","venue":null,"work_id":"ba98c4e2-bb52-4f79-9a3b-7cd1bc0dd446","year":2023},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-10T23:11:44.064277Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.209061Z"},"links":{"citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:c76a5fc318f5a23cdead6871d52b9b90f920dc3dc988effffd0a1b2fbe693282","observation_id":"45258e42-4956-4e3a-aa1a-87627e74055d","resolution":{"observed_at":"2026-08-10T23:19:02.527167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:02.513833Z","title":"Unsupervised representation learning by predicting image rotations,","venue":null,"work_id":"a2272396-500f-45a0-9ead-8b8814548429","year":2018},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-10T23:11:44.064277Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.212042Z"},"links":{"citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:b83ba8ff8cb8e90dd9ecc5a4ee6470e265d9b174dbbb3e83c368285f78d3d031","observation_id":"315a85bc-873d-463f-97c0-b37bf5325664","resolution":{"observed_at":"2026-08-10T23:19:02.517108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:02.467260Z","title":"The use of multiple measurements in taxonomic prob- lems,","venue":null,"work_id":"0369e585-7f21-469b-931c-a5dd89d759be","year":1936},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-10T23:11:44.064277Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.214634Z"},"links":{"citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:05c7b673ed7fe99527c314377708b3f4d952282ba128e41952fd2525b94fdcde","observation_id":"a88f3d46-786e-4e23-acdb-27219d5b6f06","resolution":{"observed_at":"2026-08-10T23:19:02.508560Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:02.217025Z","title":"Silhouettes: a graphical aid to the interpretation and validation of cluster analysis,","venue":null,"work_id":null,"year":1987},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-10T23:11:44.064277Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.217025Z"},"links":{"citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:776de6d7ebcaa279a4e52f991847226fb1a25c182732b5022511ff30d8914ff5","observation_id":"218e96b0-d58b-4d22-9b7a-d5f41067cfa0","resolution":{"observed_at":"2026-08-10T23:19:02.217025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:02.219537Z","title":"Deep residual learning for image recognition,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-10T23:11:44.064277Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.219537Z"},"links":{"citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:e126be2a2b1ffa9d4b7efbd3df2a35fa81e52017269ccbeaf606ef75c5a0d8f0","observation_id":"c39edd1e-2beb-494c-b54b-d9f797f5ae56","resolution":{"observed_at":"2026-08-10T23:19:02.219537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:02.386859Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":"c05e34dc-cbb8-487a-ab72-454af6c4acb9","year":2021},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-10T23:11:44.064277Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.222327Z"},"links":{"citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:88e05d125ed96340be2e54058f18319d11d3b94d9d6424a1d45fbb6285040d9a","observation_id":"7995dc37-9bf7-441f-b9fc-c302ac82e98e","resolution":{"observed_at":"2026-08-10T23:19:02.422639Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:02.378598Z","title":"A convnet for the 2020s,","venue":null,"work_id":"85f8e36d-924f-40a3-b9c9-3692fee603d6","year":2022},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-10T23:11:44.064277Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.225312Z"},"links":{"citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:c82227ca4fde4c0d4c7d0b07df2a05a6aff59d17810523fd39be8f719ce24927","observation_id":"119a2684-2c0c-439d-9f05-922bad6cc5cc","resolution":{"observed_at":"2026-08-10T23:19:02.382172Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:02.368939Z","title":"Laion-400m: Open dataset of clip-filtered 400 million image-text pairs,","venue":null,"work_id":"c6f8a196-ea6a-43a6-943d-a776ae878a35","year":2021},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-10T23:11:44.064277Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.227883Z"},"links":{"citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:4d7513b09abfb1bee6a2cfa77101234f133f61f2dc6620fc805a1b54fc60c736","observation_id":"675996f6-57fd-4a99-ae23-b26f0b48b90a","resolution":{"observed_at":"2026-08-10T23:19:02.372675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:02.357318Z","title":"AltCLIP: Altering the language encoder in CLIP for extended language capabilities,","venue":null,"work_id":"bf6c1f39-38a6-4537-a59b-f9501a7346c9","year":2023},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-10T23:11:44.064277Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.230309Z"},"links":{"citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:97cefc936c0ca9f347c278af279f88e1ce368f77d2c8f5a30b8ee65fa0fd9acb","observation_id":"82cc4b91-9e7e-4ad3-8f3c-c26e6c5d8102","resolution":{"observed_at":"2026-08-10T23:19:02.362356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:02.347505Z","title":"Groupvit: Semantic segmentation emerges from text supervision,","venue":null,"work_id":"ed5b7321-4e99-4fab-a223-339417450bbe","year":2022},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-10T23:11:44.064277Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.232910Z"},"links":{"citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:1beb7ce5cb7874a7af0ceff9a032bc925469bc3c974fab999648bfb12a7e9300","observation_id":"d7237b80-b802-4761-859c-448fcacc02af","resolution":{"observed_at":"2026-08-10T23:19:02.350740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00275","last_updated":"2023-02-01T06:44:07Z","snapshot_observed_at":"2026-08-08T23:49:53.662539Z","submitted_at":"2023-02-01T06:44:07Z","title":"Learning Generalized Zero-Shot Learners for Open-Domain Image Geolocalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00275","snapshot_observed_at":"2026-08-10T23:19:02.235754Z","title":"Learning generalized zero-shot learners for open-domain image geolocalization,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-10T23:11:44.064277Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.235754Z"},"links":{"cited_paper":"/paper/2302.00275","citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:ac3d1ce0a71f2fd59e0ccac746acc02e67a644e025f6eb328b0c8512479b73b2","observation_id":"a3b48329-45f1-4ab2-856a-bec9f04e4f0e","resolution":{"observed_at":"2026-08-10T23:19:02.235754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16671","last_updated":"2025-11-23T00:34:43Z","snapshot_observed_at":"2026-08-02T18:24:11.208164Z","submitted_at":"2023-09-28T17:59:56Z","title":"Demystifying CLIP Data","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16671","snapshot_observed_at":"2026-08-10T23:19:02.239160Z","title":"Demystifying clip data,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-10T23:11:44.064277Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.239160Z"},"links":{"cited_paper":"/paper/2309.16671","citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:d3e09fd3e7baa0498d6e6b53f6f3c3a67cb9f117051dac27f3b2262f483f4afc","observation_id":"b63e8fcc-ea48-4330-8d0f-23b2ae3a5fef","resolution":{"observed_at":"2026-08-10T23:19:02.239160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00915","last_updated":"2025-01-08T22:58:51Z","snapshot_observed_at":"2026-07-06T14:57:39.647497Z","submitted_at":"2023-03-02T02:20:04Z","title":"BiomedCLIP: a multimodal biomedical foundation model pretrained from fifteen million scientific image-text pairs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00915","snapshot_observed_at":"2026-08-10T23:19:02.242350Z","title":"Large-scale domain-specific pretraining for biomedical vision-language processing,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-10T23:11:44.064277Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.242350Z"},"links":{"cited_paper":"/paper/2303.00915","citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:e12d1ec58eb42dcf10749afb43f7d6d8cc6f9958515295c69ff31ed085fce2ba","observation_id":"8829e10d-c0a3-4c87-a026-2ede33fedede","resolution":{"observed_at":"2026-08-10T23:19:02.242350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11207","last_updated":"2025-01-13T18:16:34Z","snapshot_observed_at":"2026-08-10T06:53:04.408634Z","submitted_at":"2023-06-20T00:14:47Z","title":"Quilt-1M: One Million Image-Text Pairs for Histopathology","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.11207","snapshot_observed_at":"2026-08-10T23:19:02.245892Z","title":"Quilt-1m: One million image-text pairs for histopathology,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-10T23:11:44.064277Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.245892Z"},"links":{"cited_paper":"/paper/2306.11207","citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:ab7d78895476983355076a4828ae3e3e86b8b6ce345f9b1ecacc5c74d8096005","observation_id":"60cb4d52-1c1d-4b93-8581-ff0c846425f1","resolution":{"observed_at":"2026-08-10T23:19:02.245892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:02.338007Z","title":"BioCLIP: A vision foundation model for the tree of life,","venue":null,"work_id":"70d2d8d5-c297-4908-81fc-e8939709f549","year":2024},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-10T23:11:44.064277Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.248744Z"},"links":{"citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:4206fc8dcfe69baefc5db0a00c3366b547fca2399a08599ef176acdbef060ef9","observation_id":"8e2650a0-8233-468f-8cc3-09fc29526389","resolution":{"observed_at":"2026-08-10T23:19:02.341422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:02.327499Z","title":"Gpt-4: Generative pre-trained transformer,","venue":null,"work_id":"b9e7ef62-b03b-4613-8d9d-27f484f83bdd","year":2023},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-10T23:11:44.064277Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.251395Z"},"links":{"citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:50efae4305a2bcff0e238a565c7cfbcfc7f1a5ea2b44c0c3c57574fc3f159115","observation_id":"cb36a3e1-a99f-4dcc-8527-2511724e5102","resolution":{"observed_at":"2026-08-10T23:19:02.331857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T23:11:44.064277Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks"},"reference_resolution":{"displayed":60,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":0,"verified_fuzzy":47},"total_outbound_references":60},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 60 of 60 outbound references and 0 inbound Pith citation observations for arXiv:2412.20682."}