{"as_of":"2026-08-21T15:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:aff5e920b5fd7771a5a55cfb530bcbc8e6f790ce368d18cfb535553bc8129f07","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T19:24:21.549089Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.09311/citation-record","integrity":"/paper/2509.09311/integrity","json":"/paper/2509.09311/citation-record.json","paper":"/paper/2509.09311"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2305.13035","last_updated":"2024-01-09T10:43:02Z","snapshot_observed_at":"2026-08-16T15:31:05.745618Z","submitted_at":"2023-05-22T13:39:28Z","title":"Getting ViT in Shape: Scaling Laws for Compute-Optimal Model Design","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13035","snapshot_observed_at":"2026-08-04T19:24:21.431803Z","title":"Get- ting vit in shape: Scaling laws for compute-optimal model design, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09311","last_updated":"2025-09-11T09:54:25Z","snapshot_observed_at":"2026-08-16T02:44:26.539551Z","submitted_at":"2025-09-11T09:54:25Z","title":"Image Recognition with Vision and Language Embeddings of VLMs","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T19:24:21.431803Z"},"links":{"cited_paper":"/paper/2305.13035","citing_paper":"/paper/2509.09311"},"observation_digest":"sha256:cb8a0a4f40f5bd44b677b94f73ea539a279fa2dc8f4d798bab60771f2622737d","observation_id":"9883c8b3-ce2f-4d7d-ba90-b22152ec868c","resolution":{"observed_at":"2026-08-04T19:24:21.431803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.07159","last_updated":"2020-06-12T13:17:25Z","snapshot_observed_at":"2026-08-15T10:22:52.364884Z","submitted_at":"2020-06-12T13:17:25Z","title":"Are we done with ImageNet?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.07159","snapshot_observed_at":"2026-08-04T19:24:21.435965Z","title":"Hénaff, Alexander Kolesnikov, Xiaohua Zhai, and Aäron van den Oord","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.09311","last_updated":"2025-09-11T09:54:25Z","snapshot_observed_at":"2026-08-16T02:44:26.539551Z","submitted_at":"2025-09-11T09:54:25Z","title":"Image Recognition with Vision and Language Embeddings of VLMs","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T19:24:21.435965Z"},"links":{"cited_paper":"/paper/2006.07159","citing_paper":"/paper/2509.09311"},"observation_digest":"sha256:ac451da6a3c9482d7496bbe123b2b645855825a718d33c5656ed8fc9da7fc951","observation_id":"79b454bc-263c-4864-bfb1-dc73f3bc623d","resolution":{"observed_at":"2026-08-04T19:24:21.435965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:24:21.439635Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2509.09311","last_updated":"2025-09-11T09:54:25Z","snapshot_observed_at":"2026-08-16T02:44:26.539551Z","submitted_at":"2025-09-11T09:54:25Z","title":"Image Recognition with Vision and Language Embeddings of VLMs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T19:24:21.439635Z"},"links":{"citing_paper":"/paper/2509.09311"},"observation_digest":"sha256:dc44ec9235d255f6af0c6eda6e1bf4b59077f6c4d37167545e284967d4a345c8","observation_id":"a130b777-9e34-4895-93cc-42df65db3df9","resolution":{"observed_at":"2026-08-04T19:24:21.439635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:24:21.443012Z","title":"Eva-02: A visual representation for neon genesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09311","last_updated":"2025-09-11T09:54:25Z","snapshot_observed_at":"2026-08-16T02:44:26.539551Z","submitted_at":"2025-09-11T09:54:25Z","title":"Image Recognition with Vision and Language Embeddings of VLMs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T19:24:21.443012Z"},"links":{"citing_paper":"/paper/2509.09311"},"observation_digest":"sha256:bb5170ee5ee9a0203c90f1e0e2dc61694f7a29d4486d0bc5e79f9eb248cc7e62","observation_id":"a158f1a2-b443-42da-a6ab-6d59617aef43","resolution":{"observed_at":"2026-08-04T19:24:21.443012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:24:21.446516Z","title":"Renovating names in open-vocabulary segmentation benchmarks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09311","last_updated":"2025-09-11T09:54:25Z","snapshot_observed_at":"2026-08-16T02:44:26.539551Z","submitted_at":"2025-09-11T09:54:25Z","title":"Image Recognition with Vision and Language Embeddings of VLMs","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T19:24:21.446516Z"},"links":{"citing_paper":"/paper/2509.09311"},"observation_digest":"sha256:ed9b557216226bf0edad7c4c790a651ce0a7a861c4f51aa41b84dfdb06f844fe","observation_id":"f82c2987-ceb4-48f8-b189-b0354759ffde","resolution":{"observed_at":"2026-08-04T19:24:21.446516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.07679","last_updated":"2025-02-09T15:03:08Z","snapshot_observed_at":"2026-08-12T11:03:33.917154Z","submitted_at":"2024-12-10T17:06:41Z","title":"RADIOv2.5: Improved Baselines for Agglomerative Vision Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.07679","snapshot_observed_at":"2026-08-04T19:24:21.450187Z","title":"Radiov2.5: Improved baselines for agglomerative vi- sion foundation models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09311","last_updated":"2025-09-11T09:54:25Z","snapshot_observed_at":"2026-08-16T02:44:26.539551Z","submitted_at":"2025-09-11T09:54:25Z","title":"Image Recognition with Vision and Language Embeddings of VLMs","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T19:24:21.450187Z"},"links":{"cited_paper":"/paper/2412.07679","citing_paper":"/paper/2509.09311"},"observation_digest":"sha256:3b778a6205382707627ca3417aedf9a4ad67cd2ee27bffe59a2d90eb2a2ccf60","observation_id":"fd80e3a1-1bf5-4e67-acb5-6911634527ee","resolution":{"observed_at":"2026-08-04T19:24:21.450187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:24:21.454305Z","title":"Openclip, July 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.09311","last_updated":"2025-09-11T09:54:25Z","snapshot_observed_at":"2026-08-16T02:44:26.539551Z","submitted_at":"2025-09-11T09:54:25Z","title":"Image Recognition with Vision and Language Embeddings of VLMs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T19:24:21.454305Z"},"links":{"citing_paper":"/paper/2509.09311"},"observation_digest":"sha256:fe1dd78dbbbb3e03bd117dbdfa05441a03a06297a537d26ad61144213dccb348","observation_id":"61a2475a-a115-4991-afc0-1744b5160b9a","resolution":{"observed_at":"2026-08-04T19:24:21.454305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:24:21.457434Z","title":"Berg, Wan-Yen Lo, Piotr Dollar, and Ross Girshick","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09311","last_updated":"2025-09-11T09:54:25Z","snapshot_observed_at":"2026-08-16T02:44:26.539551Z","submitted_at":"2025-09-11T09:54:25Z","title":"Image Recognition with Vision and Language Embeddings of VLMs","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T19:24:21.457434Z"},"links":{"citing_paper":"/paper/2509.09311"},"observation_digest":"sha256:634d4e2eda0a096667b38795834d2258cb10943b703d7b94e47289848a68a607","observation_id":"03b350dc-7bd6-48b1-b7df-0cdd057b1163","resolution":{"observed_at":"2026-08-04T19:24:21.457434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:24:21.462404Z","title":"Flaws of imagenet, computer vision’s favorite dataset","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09311","last_updated":"2025-09-11T09:54:25Z","snapshot_observed_at":"2026-08-16T02:44:26.539551Z","submitted_at":"2025-09-11T09:54:25Z","title":"Image Recognition with Vision and Language Embeddings of VLMs","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T19:24:21.462404Z"},"links":{"citing_paper":"/paper/2509.09311"},"observation_digest":"sha256:b338dce0fc628997ba319d3e177bbb5f55c201e15d56823d50cb40a447a70933","observation_id":"f61acd8f-110f-4bc2-83f9-bf00489db786","resolution":{"observed_at":"2026-08-04T19:24:21.462404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02915","last_updated":"2024-06-05T04:08:41Z","snapshot_observed_at":"2026-08-17T16:05:48.386981Z","submitted_at":"2024-06-05T04:08:41Z","title":"Visual-Text Cross Alignment: Refining the Similarity Score in Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02915","snapshot_observed_at":"2026-08-04T19:24:21.466174Z","title":"Visual- text cross alignment: Refining the similarity score in vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09311","last_updated":"2025-09-11T09:54:25Z","snapshot_observed_at":"2026-08-16T02:44:26.539551Z","submitted_at":"2025-09-11T09:54:25Z","title":"Image Recognition with Vision and Language Embeddings of VLMs","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T19:24:21.466174Z"},"links":{"cited_paper":"/paper/2406.02915","citing_paper":"/paper/2509.09311"},"observation_digest":"sha256:06f6552dabd2008f99dae13b75094f681fafaafb6b393b22a0d6f481151b4541","observation_id":"8ddf585f-62c6-434f-822c-ccb3333993be","resolution":{"observed_at":"2026-08-04T19:24:21.466174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:24:21.469313Z","title":"Visual instruction tuning,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09311","last_updated":"2025-09-11T09:54:25Z","snapshot_observed_at":"2026-08-16T02:44:26.539551Z","submitted_at":"2025-09-11T09:54:25Z","title":"Image Recognition with Vision and Language Embeddings of VLMs","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T19:24:21.469313Z"},"links":{"citing_paper":"/paper/2509.09311"},"observation_digest":"sha256:4e71b593bb8a2db76ff00461e6893f02abb34da3cbecf16b10394b58c6e5dadd","observation_id":"0070f8cf-d175-4caa-934d-1c5f9598f731","resolution":{"observed_at":"2026-08-04T19:24:21.469313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.14749","last_updated":"2021-11-07T13:04:04Z","snapshot_observed_at":"2026-08-21T01:55:59.409554Z","submitted_at":"2021-03-26T21:54:36Z","title":"Pervasive Label Errors in Test Sets Destabilize Machine Learning Benchmarks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.14749","snapshot_observed_at":"2026-08-04T19:24:21.475663Z","title":"Northcutt, Anish Athalye, and Jonas Mueller","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.09311","last_updated":"2025-09-11T09:54:25Z","snapshot_observed_at":"2026-08-16T02:44:26.539551Z","submitted_at":"2025-09-11T09:54:25Z","title":"Image Recognition with Vision and Language Embeddings of VLMs","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T19:24:21.475663Z"},"links":{"cited_paper":"/paper/2103.14749","citing_paper":"/paper/2509.09311"},"observation_digest":"sha256:6b91d995bacd1209fcf70839a6ff25f6a14643c0f5f43e89c5cc56866b363570","observation_id":"a1c85b76-e1e6-4e7f-b84f-3a570739fec6","resolution":{"observed_at":"2026-08-04T19:24:21.475663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:24:21.479479Z","title":"Chatgpt: Optimizing language models for dialogue, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.09311","last_updated":"2025-09-11T09:54:25Z","snapshot_observed_at":"2026-08-16T02:44:26.539551Z","submitted_at":"2025-09-11T09:54:25Z","title":"Image Recognition with Vision and Language Embeddings of VLMs","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T19:24:21.479479Z"},"links":{"citing_paper":"/paper/2509.09311"},"observation_digest":"sha256:f838ddd6e831300cae22fdf3b993eeba50c3bd4189a4179eca21727a4aee43d6","observation_id":"a15fc33b-2c4b-441a-abc2-ff9225f78a20","resolution":{"observed_at":"2026-08-04T19:24:21.479479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-17T13:03:40.359628Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-04T19:24:21.482265Z","title":"Dinov2: Learning robust visual features without supervision, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09311","last_updated":"2025-09-11T09:54:25Z","snapshot_observed_at":"2026-08-16T02:44:26.539551Z","submitted_at":"2025-09-11T09:54:25Z","title":"Image Recognition with Vision and Language Embeddings of VLMs","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T19:24:21.482265Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2509.09311"},"observation_digest":"sha256:92f2c6aa5c23ead1bb89d138ddfc032608356db615ca2ef992ee45d373471dac","observation_id":"f0fcf758-83ae-4563-850a-aaa7e5619bee","resolution":{"observed_at":"2026-08-04T19:24:21.482265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:24:21.485402Z","title":"Learning to name classes for vision and language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09311","last_updated":"2025-09-11T09:54:25Z","snapshot_observed_at":"2026-08-16T02:44:26.539551Z","submitted_at":"2025-09-11T09:54:25Z","title":"Image Recognition with Vision and Language Embeddings of VLMs","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T19:24:21.485402Z"},"links":{"citing_paper":"/paper/2509.09311"},"observation_digest":"sha256:1971c0bd7879dabe45d9317c029303a490b57c54f0c36f2f8881dad81e1f565c","observation_id":"540d8450-2e48-4db0-9e36-8ad336aebf26","resolution":{"observed_at":"2026-08-04T19:24:21.485402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00020","last_updated":"2021-02-26T19:04:58Z","snapshot_observed_at":"2026-07-06T10:45:03.059688Z","submitted_at":"2021-02-26T19:04:58Z","title":"Learning Transferable Visual Models From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00020","snapshot_observed_at":"2026-08-04T19:24:21.488592Z","title":"Learning transferable visual models from natural lan- guage supervision, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.09311","last_updated":"2025-09-11T09:54:25Z","snapshot_observed_at":"2026-08-16T02:44:26.539551Z","submitted_at":"2025-09-11T09:54:25Z","title":"Image Recognition with Vision and Language Embeddings of VLMs","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T19:24:21.488592Z"},"links":{"cited_paper":"/paper/2103.00020","citing_paper":"/paper/2509.09311"},"observation_digest":"sha256:99f125168f74603c92db970596a9005a1c6e6c26eba781c2086ed5229af8c613","observation_id":"878ad9ef-f2ab-48e1-8663-6300a301619d","resolution":{"observed_at":"2026-08-04T19:24:21.488592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1409.0575","last_updated":"2015-01-30T01:23:59Z","snapshot_observed_at":"2026-08-14T23:21:09.382166Z","submitted_at":"2014-09-01T22:29:38Z","title":"ImageNet Large Scale Visual Recognition Challenge","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1409.0575","snapshot_observed_at":"2026-08-04T19:24:21.491601Z","title":"Berg, and Li Fei-Fei","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2509.09311","last_updated":"2025-09-11T09:54:25Z","snapshot_observed_at":"2026-08-16T02:44:26.539551Z","submitted_at":"2025-09-11T09:54:25Z","title":"Image Recognition with Vision and Language Embeddings of VLMs","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T19:24:21.491601Z"},"links":{"cited_paper":"/paper/1409.0575","citing_paper":"/paper/2509.09311"},"observation_digest":"sha256:33676ba4e8467c3a0ed5c222ab54e36cd662683592189bf5c6c5f94abfd01e0d","observation_id":"7d8e7bdd-e8a1-4ef9-a9a0-4f0ddc0315b9","resolution":{"observed_at":"2026-08-04T19:24:21.491601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:24:21.494917Z","title":"Evaluating machine accuracy on ImageNet","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09311","last_updated":"2025-09-11T09:54:25Z","snapshot_observed_at":"2026-08-16T02:44:26.539551Z","submitted_at":"2025-09-11T09:54:25Z","title":"Image Recognition with Vision and Language Embeddings of VLMs","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T19:24:21.494917Z"},"links":{"citing_paper":"/paper/2509.09311"},"observation_digest":"sha256:76d5659a982ba7d60d18311ea4e4b8263cc82507c1560faf2503e9155bb0ddd6","observation_id":"cadf1b4e-088b-4dcc-a538-116ebe94679b","resolution":{"observed_at":"2026-08-04T19:24:21.494917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03555","last_updated":"2024-12-04T18:50:42Z","snapshot_observed_at":"2026-07-06T20:01:45.826971Z","submitted_at":"2024-12-04T18:50:42Z","title":"PaliGemma 2: A Family of Versatile VLMs for Transfer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03555","snapshot_observed_at":"2026-08-04T19:24:21.501065Z","title":"Paligemma 2: A family of versatile vlms for transfer, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09311","last_updated":"2025-09-11T09:54:25Z","snapshot_observed_at":"2026-08-16T02:44:26.539551Z","submitted_at":"2025-09-11T09:54:25Z","title":"Image Recognition with Vision and Language Embeddings of VLMs","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T19:24:21.501065Z"},"links":{"cited_paper":"/paper/2412.03555","citing_paper":"/paper/2509.09311"},"observation_digest":"sha256:c66c5255a7e0ec8ba4909d1744b9ee486379dafc563b8d8f503da7766e6e0958","observation_id":"f4258173-5baa-4ad9-9d49-88d1b5c7885f","resolution":{"observed_at":"2026-08-04T19:24:21.501065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:24:21.504476Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09311","last_updated":"2025-09-11T09:54:25Z","snapshot_observed_at":"2026-08-16T02:44:26.539551Z","submitted_at":"2025-09-11T09:54:25Z","title":"Image Recognition with Vision and Language Embeddings of VLMs","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T19:24:21.504476Z"},"links":{"citing_paper":"/paper/2509.09311"},"observation_digest":"sha256:730e105104ab4513421e5733fe3c2ffb105cd6163b28a89f3793f6080c451be1","observation_id":"0e3e8dc7-5b40-4a0c-8a6a-fb6ce18526d0","resolution":{"observed_at":"2026-08-04T19:24:21.504476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-08-14T18:15:53.516440Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-04T19:24:21.510846Z","title":"Gemini 1.5: Unlocking multimodal under- standing across millions of tokens of context, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09311","last_updated":"2025-09-11T09:54:25Z","snapshot_observed_at":"2026-08-16T02:44:26.539551Z","submitted_at":"2025-09-11T09:54:25Z","title":"Image Recognition with Vision and Language Embeddings of VLMs","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T19:24:21.510846Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2509.09311"},"observation_digest":"sha256:472a43a345d71a4d3ac6e5859b67707cf22b03e9835d07791ea16a3bba96f459","observation_id":"cb45ebac-444f-4468-9565-8b2156c2d286","resolution":{"observed_at":"2026-08-04T19:24:21.510846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-08-04T19:24:21.514128Z","title":"Siglip 2: Multilingual vision-language encoders with improved semantic understand- ing, localization, and dense features, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09311","last_updated":"2025-09-11T09:54:25Z","snapshot_observed_at":"2026-08-16T02:44:26.539551Z","submitted_at":"2025-09-11T09:54:25Z","title":"Image Recognition with Vision and Language Embeddings of VLMs","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T19:24:21.514128Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2509.09311"},"observation_digest":"sha256:14c9917acda9fc579dbc91220377e28afaa22b5d1750aad905e2a3ad188f3c9d","observation_id":"4966a22b-7840-4dbc-ab81-3d99222383a4","resolution":{"observed_at":"2026-08-04T19:24:21.514128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.11295","last_updated":"2020-05-22T17:39:16Z","snapshot_observed_at":"2026-08-10T15:42:53.621205Z","submitted_at":"2020-05-22T17:39:16Z","title":"From ImageNet to Image Classification: Contextualizing Progress on Benchmarks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.11295","snapshot_observed_at":"2026-08-04T19:24:21.517237Z","title":"From imagenet to image classification: Contextualizing progress on bench- marks, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.09311","last_updated":"2025-09-11T09:54:25Z","snapshot_observed_at":"2026-08-16T02:44:26.539551Z","submitted_at":"2025-09-11T09:54:25Z","title":"Image Recognition with Vision and Language Embeddings of VLMs","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T19:24:21.517237Z"},"links":{"cited_paper":"/paper/2005.11295","citing_paper":"/paper/2509.09311"},"observation_digest":"sha256:631b5736bcf40ea492bfaf8d7f45178169727038e6ad863586b802283a1f4888","observation_id":"6ccb2a77-e206-49d0-898d-6cd2b0d04462","resolution":{"observed_at":"2026-08-04T19:24:21.517237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.04596","last_updated":"2022-05-25T20:27:16Z","snapshot_observed_at":"2026-08-16T17:01:30.199600Z","submitted_at":"2022-05-09T23:25:45Z","title":"When does dough become a bagel? Analyzing the remaining mistakes on ImageNet","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.04596","snapshot_observed_at":"2026-08-04T19:24:21.520369Z","title":"When does dough become a bagel? analyzing the remaining mistakes on imagenet, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.09311","last_updated":"2025-09-11T09:54:25Z","snapshot_observed_at":"2026-08-16T02:44:26.539551Z","submitted_at":"2025-09-11T09:54:25Z","title":"Image Recognition with Vision and Language Embeddings of VLMs","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T19:24:21.520369Z"},"links":{"cited_paper":"/paper/2205.04596","citing_paper":"/paper/2509.09311"},"observation_digest":"sha256:93c415f33e4a28f5b5c193402466286e24b1eaea832d174c0f446c61ff5559e1","observation_id":"98fc8d27-3340-4fa4-b60e-9b4b440f9092","resolution":{"observed_at":"2026-08-04T19:24:21.520369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09215","last_updated":"2024-07-23T16:20:54Z","snapshot_observed_at":"2026-08-18T01:20:59.888556Z","submitted_at":"2023-11-15T18:56:51Z","title":"ConvNet vs Transformer, Supervised vs CLIP: Beyond ImageNet Accuracy","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.09215","snapshot_observed_at":"2026-08-04T19:24:21.523599Z","title":"Convnet vs transformer, supervised vs clip: Beyond imagenet accuracy","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09311","last_updated":"2025-09-11T09:54:25Z","snapshot_observed_at":"2026-08-16T02:44:26.539551Z","submitted_at":"2025-09-11T09:54:25Z","title":"Image Recognition with Vision and Language Embeddings of VLMs","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T19:24:21.523599Z"},"links":{"cited_paper":"/paper/2311.09215","citing_paper":"/paper/2509.09311"},"observation_digest":"sha256:3cda8f095e6c1c08b74c7f3eb4c302e49f55ab2d46ff4f3d5e44e6f0d4d20b7a","observation_id":"5c6f9b95-61e4-42ee-ba3e-65f622c2b323","resolution":{"observed_at":"2026-08-04T19:24:21.523599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:24:21.526595Z","title":"Pytorch image models","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.09311","last_updated":"2025-09-11T09:54:25Z","snapshot_observed_at":"2026-08-16T02:44:26.539551Z","submitted_at":"2025-09-11T09:54:25Z","title":"Image Recognition with Vision and Language Embeddings of VLMs","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T19:24:21.526595Z"},"links":{"citing_paper":"/paper/2509.09311"},"observation_digest":"sha256:21fd619ef56ea71ecfb089673b692ff8dfd412b3c11b377f7f5a48c6d616e7b8","observation_id":"e414068e-e0e8-4937-abf9-1501886f0e84","resolution":{"observed_at":"2026-08-04T19:24:21.526595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.04252","last_updated":"2020-06-19T17:36:57Z","snapshot_observed_at":"2026-08-15T20:19:29.272018Z","submitted_at":"2019-11-11T18:59:27Z","title":"Self-training with Noisy Student improves ImageNet classification","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.04252","snapshot_observed_at":"2026-08-04T19:24:21.529702Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.09311","last_updated":"2025-09-11T09:54:25Z","snapshot_observed_at":"2026-08-16T02:44:26.539551Z","submitted_at":"2025-09-11T09:54:25Z","title":"Image Recognition with Vision and Language Embeddings of VLMs","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T19:24:21.529702Z"},"links":{"cited_paper":"/paper/1911.04252","citing_paper":"/paper/2509.09311"},"observation_digest":"sha256:d469193b6c332affb2580adc04deea3e199e2c78b9d720f1620b989a611d276a","observation_id":"11799de6-8e27-453a-92f4-d13f1bc23230","resolution":{"observed_at":"2026-08-04T19:24:21.529702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:24:21.533090Z","title":"Leveraging cross-modal neigh- bor representation for improved clip classification","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09311","last_updated":"2025-09-11T09:54:25Z","snapshot_observed_at":"2026-08-16T02:44:26.539551Z","submitted_at":"2025-09-11T09:54:25Z","title":"Image Recognition with Vision and Language Embeddings of VLMs","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T19:24:21.533090Z"},"links":{"citing_paper":"/paper/2509.09311"},"observation_digest":"sha256:40d4977f14bd2e0fe522436d60adf65c6c9085dc0c135bc0ec5d8d66c4920cd0","observation_id":"9e96df1d-d9e6-4e7f-9663-d8f563d65d6d","resolution":{"observed_at":"2026-08-04T19:24:21.533090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:24:21.535869Z","title":"Sigmoid loss for language image pre-training, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09311","last_updated":"2025-09-11T09:54:25Z","snapshot_observed_at":"2026-08-16T02:44:26.539551Z","submitted_at":"2025-09-11T09:54:25Z","title":"Image Recognition with Vision and Language Embeddings of VLMs","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T19:24:21.535869Z"},"links":{"citing_paper":"/paper/2509.09311"},"observation_digest":"sha256:ed113475659455e0d96cafc6516fc216602a89e951507b9bece50b97f01a6df2","observation_id":"11bd0161-0444-46c4-a228-89f9118114e2","resolution":{"observed_at":"2026-08-04T19:24:21.535869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:24:21.538976Z","title":"Vision-language models for vision tasks: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09311","last_updated":"2025-09-11T09:54:25Z","snapshot_observed_at":"2026-08-16T02:44:26.539551Z","submitted_at":"2025-09-11T09:54:25Z","title":"Image Recognition with Vision and Language Embeddings of VLMs","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T19:24:21.538976Z"},"links":{"citing_paper":"/paper/2509.09311"},"observation_digest":"sha256:576b3f11504640e5bd326c2a26b238b1d3f0af06284f91bf5f356b145a1f3c1e","observation_id":"b6fc6248-da4c-4349-a485-ec227cf8cc84","resolution":{"observed_at":"2026-08-04T19:24:21.538976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:24:21.542732Z","title":"Tip-adapter: Training-free adaption of clip for few-shot classification","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.09311","last_updated":"2025-09-11T09:54:25Z","snapshot_observed_at":"2026-08-16T02:44:26.539551Z","submitted_at":"2025-09-11T09:54:25Z","title":"Image Recognition with Vision and Language Embeddings of VLMs","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T19:24:21.542732Z"},"links":{"citing_paper":"/paper/2509.09311"},"observation_digest":"sha256:3b13b825424ccaaae597c29dccd09d1c9cb8729d6d6a14826391603e55fc11a8","observation_id":"a6e85d05-2b34-4bf3-95a5-50a12d6426be","resolution":{"observed_at":"2026-08-04T19:24:21.542732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.05557","last_updated":"2022-10-06T11:52:39Z","snapshot_observed_at":"2026-08-20T04:20:07.821793Z","submitted_at":"2022-03-10T18:59:41Z","title":"Conditional Prompt Learning for Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.05557","snapshot_observed_at":"2026-08-04T19:24:21.545774Z","title":"Conditional prompt learning for vision-language models, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.09311","last_updated":"2025-09-11T09:54:25Z","snapshot_observed_at":"2026-08-16T02:44:26.539551Z","submitted_at":"2025-09-11T09:54:25Z","title":"Image Recognition with Vision and Language Embeddings of VLMs","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T19:24:21.545774Z"},"links":{"cited_paper":"/paper/2203.05557","citing_paper":"/paper/2509.09311"},"observation_digest":"sha256:da8ab4f6c59870a69ead3ae75aa3cd377c4f3db37feb95e672646aa4c617d641","observation_id":"0b041f9d-4f58-4ac6-bf92-e96c1a93d2fe","resolution":{"observed_at":"2026-08-04T19:24:21.545774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:24:21.549089Z","title":"{class name}","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.09311","last_updated":"2025-09-11T09:54:25Z","snapshot_observed_at":"2026-08-16T02:44:26.539551Z","submitted_at":"2025-09-11T09:54:25Z","title":"Image Recognition with Vision and Language Embeddings of VLMs","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T19:24:21.549089Z"},"links":{"citing_paper":"/paper/2509.09311"},"observation_digest":"sha256:a30743b07cf2feaf6e1c33f3226a70a3b7ce5df17e4272001f1ef79ade0b23f1","observation_id":"9172bc4a-4b87-486d-8d06-370a2c1e901a","resolution":{"observed_at":"2026-08-04T19:24:21.549089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.00298","last_updated":"2021-06-23T22:04:56Z","snapshot_observed_at":"2026-08-19T10:55:54.111071Z","submitted_at":"2021-04-01T07:08:36Z","title":"EfficientNetV2: Smaller Models and Faster Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.00298","snapshot_observed_at":"2026-08-04T19:24:21.507572Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09311","last_updated":"2025-09-11T09:54:25Z","snapshot_observed_at":"2026-08-16T02:44:26.539551Z","submitted_at":"2025-09-11T09:54:25Z","title":"Image Recognition with Vision and Language Embeddings of VLMs","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-04T19:24:21.507572Z"},"links":{"cited_paper":"/paper/2104.00298","citing_paper":"/paper/2509.09311"},"observation_digest":"sha256:8d7246c212b365c5119d15a5963cb033bcdd2998dba99cdd890c5a84f76cf918","observation_id":"1e4496f4-70f1-4cd2-ab1c-2ca998b2b319","resolution":{"observed_at":"2026-08-04T19:24:21.507572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-04T19:24:21.472351Z","title":"12 VOLKOV , KISEL, JANOUSKOV A, MA TAS: IMAGE RECOGNITION WITH VLMS","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09311","last_updated":"2025-09-11T09:54:25Z","snapshot_observed_at":"2026-08-16T02:44:26.539551Z","submitted_at":"2025-09-11T09:54:25Z","title":"Image Recognition with Vision and Language Embeddings of VLMs","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-04T19:24:21.472351Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2509.09311"},"observation_digest":"sha256:9aa1bd0d7ffce3fc4bc61e4b27b19b2e357ff17a8dc7f8d29ba6db44d37343d5","observation_id":"6c372c09-a47f-49c3-aefa-25cedcfdfc32","resolution":{"observed_at":"2026-08-04T19:24:21.472351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:24:21.498040Z","title":"URL https://proceedings.mlr.press/ v119/shankar20c.html","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.09311","last_updated":"2025-09-11T09:54:25Z","snapshot_observed_at":"2026-08-16T02:44:26.539551Z","submitted_at":"2025-09-11T09:54:25Z","title":"Image Recognition with Vision and Language Embeddings of VLMs","version":1},"reference_index":8644,"source":"pdf_text","source_observed_at":"2026-08-04T19:24:21.498040Z"},"links":{"citing_paper":"/paper/2509.09311"},"observation_digest":"sha256:1430cdbd10e3c454c6c0ef6389c88dc33737369ca62900cb20616ca42beddcea","observation_id":"c0db88a8-b69d-4bea-9f53-723bc2abef3f","resolution":{"observed_at":"2026-08-04T19:24:21.498040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.09311","last_updated":"2025-09-11T09:54:25Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T02:44:26.539551Z","submitted_at":"2025-09-11T09:54:25Z","title":"Image Recognition with Vision and Language Embeddings of VLMs"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":36,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 0 inbound Pith citation observations for arXiv:2509.09311."}