{"as_of":"2026-08-07T23:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:40bffb2c7d46bb54a8c85bea9e580e869c2d390c97c70212aeb0740e99615925","coverage":[{"denominator":98,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":98,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:26:14.795852Z","state":"measured"},{"denominator":102,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":102,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-20T22:07:35.021986Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-20T22:09:07.132811Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-07T11:19:23.931052Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"cited_work":{"arxiv_id":"2506.02557","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02557","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kernel-based unsupervised embedding alignment for enhanced visual representation in vision- language models.arXiv preprint arXiv:2506.02557","venue":null,"work_id":"8af49f39-384f-4ad9-932b-9e17c1f299ca","year":2025},"citing_paper":{"arxiv_id":"2604.16678","last_updated":"2026-04-17T20:21:34Z","snapshot_observed_at":"2026-07-06T23:03:57.199731Z","submitted_at":"2026-04-17T20:21:34Z","title":"UniCon: Unified Framework for Efficient Contrastive Alignment via Kernels","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T08:32:36.729122Z"},"links":{"cited_paper":"/paper/2506.02557","citing_paper":"/paper/2604.16678"},"observation_digest":"sha256:ad26da87829820a28436c96e7e627a1e0ec8732a6df5875d4a842b2a9da03981","observation_id":"d62736ac-a819-41bb-a7c7-eb0abf546778","resolution":{"observed_at":"2026-05-10T08:32:52.003486Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-07T11:19:23.931052Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"cited_work":{"arxiv_id":"2506.02557","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02557","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kernel-based unsupervised embedding alignment for enhanced visual representation in vision- language models.arXiv preprint arXiv:2506.02557","venue":null,"work_id":"8af49f39-384f-4ad9-932b-9e17c1f299ca","year":2025},"citing_paper":{"arxiv_id":"2604.21343","last_updated":"2026-08-04T21:50:05Z","snapshot_observed_at":"2026-08-07T23:14:15.111758Z","submitted_at":"2026-04-23T06:58:08Z","title":"Latent Denoising Improves Visual Alignment in Large Multimodal Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-09T23:07:54.806529Z"},"links":{"cited_paper":"/paper/2506.02557","citing_paper":"/paper/2604.21343"},"observation_digest":"sha256:059a1b93c441a8347a4af4fc6d5e85d037c4b04ba89b37ecdadc19fc79b745b1","observation_id":"a3fff1ec-2d20-4ddc-ad54-cc96cf462af6","resolution":{"observed_at":"2026-05-09T23:09:26.700458Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-07T11:19:23.931052Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"cited_work":{"arxiv_id":"2506.02557","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02557","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kernel-based unsupervised embedding alignment for enhanced visual representation in vision- language models.arXiv preprint arXiv:2506.02557","venue":null,"work_id":"8af49f39-384f-4ad9-932b-9e17c1f299ca","year":2025},"citing_paper":{"arxiv_id":"2605.13161","last_updated":"2026-05-15T18:29:50Z","snapshot_observed_at":"2026-08-06T23:58:47.641580Z","submitted_at":"2026-05-13T08:24:55Z","title":"A$_3$B$_2$: Adaptive Asymmetric Adapter for Alleviating Branch Bias in Vision-Language Image Classification with Few-Shot Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-14T19:14:03.809826Z"},"links":{"cited_paper":"/paper/2506.02557","citing_paper":"/paper/2605.13161"},"observation_digest":"sha256:812a0ddb8b552868c1b1005735021931d8c8410aa12b77373636687291eaf011","observation_id":"5b84b43d-5e64-4629-a595-4b924cbc06b4","resolution":{"observed_at":"2026-05-14T19:17:51.075371Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-07T11:19:23.931052Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"cited_work":{"arxiv_id":"2506.02557","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02557","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kernel-based unsupervised embedding alignment for enhanced visual representation in vision- language models.arXiv preprint arXiv:2506.02557","venue":null,"work_id":"8af49f39-384f-4ad9-932b-9e17c1f299ca","year":2025},"citing_paper":{"arxiv_id":"2605.13161","last_updated":"2026-05-15T18:29:50Z","snapshot_observed_at":"2026-08-06T23:58:47.641580Z","submitted_at":"2026-05-13T08:24:55Z","title":"A$_3$B$_2$: Adaptive Asymmetric Adapter for Alleviating Branch Bias in Vision-Language Image Classification with Few-Shot Learning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-20T22:07:35.021986Z"},"links":{"cited_paper":"/paper/2506.02557","citing_paper":"/paper/2605.13161"},"observation_digest":"sha256:5c64e718882f07adc8d5d0fd04469bd1e838af1cb1fd21d826f4883df8a9967d","observation_id":"885178fa-8e7d-4394-a495-a60a3a927002","resolution":{"observed_at":"2026-05-20T22:09:07.135657Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.02557/citation-record","integrity":"/paper/2506.02557/integrity","json":"/paper/2506.02557/citation-record.json","paper":"/paper/2506.02557"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:13.076810Z","title":"Tallyqa: Answering complex counting questions","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-07T11:19:23.931052Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:13.076810Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:f8f0b65c6bf3b1a570801e5195ca3e536a25a5197a8488949d1efd89f0b77a64","observation_id":"4d16e6ee-d894-4bda-8dcc-7acfeb66ae2e","resolution":{"observed_at":"2026-08-07T11:26:13.076810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.09816","last_updated":"2023-02-15T10:01:31Z","snapshot_observed_at":"2026-08-06T18:01:31.723021Z","submitted_at":"2020-12-17T18:34:45Z","title":"Towards Understanding Ensemble, Knowledge Distillation and Self-Distillation in Deep Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.09816","snapshot_observed_at":"2026-08-07T11:26:13.168645Z","title":"and Li, Y","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-07T11:19:23.931052Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:13.168645Z"},"links":{"cited_paper":"/paper/2012.09816","citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:52b1f337a8c04c24987aad6e3e735fff0430eeec48acded649f36fcc766d6c52","observation_id":"9ac6405e-c393-4fe7-be5e-44e9302a72b6","resolution":{"observed_at":"2026-08-07T11:26:13.168645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:13.268183Z","title":"Multi-label cluster discrimination for visual representation learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-07T11:19:23.931052Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:13.268183Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:ba6faf67f325d33eb3d65621f0077dc03ba96031ebb64364c98f385282dc924a","observation_id":"5b8e08a7-39c5-472a-bf0b-f4305a43ef72","resolution":{"observed_at":"2026-08-07T11:26:13.268183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01390","last_updated":"2023-08-07T17:53:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-02T19:10:23Z","title":"OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01390","snapshot_observed_at":"2026-08-07T11:26:13.323907Z","title":"W., Ilharco, G., Wortsman, M., and Schmidt, L","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-07T11:19:23.931052Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:13.323907Z"},"links":{"cited_paper":"/paper/2308.01390","citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:05a6a9f162c378d630c914aa514bcb42f6fa97dcdd628a47b89b21c3439057d1","observation_id":"dd2aea2c-c9b9-4bd1-894b-5ac1d6191e03","resolution":{"observed_at":"2026-08-07T11:26:13.323907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-07T11:26:13.361069Z","title":"Qwen-vl: A versatile vision-language model for understanding, localization, text reading, and beyond","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-07T11:19:23.931052Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:13.361069Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:7f898791bc32dc54e6c90c6bd18bd7b1cc3a3a18cafd25ecffb292a6b5cf3d41","observation_id":"ae69c505-1c92-4049-8542-abc0a16de6f6","resolution":{"observed_at":"2026-08-07T11:26:13.361069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:13.366454Z","title":"BE it: BERT pre-training of image transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-07T11:19:23.931052Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:13.366454Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:a08f78024af5e5b088e6ec26de70ff4ff5b2ee4f801b99c1a2180d0f3e9ceb3c","observation_id":"93b3c931-1656-477b-91ee-e9678554b1ea","resolution":{"observed_at":"2026-08-07T11:26:13.366454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.01401","last_updated":"2021-01-14T05:36:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-01-04T15:25:26Z","title":"Demystifying MMD GANs","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.01401","snapshot_observed_at":"2026-08-07T11:26:13.372034Z","title":"J., Arbel, M., and Gretton, A","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-07T11:19:23.931052Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:13.372034Z"},"links":{"cited_paper":"/paper/1801.01401","citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:1b55f291a23061e0423e85fe0b174b20df0460e674112cd4f65aad2074e3fcf1","observation_id":"15631b84-da0c-4158-890f-8af4e5d2f0cf","resolution":{"observed_at":"2026-08-07T11:26:13.372034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:13.379895Z","title":"Domain prompt learning with quaternion networks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-07T11:19:23.931052Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:13.379895Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:8695f7db9945911ba83aa28e3e0669a8e8bc0f66becabb28ae01dbf34a0d73ec","observation_id":"687fedb5-d726-43a1-a2cd-2cb12ad73329","resolution":{"observed_at":"2026-08-07T11:26:13.379895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:13.388470Z","title":"Emerging properties in self-supervised vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-07T11:19:23.931052Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:13.388470Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:3e27bd27f9456041591bf3c271341e5b364b662d896e0b9b3e5b4bfca45884cd","observation_id":"18af799d-c07f-4a26-8766-b41a6ea96b33","resolution":{"observed_at":"2026-08-07T11:26:13.388470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-07T11:26:13.395742Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-07T11:19:23.931052Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:13.395742Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:203b799cd474472308230e1d0ee8e9bdeb0ca059c2f9297689da37025b104385","observation_id":"4ae0c78d-9be3-4ee3-84a6-54fc288609ed","resolution":{"observed_at":"2026-08-07T11:26:13.395742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:13.404320Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-07T11:19:23.931052Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:13.404320Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:af8cfcec013082d99c9e0895578bc61c92807075acd6ce90d07424009eed9caf","observation_id":"5bc761d1-b06c-4caa-a25b-ce9284b1b416","resolution":{"observed_at":"2026-08-07T11:26:13.404320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:13.413877Z","title":"Remote sensing image scene classification: Benchmark and state of the art","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-07T11:19:23.931052Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:13.413877Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:83bb83e6e2790da13f5d8091ea647f2acb585a73695dd703aac27f24545fc3e3","observation_id":"9aa90695-3be6-400e-943d-09083641276e","resolution":{"observed_at":"2026-08-07T11:26:13.413877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:13.424318Z","title":"Describing textures in the wild","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-07T11:19:23.931052Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:13.424318Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:e837bc74753a83ddd97762c7884f6972c64affcfc5918bf97d4a61221af63c6b","observation_id":"2bc4a2da-efac-488c-a0ec-b5892fa02b4a","resolution":{"observed_at":"2026-08-07T11:26:13.424318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:13.433254Z","title":"Locality alignment improves vision-language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-07T11:19:23.931052Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:13.433254Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:61136a02399c04d49fea20d77cd64f423138ae75ce33c78e935f767b13aefe12","observation_id":"01f684b7-2458-4e0c-844a-5c245287180d","resolution":{"observed_at":"2026-08-07T11:26:13.433254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:13.442273Z","title":"Vision transformers need registers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-07T11:19:23.931052Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:13.442273Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:a8587d0d32c36c67a2d009dd6a8f1fcd151c721520913715afd9b67dfeef9762","observation_id":"9ea5f798-9654-40d3-b615-2e300fe98c8e","resolution":{"observed_at":"2026-08-07T11:26:13.442273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.15593","last_updated":"2024-05-16T20:51:13Z","snapshot_observed_at":"2026-08-04T22:40:00.783785Z","submitted_at":"2024-03-22T19:41:26Z","title":"FairerCLIP: Debiasing CLIP's Zero-Shot Predictions using Functions in RKHSs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.15593","snapshot_observed_at":"2026-08-07T11:26:13.449072Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-07T11:19:23.931052Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:13.449072Z"},"links":{"cited_paper":"/paper/2403.15593","citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:a7454fe4298f431337c7e8c6d9c30656c6136fb34774463e61d00f3136784c7e","observation_id":"76f1de1f-3955-4271-956b-0e71f1f8478a","resolution":{"observed_at":"2026-08-07T11:26:13.449072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:13.458149Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-07T11:19:23.931052Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:13.458149Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:6ef616664ffd53b0c07f89cb41aff17a1d2c0b1d69285b428c778f779773a233","observation_id":"29001f20-7d10-4a44-aa2e-3a212bc2928b","resolution":{"observed_at":"2026-08-07T11:26:13.458149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17425","last_updated":"2023-11-06T02:47:51Z","snapshot_observed_at":"2026-07-06T16:25:38.571377Z","submitted_at":"2023-09-29T17:37:29Z","title":"Data Filtering Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17425","snapshot_observed_at":"2026-08-07T11:26:13.466593Z","title":"M., Jain, A., Schmidt, L., Toshev, A., and Shankar, V","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-07T11:19:23.931052Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:13.466593Z"},"links":{"cited_paper":"/paper/2309.17425","citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:9fcd1eca219c804187b97235b86ca83dbbac76cceb7bbac3f1ee1b89fc1e961c","observation_id":"0f19e8af-fdf4-4222-b513-e6808e566af5","resolution":{"observed_at":"2026-08-07T11:26:13.466593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:13.474213Z","title":"Learning generative visual models from few training examples: An incremental bayesian approach tested on 101 object categories","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-07T11:19:23.931052Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:13.474213Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:bb380a37f673a0a8612f931265c85f683a77c75ff71bc3c2379bfde62cf5c6f4","observation_id":"e1768fd8-cc1c-4a4b-8fb5-cac422a01f1c","resolution":{"observed_at":"2026-08-07T11:26:13.474213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02410","last_updated":"2023-07-02T22:58:51Z","snapshot_observed_at":"2026-08-07T23:25:34.011944Z","submitted_at":"2022-10-05T17:32:16Z","title":"The Vendi Score: A Diversity Evaluation Metric for Machine Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02410","snapshot_observed_at":"2026-08-07T11:26:13.482039Z","title":"and Dieng, A","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-07T11:19:23.931052Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:13.482039Z"},"links":{"cited_paper":"/paper/2210.02410","citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:711f1ef28b325d05d841f69fa03505cc38967a0c4762f439804d10142550979d","observation_id":"f27885c4-874f-4f66-80cd-ca21c6c67bfc","resolution":{"observed_at":"2026-08-07T11:26:13.482039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:13.489672Z","title":"Y., Ilharco, G., Fang, A., Hayase, J., Smyrnis, G., Nguyen, T., Marten, R., Wortsman, M., Ghosh, D., Zhang, J., et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-07T11:19:23.931052Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:13.489672Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:fcc7a5867f6d39b0f13fe495d74f124b2bf0b2d49fc4c328a7b1ae653febbefc","observation_id":"fe8321d5-a764-48b8-9d49-79270960917b","resolution":{"observed_at":"2026-08-07T11:26:13.489672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:13.498808Z","title":"Clip-adapter: Better vision-language models with feature adapters","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-07T11:19:23.931052Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:13.498808Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:11659fe7a3895fe2608dee7392795220a30904fcd67362facbd2d07c3ef13173","observation_id":"5e9ed5a2-454f-4ca2-afc6-0660046e0e4a","resolution":{"observed_at":"2026-08-07T11:26:13.498808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:13.507737Z","title":"3dsam-adapter: Holistic adaptation of sam from 2d to 3d for promptable tumor segmentation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-07T11:19:23.931052Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:13.507737Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:40db50f4140fd2099c386b61cfefc40c263f4c0883491f2c9cdbc05234b79acd","observation_id":"01bb1b83-88d7-447e-a6f6-e6d5055328d6","resolution":{"observed_at":"2026-08-07T11:26:13.507737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:13.514659Z","title":"Boosting the visual interpretability of clip via adversarial fine-tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-07T11:19:23.931052Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:13.514659Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:bd83270b488aae89fb067a795aa1942cf0ee8b92e45d69875bc6f4eb1feadf7c","observation_id":"1b00e8df-c653-435c-8b8a-207190ba5e94","resolution":{"observed_at":"2026-08-07T11:26:13.514659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:13.523302Z","title":"J., Erhan, D., Carrier, P","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-07T11:19:23.931052Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:13.523302Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:462bea3b21c616cf27cd869ac5644573e50f8312b7b3b484c3e8fb373003f250","observation_id":"d9c80418-3b83-47c1-9d71-9fe959274c87","resolution":{"observed_at":"2026-08-07T11:26:13.523302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:13.531936Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answering","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-07T11:19:23.931052Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:13.531936Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:da7f05e33e4c2dc8075a7b170da0f6997ab5af79d8c7b7228e89abb0720bb660","observation_id":"6930017c-288a-4408-b09a-498b9b8db2e4","resolution":{"observed_at":"2026-08-07T11:26:13.531936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:13.543285Z","title":"Recovering low-rank matrices from few coefficients in any basis","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-07T11:19:23.931052Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:13.543285Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:8a113cd219f09c8eb88b9c169bf860310a6a8aba61801db0cdfdfed907ac4e99","observation_id":"f2ecbac2-a02a-4822-91ae-6e21c4010444","resolution":{"observed_at":"2026-08-07T11:26:13.543285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:16.317070Z","title":"Llava-uhd: an lmm perceiving any aspect ratio and high-resolution images","venue":null,"work_id":"72c23a8a-0cfb-42dc-81c4-0259dfecc73f","year":2024},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-07T11:19:23.931052Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:13.551090Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:d0777fe1b4de0b17211e6478215fc3b51714cc34b439200222df539cdc1940f3","observation_id":"366ffc2e-2196-4e70-8d5f-1cc98c69c510","resolution":{"observed_at":"2026-08-07T11:26:16.322547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:13.559218Z","title":"J., Guo, A., Lin, C., Grauman, K., Luo, J., and Bigham, J","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-07T11:19:23.931052Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:13.559218Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:2139f0c0d7366d397b56eac1f5e12db654c6a3a0f34db8ddd5eeb0f05ec3071e","observation_id":"3a7fc68b-0e04-4eca-a9b0-df2e2203c2b7","resolution":{"observed_at":"2026-08-07T11:26:13.559218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:16.288284Z","title":"and Ozay, M","venue":null,"work_id":"1cce4c87-dcd5-4170-b8db-8f4a56411f95","year":2022},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-07T11:19:23.931052Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:13.569083Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:081557f6ec9c8c18bd28ff42fafd4f01d6443b23674da863350693429fdd9c72","observation_id":"b69abfb6-bd6c-44df-9b2b-e0d23c980b20","resolution":{"observed_at":"2026-08-07T11:26:16.293617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:13.577818Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-07T11:19:23.931052Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:13.577818Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:db796b65e515fffff5ff9bb1987d66a1d277ad306c1c114cffbb35753f7627a2","observation_id":"121c676e-fa5f-48ad-9c50-690fa20805bb","resolution":{"observed_at":"2026-08-07T11:26:13.577818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:16.256944Z","title":"Introducing eurosat: A novel dataset and deep learning benchmark for land use and land cover classification","venue":null,"work_id":"1de5cb4e-7c60-4e6c-a242-b5273142b0ac","year":2018},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-07T11:19:23.931052Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:13.585481Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:439cecbc29019309c0afa38bfef2675d9bbe9ac9dd098f80dfa8b2e7f6e9ecbd","observation_id":"2a254a0e-9dcf-4e16-949a-9b1c1abc6c1c","resolution":{"observed_at":"2026-08-07T11:26:16.263624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:16.239151Z","title":"Natural adversarial examples","venue":null,"work_id":"52284d61-ae33-4532-b414-6666b46bd857","year":2021},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-07T11:19:23.931052Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:13.594682Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:5f7f50438129fc7b0c612e6fe9996b6a41c73e81da047d365b51262a5947acf1","observation_id":"4d7b9426-0970-4aae-b9d7-3d9b4b0597f1","resolution":{"observed_at":"2026-08-07T11:26:16.245014Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:16.218091Z","title":"Probability inequalities for sums of bounded random variables","venue":null,"work_id":"af97c45c-a3bc-43c2-9b6e-e2e526f355db","year":1994},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-07T11:19:23.931052Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:13.603893Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:e646c6796cf595d04f70fac136f041f5d50662027a6107ac5e42cb31b65a7b01","observation_id":"cf580be8-ad12-443a-9c32-81712a0531de","resolution":{"observed_at":"2026-08-07T11:26:16.227681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:16.197156Z","title":null,"venue":null,"work_id":"0485fceb-bdeb-4082-a617-1489076ce5bd","year":2008},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-07T11:19:23.931052Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:13.611022Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:dfa8541e2216adf3ce0d1de26ce2ff5691a482efed0593065e0ec76d8608df61","observation_id":"4416e393-5b99-45c6-9ea9-dba6335057b2","resolution":{"observed_at":"2026-08-07T11:26:16.203710Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:13.622913Z","title":"J., yelong shen, Wallis, P., Allen-Zhu, Z., Li, Y., Wang, S., Wang, L., and Chen, W","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-07T11:19:23.931052Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:13.622913Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:2075cad8c36f54ab0deaf2e87e6fadbc0cf0d4692f1095bafcf5e9ffc098b072","observation_id":"dc363e2b-3006-4734-a536-73a19962b57a","resolution":{"observed_at":"2026-08-07T11:26:13.622913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:16.167053Z","title":"T., and Farnia, F","venue":null,"work_id":"c78a0e97-9818-4f05-921e-d40c8cf71a10","year":2023},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-07T11:19:23.931052Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:13.629823Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:4067a784e663f9eee817d72984972e912bd220816cd994ade8903e7e69d5e8e5","observation_id":"ec4452a5-ec39-44de-b667-91adde54424a","resolution":{"observed_at":"2026-08-07T11:26:16.171988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:16.149916Z","title":"T., and Farnia, F","venue":null,"work_id":"f1a6f4dd-0493-4103-9c7d-6b85f6895493","year":2024},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-07T11:19:23.931052Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:13.639656Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:d082d98fa0a689906328a2ddee6a7ae92155487461b74474d33a83ded14dfc6f","observation_id":"eae863a3-ed91-4854-9112-b5ceaa723332","resolution":{"observed_at":"2026-08-07T11:26:16.156234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08825","last_updated":"2024-03-08T02:49:12Z","snapshot_observed_at":"2026-08-06T19:26:27.412366Z","submitted_at":"2023-10-13T02:41:55Z","title":"From CLIP to DINO: Visual Encoders Shout in Multi-modal Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08825","snapshot_observed_at":"2026-08-07T11:26:13.676257Z","title":"From clip to dino: Visual encoders shout in multi-modal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-07T11:19:23.931052Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:13.676257Z"},"links":{"cited_paper":"/paper/2310.08825","citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:841c348113896f268f682ea38e2f33ceefd0b44f992948bf6892120938f47a58","observation_id":"dbba5313-2aad-4768-8d8a-e44aa9ffa657","resolution":{"observed_at":"2026-08-07T11:26:13.676257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:16.131375Z","title":"Clevr: A diagnostic dataset for compositional language and elementary visual reasoning","venue":null,"work_id":"0f483acb-b058-451c-aab7-a59b085f29f5","year":2017},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-07T11:19:23.931052Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:13.710170Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:9d11824042b12f787b6b8606f0f95eaa6ebe46ba21875143a154153bcecec860","observation_id":"206e2dba-54a7-45c6-8e8b-d3e48972387e","resolution":{"observed_at":"2026-08-07T11:26:16.137088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:16.113107Z","title":"What's ''up'' with vision-language models? investigating their struggle with spatial reasoning","venue":null,"work_id":"a152050b-a0e6-46d0-9fa7-9f87bbc8380b","year":2023},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-07T11:19:23.931052Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:13.745597Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:d4585b91cf2d26387f3397f12c3f39e6750f64728d38615d09fd3728bbf4b1c0","observation_id":"ad4df0c3-f888-4b8c-81b7-7cf62eae08cc","resolution":{"observed_at":"2026-08-07T11:26:16.118412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:13.769979Z","title":"Studiogan: A taxonomy and benchmark of gans for image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-07T11:19:23.931052Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:13.769979Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:40852c8e905d4e8c0f26b697c5b080e3ac2cccac89cd6416b33ee4d05406390e","observation_id":"bc348745-03d8-4a07-95c6-203ae6f6619c","resolution":{"observed_at":"2026-08-07T11:26:13.769979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:16.090774Z","title":"Referitgame: Referring to objects in photographs of natural scenes","venue":null,"work_id":"bf6aa123-f25d-48fe-99ff-620bd6aa5047","year":2014},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-07T11:19:23.931052Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:13.788031Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:c14f4197976e7d410870daa1ff220df1b3f1743b13086ddc5a88e2418f9ccbbb","observation_id":"e2a1764d-f340-4029-ab33-673f15dd52c5","resolution":{"observed_at":"2026-08-07T11:26:16.098644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:16.070817Z","title":"A diagram is worth a dozen images","venue":null,"work_id":"fedb54ba-8c95-4131-b30e-2d9ee346ebb3","year":2016},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-07T11:19:23.931052Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:13.814240Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:cf214c3dcb31219915dab32cbec2387588091de9b7d9e7aa2a74517f63391152","observation_id":"fd87e030-16f8-4a32-8da4-d7c713a2ebcb","resolution":{"observed_at":"2026-08-07T11:26:16.076987Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:16.052860Z","title":"The hateful memes challenge: Detecting hate speech in multimodal memes","venue":null,"work_id":"dc603fac-627d-43cf-b703-61a2f6e2a091","year":2020},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-07T11:19:23.931052Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:13.852337Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:cdf36f941c062a2dd7e3fa9552aaecaa7ea48e40af7466494b89a063c39e9416","observation_id":"1d4571e4-a51e-4c97-a34b-51d71ddfc5ed","resolution":{"observed_at":"2026-08-07T11:26:16.058144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:13.878916Z","title":null,"venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-07T11:19:23.931052Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:13.878916Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:c159851112e67d42d0189b859906482db4359a7f05a8a47db82dae02cf041c16","observation_id":"4f904f8d-1662-4281-94b0-c76d3ac765c4","resolution":{"observed_at":"2026-08-07T11:26:13.878916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:13.897490Z","title":"Learning multiple layers of features from tiny images","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-07T11:19:23.931052Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:13.897490Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:69b2aaee00c43d306a983b19007eb5b9171f6ff9ba32e8c87bcd79179ac3c1c3","observation_id":"da99cb35-99f2-40e9-b0d1-58ece4309242","resolution":{"observed_at":"2026-08-07T11:26:13.897490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:16.013091Z","title":"Clip benchmark: Clip-like model evaluation, 2022","venue":null,"work_id":"0479cf7e-c89a-471c-bb82-cdb8159164c2","year":2022},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-07T11:19:23.931052Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:13.931847Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:c80460c8deee94b3f182d0f6b632ceeafea03264e1a885fff9691dd0fdb88409","observation_id":"fdc3bc36-8274-4109-a257-e0b499b0d560","resolution":{"observed_at":"2026-08-07T11:26:16.019546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:13.958430Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-07T11:19:23.931052Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:13.958430Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:a315e54bd73e5040dc6f3b32efb26da8e66890c1194418bc213904075950ca47","observation_id":"986ea017-a1a9-423e-a162-80aa191b2015","resolution":{"observed_at":"2026-08-07T11:26:13.958430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:15.982085Z","title":"Transfer learning in computer vision tasks: Remember where you come from","venue":null,"work_id":"eb3534ee-a2ce-437e-93f2-66e9123e4687","year":2020},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-07T11:19:23.931052Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:13.985748Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:0602696b715ff6e0b8d1a3129071c5f6fa78974d8b6ebc576df02d8f67ab5775","observation_id":"ab00bb5c-ea22-4fe4-b469-420a53fd3470","resolution":{"observed_at":"2026-08-07T11:26:15.987195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:15.965606Z","title":"Evaluating object hallucination in large vision-language models","venue":null,"work_id":"072a9eeb-122c-4a00-9504-99f3b3b6ed01","year":2023},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-07T11:19:23.931052Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:14.022976Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:bb09ee463eb1abec9245b4a01ffbed36e891e87da833d37093afa9684077fa90","observation_id":"0e1a228a-284d-4834-acf0-c75ca3829e9a","resolution":{"observed_at":"2026-08-07T11:26:15.971091Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:14.058425Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-07T11:19:23.931052Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:14.058425Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:5ded77f0add90f8a9c239dd387b6eb2d2ce2d7647b9a4646bcb092b3b12ef932","observation_id":"b55b8aa9-9a3c-492d-85ad-173108fd5013","resolution":{"observed_at":"2026-08-07T11:26:14.058425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:15.937894Z","title":"Visual spatial reasoning","venue":null,"work_id":"7169488d-758f-4ffa-b0e3-09b7596a4368","year":2023},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-07T11:19:23.931052Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:14.093939Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:a85c5f9761664e5ddfa4694f55827aceff8709c71edc9b66c91bed51c9a4ce4a","observation_id":"941bbed5-eb97-4269-8ad7-47c1f58e61e1","resolution":{"observed_at":"2026-08-07T11:26:15.943536Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:14.130078Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-07T11:19:23.931052Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:14.130078Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:2cb0ad261782866452c8f907f22cc7f4962a23313d73dcd9cd60b53f14b7e279","observation_id":"95581358-a2dc-4a8f-8e01-5f39a1289963","resolution":{"observed_at":"2026-08-07T11:26:14.130078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-07T11:26:14.157884Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-07T11:19:23.931052Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:14.157884Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:781773725fd0c08bbf86fec42d0f5e32195437147a8c5456cab1a0a3dea644b4","observation_id":"ad658fa4-a1d9-4e11-88d2-2c6fa4d826b1","resolution":{"observed_at":"2026-08-07T11:26:14.157884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.07016","last_updated":"2023-04-21T17:08:27Z","snapshot_observed_at":"2026-08-02T07:43:21.690977Z","submitted_at":"2022-12-14T04:08:56Z","title":"Understanding Zero-Shot Adversarial Robustness for Large-Scale Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.07016","snapshot_observed_at":"2026-08-07T11:26:14.191544Z","title":"Understanding zero-shot adversarial robustness for large-scale models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-07T11:19:23.931052Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:14.191544Z"},"links":{"cited_paper":"/paper/2212.07016","citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:5299b33395511c5eb677325f9e1a67041f4ef6e851299008ac821791ffd19bba","observation_id":"2b9b5496-ad13-4cc1-b52b-2c82d1c81616","resolution":{"observed_at":"2026-08-07T11:26:14.191544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:14.214004Z","title":"Ok-vqa: A visual question answering benchmark requiring external knowledge","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-07T11:19:23.931052Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:14.214004Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:18793c5ba63c147f27a4dfd3d0e482e29dc0422876d7fa354b44ccbe32513559","observation_id":"97d40f26-43b0-4ba1-b6c8-bbf546f4a1d4","resolution":{"observed_at":"2026-08-07T11:26:14.214004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:14.234636Z","title":"Y., et al","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-07T11:19:23.931052Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:14.234636Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:ff462f08fd32976858b2a93f175826f497f5ba3eeb60aa44a56d38cdef5511b5","observation_id":"53d26859-b591-4ff0-8722-4807ae2a4770","resolution":{"observed_at":"2026-08-07T11:26:14.234636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:15.888167Z","title":"Dinov2: Learning robust visual features without supervision","venue":null,"work_id":"fa611790-5255-4373-a7ba-f4c51d716755","year":2024},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-07T11:19:23.931052Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:14.250170Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:3f16dd773127b2ef1df59f51c892df1be573ebf9bd720a4e0ff3189d94ceb29f","observation_id":"76527488-a35d-443a-aab9-e2a81759f282","resolution":{"observed_at":"2026-08-07T11:26:15.894122Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21719","last_updated":"2025-06-24T07:25:00Z","snapshot_observed_at":"2026-07-06T19:41:15.267950Z","submitted_at":"2024-10-29T04:19:41Z","title":"Do Vendi Scores Converge with Finite Samples? Truncated Vendi Score for Finite-Sample Convergence Guarantees","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21719","snapshot_observed_at":"2026-08-07T11:26:14.272780Z","title":"and Farnia, F","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-07T11:19:23.931052Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:14.272780Z"},"links":{"cited_paper":"/paper/2410.21719","citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:0c08749e9e88fa55c106c1313947a969c420119528b492f1e0fda20480443bf0","observation_id":"dcf1e64b-a01b-4377-bd5c-3489b89a64c3","resolution":{"observed_at":"2026-08-07T11:26:14.272780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18645","last_updated":"2025-08-03T06:19:26Z","snapshot_observed_at":"2026-07-06T20:12:59.152345Z","submitted_at":"2024-12-24T18:07:57Z","title":"Scendi Score: Prompt-Aware Diversity Evaluation via Schur Complement of CLIP Embeddings","version":3},"cited_work":{"arxiv_id":"2412.18645","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.18645","snapshot_observed_at":"2026-08-07T11:26:15.075739Z","title":"Scendi Score: Prompt-Aware Diversity Evaluation via Schur Complement of CLIP Embeddings","venue":"cs.CV","work_id":"efbc86d2-0202-4e95-afa6-c4af29d3c96b","year":2024},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-07T11:19:23.931052Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:14.289306Z"},"links":{"cited_paper":"/paper/2412.18645","citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:b1220aae0cda4ddf727791fe638254ce2b26944ebdee08777e9f6214e8fcb0f6","observation_id":"1a5fae69-ee38-41bc-b5dc-14c10c800486","resolution":{"observed_at":"2026-08-07T11:26:15.081496Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:15.869791Z","title":"Towards a scalable reference-free evaluation of generative models","venue":null,"work_id":"f0e2168f-263d-4155-b2e7-9975e83e8146","year":2024},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-07T11:19:23.931052Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:14.310303Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:6c7d98ff9cb0e3011d4837b98874eabf86d4a5fd7f6ff1ead2b6c942e25a0f60","observation_id":"74d19f35-21aa-471d-910a-247e7ee840c8","resolution":{"observed_at":"2026-08-07T11:26:15.875218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:15.852452Z","title":"M., Vedaldi, A., Zisserman, A., and Jawahar, C","venue":null,"work_id":"c232b0d6-9851-481b-8872-d3a9d38f0b3e","year":2012},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-07T11:19:23.931052Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:14.315818Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:a29d936fc759eda61e19e6f56d3a8a05a2f50c9cf000eb680358bb04373fe279","observation_id":"43bac356-ca4d-42a1-81aa-2d9b908b5fc7","resolution":{"observed_at":"2026-08-07T11:26:15.857821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:14.327491Z","title":"W., Hallacy, C., Ramesh, A., Goh, G., Agarwal, S., Sastry, G., Askell, A., Mishkin, P., Clark, J., et al","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-07T11:19:23.931052Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:14.327491Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:0a9778a428f88c1e14148d930e1dd3b5121e92778cdbdf4aef96c66ef813233b","observation_id":"2618be62-08dc-4987-b436-f6c8b8b33a5d","resolution":{"observed_at":"2026-08-07T11:26:14.327491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:15.821757Z","title":"Am-radio: Agglomerative vision foundation model reduce all domains into one","venue":null,"work_id":"6ba64ff3-31e7-4acc-89ae-899af5ddb9b7","year":2024},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-07T11:19:23.931052Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:14.337840Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:b8b728c816d2d80f1682408703a70ffe799af6dc2a906a6faec0ebfc489a4f94","observation_id":"36b7853d-b122-4b04-98f4-4a8a043db632","resolution":{"observed_at":"2026-08-07T11:26:15.828165Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.17622","last_updated":"2025-03-22T10:45:56Z","snapshot_observed_at":"2026-07-06T20:12:13.548098Z","submitted_at":"2024-12-23T14:48:17Z","title":"Be More Diverse than the Most Diverse: Optimal Mixtures of Generative Models via Mixture-UCB Bandit Algorithms","version":2},"cited_work":{"arxiv_id":"2412.17622","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.17622","snapshot_observed_at":"2026-08-07T11:26:15.051605Z","title":"Be More Diverse than the Most Diverse: Optimal Mixtures of Generative Models via Mixture-UCB Bandit Algorithms","venue":"cs.LG","work_id":"d5e5a225-d161-4fb9-9d26-46915e86704c","year":2024},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-07T11:19:23.931052Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:14.349429Z"},"links":{"cited_paper":"/paper/2412.17622","citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:b888fc2a216621abe234cba4bcbea6726ef22e47633fb24ab53995bf39052c08","observation_id":"918a3279-df71-4ef6-937d-790a1d9df14b","resolution":{"observed_at":"2026-08-07T11:26:15.058806Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:15.803677Z","title":"Improved zero-shot classification by adapting vlms with text descriptions","venue":null,"work_id":"d034fdb7-8900-4ff4-ae5a-9c0c2868483f","year":2024},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-07T11:19:23.931052Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:14.362400Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:d91d2709535ec302851c02c894acaa0f544975eae73c60060238f5b2e4135598","observation_id":"6ac9159c-f5d3-405d-81b3-fcf795583ee8","resolution":{"observed_at":"2026-08-07T11:26:15.809295Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.14108","last_updated":"2023-10-21T20:20:13Z","snapshot_observed_at":"2026-07-06T16:36:35.423639Z","submitted_at":"2023-10-21T20:20:13Z","title":"CLIP meets Model Zoo Experts: Pseudo-Supervision for Visual Enhancement","version":1},"cited_work":{"arxiv_id":"2310.14108","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.14108","snapshot_observed_at":"2026-08-07T11:26:15.029417Z","title":"CLIP meets Model Zoo Experts: Pseudo-Supervision for Visual Enhancement","venue":"cs.LG","work_id":"b2004c85-0b70-4f90-be20-d3121b063902","year":2023},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-07T11:19:23.931052Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:14.375483Z"},"links":{"cited_paper":"/paper/2310.14108","citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:a14b063c28f436f3be34190d43039de76ac43a2ca2531f861dcc85635804f0ef","observation_id":"4e5c131a-6d20-4eff-b873-ca932678061f","resolution":{"observed_at":"2026-08-07T11:26:15.035097Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12336","last_updated":"2024-06-05T15:32:03Z","snapshot_observed_at":"2026-07-06T17:32:24.161667Z","submitted_at":"2024-02-19T18:09:48Z","title":"Robust CLIP: Unsupervised Adversarial Fine-Tuning of Vision Embeddings for Robust Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12336","snapshot_observed_at":"2026-08-07T11:26:14.409174Z","title":"D., Croce, F., and Hein, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-07T11:19:23.931052Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:14.409174Z"},"links":{"cited_paper":"/paper/2402.12336","citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:4fd15ce71f8584ac54c74323caa69ede0bbce98a53e7c6b174f0160f3d38d08d","observation_id":"ebf584df-d99f-4edd-a28a-dc9ee716d36c","resolution":{"observed_at":"2026-08-07T11:26:14.409174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12709","last_updated":"2024-07-17T16:31:38Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T16:31:38Z","title":"MoME: Mixture of Multimodal Experts for Generalist Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12709","snapshot_observed_at":"2026-08-07T11:26:14.425638Z","title":"Mome: Mixture of multimodal experts for generalist multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-07T11:19:23.931052Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:14.425638Z"},"links":{"cited_paper":"/paper/2407.12709","citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:fd410dfe3724fa373c34884d4c001007c1fe99f26dffab8ccf8422b08c2a6ced","observation_id":"b6b6a7b7-2294-4b70-ba5a-04f1a26dbd1c","resolution":{"observed_at":"2026-08-07T11:26:14.425638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07604","last_updated":"2024-03-15T08:42:39Z","snapshot_observed_at":"2026-07-06T16:46:57.403995Z","submitted_at":"2023-11-11T05:40:54Z","title":"Finetuning Text-to-Image Diffusion Models for Fairness","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07604","snapshot_observed_at":"2026-08-07T11:26:14.450325Z","title":"Finetuning text-to-image diffusion models for fairness","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-07T11:19:23.931052Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:14.450325Z"},"links":{"cited_paper":"/paper/2311.07604","citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:43e0c36d49e2caacd7a7d74ca420f30d81963ec210bd9c419c099a12441e8573","observation_id":"73f02e0a-268b-47b9-8f9d-0ec95bc9ce56","resolution":{"observed_at":"2026-08-07T11:26:14.450325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15998","last_updated":"2025-03-02T23:41:37Z","snapshot_observed_at":"2026-07-06T19:07:16.252072Z","submitted_at":"2024-08-28T17:59:31Z","title":"Eagle: Exploring The Design Space for Multimodal LLMs with Mixture of Encoders","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15998","snapshot_observed_at":"2026-08-07T11:26:14.486555Z","title":"Eagle: Exploring the design space for multimodal llms with mixture of encoders","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-07T11:19:23.931052Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:14.486555Z"},"links":{"cited_paper":"/paper/2408.15998","citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:745a4177c344083a66dfc158583ec78812e211b2e8690f8e4c069ce7c3fa3078","observation_id":"5efff50b-5682-40c5-b5d9-0ed382beb549","resolution":{"observed_at":"2026-08-07T11:26:14.486555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:14.514075Z","title":"Towards vqa models that can read","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-07T11:19:23.931052Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:14.514075Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:ca7a4f706728adc989a870ba466c4a25d8a0d635286d2d4cded4c61d473bb0f1","observation_id":"86c03fab-1dc6-414c-9dd9-3cf325655264","resolution":{"observed_at":"2026-08-07T11:26:14.514075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:15.773349Z","title":null,"venue":null,"work_id":"5f0c0560-b194-471b-b3f1-ccb83fe6777b","year":2012},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-07T11:19:23.931052Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:14.532330Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:5a6a0da35f06f7d80354a58b1ccf23c762b46526bcc81c79667212673bcb3363","observation_id":"d5eeb4e4-5a06-4026-845f-44b8f6fe2d19","resolution":{"observed_at":"2026-08-07T11:26:15.779942Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:15.752328Z","title":"L., Taylor, E., and Loaiza-Ganem, G","venue":null,"work_id":"6fa451af-ae43-4b8e-bebd-97b459e0188b","year":2023},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-07T11:19:23.931052Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:14.567592Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:6efbf1fb1580e177833fd8de16ddbae97700825dc42a51aa54b0d48f89a513e2","observation_id":"a43fc90d-4703-49a7-8e49-220310d8585c","resolution":{"observed_at":"2026-08-07T11:26:15.758280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-07T11:26:14.595926Z","title":"Eva-clip: Improved training techniques for clip at scale","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-07T11:19:23.931052Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:14.595926Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:18b17aa00d2621eeb80ea24f62d4709cc0fe69da7bb6fe3e3dd9ce53ae16f19e","observation_id":"92360aea-3301-4b3a-8ae3-14ba88afdfd5","resolution":{"observed_at":"2026-08-07T11:26:14.595926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:15.734810Z","title":"Winoground: Probing vision and language models for visio-linguistic compositionality","venue":null,"work_id":"968a7ac1-500e-41f6-bed4-8078b4d9c36c","year":2022},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-07T11:19:23.931052Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:14.633074Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:b534e707b64b85c1a8982abf591ae01c8ddbf260148e37e896090b53c7e91364","observation_id":"75fce3a4-6058-4509-a68a-2ce192512d2d","resolution":{"observed_at":"2026-08-07T11:26:15.740074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:14.668972Z","title":"Eyes wide shut? exploring the visual shortcomings of multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-07T11:19:23.931052Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:14.668972Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:418009ba16f362fbc944e5ffc2380d238319f61175f772bfa0f47afbf047541f","observation_id":"8a11379d-27de-4437-81c4-d11d76d335b6","resolution":{"observed_at":"2026-08-07T11:26:14.668972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:15.703004Z","title":"S., Linmans, J., Winkens, J., Cohen, T., and Welling, M","venue":null,"work_id":"ca78e726-3952-4a76-8c3a-316b84bf6d35","year":2018},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-07T11:19:23.931052Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:14.688699Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:2f77ac76cbdaf1025d8e43b68f52038af070562883ec19706591b59a78cc7784","observation_id":"8958d4da-88b8-4d83-a640-75d27891eb51","resolution":{"observed_at":"2026-08-07T11:26:15.709139Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:15.684638Z","title":"Clip the gap: A single domain generalization approach for object detection","venue":null,"work_id":"6d010d63-1605-449d-9209-ad966f309f80","year":2023},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-07T11:19:23.931052Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:14.693990Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:23b479b88bc23f36c93dc7425eb26517545dc49a91f0a32f9032bcf3e008cb6a","observation_id":"bd473008-39b0-4582-86b0-9cf57d3e5756","resolution":{"observed_at":"2026-08-07T11:26:15.691181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:15.667650Z","title":"S., Steiner, A","venue":null,"work_id":"720f25f1-6e43-4e41-adb8-94ec020fd84d","year":2024},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-07T11:19:23.931052Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:14.699343Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:9e7ff9ac24ab111f2dd100921883eceddaba13526e0ed5c9e85c03d309c532db","observation_id":"e5740819-6d52-4e95-8a60-38da9a6d39f4","resolution":{"observed_at":"2026-08-07T11:26:15.673241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:15.650884Z","title":null,"venue":null,"work_id":"d31aeecd-a1f7-468f-83bc-9469a48e7571","year":2019},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-07T11:19:23.931052Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:14.708069Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:3a6138d9b6064941fd9a1071911453cd53927c93d22bbafb59f2734a1200f783","observation_id":"b7a586b6-5dc2-43c8-bc52-d27d87f85af7","resolution":{"observed_at":"2026-08-07T11:26:15.655991Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:15.633995Z","title":"Diffusion feedback helps clip see better","venue":null,"work_id":"cf39d2c2-f0d9-4131-8a08-9c53e643ea11","year":2025},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-07T11:19:23.931052Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:14.714678Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:d44a3451e51e5ec446251c9391c57d1e499102e0f4ca1b5a2362b8575de41411","observation_id":"65186142-1aa3-4919-9f62-ca235b46f4c6","resolution":{"observed_at":"2026-08-07T11:26:15.640372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01403","last_updated":"2024-01-24T18:11:53Z","snapshot_observed_at":"2026-08-05T20:11:45.942545Z","submitted_at":"2023-10-02T17:58:52Z","title":"CLIPSelf: Vision Transformer Distills Itself for Open-Vocabulary Dense Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01403","snapshot_observed_at":"2026-08-07T11:26:14.720443Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-07T11:19:23.931052Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:14.720443Z"},"links":{"cited_paper":"/paper/2310.01403","citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:508d122ad6173f9fbeb86685901db043ac095470b0fffc4421e208f5e17e6981","observation_id":"62d63c46-d754-4f26-828f-ce1d23533941","resolution":{"observed_at":"2026-08-07T11:26:14.720443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:15.617980Z","title":"Demystifying CLIP data","venue":null,"work_id":"285d62c3-466d-4546-98f2-15ab62a3d5e1","year":2024},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-07T11:19:23.931052Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:14.725923Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:d99762209a729fcb58730369a33717439cbe7dc9b200909a91a96b2928f0d51c","observation_id":"a43c192a-2ac7-447c-a69d-9cc493a6cfcf","resolution":{"observed_at":"2026-08-07T11:26:15.623105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:15.600225Z","title":"Explicit inductive bias for transfer learning with convolutional networks","venue":null,"work_id":"05fe1663-8dc7-4197-b339-52b2fbe65c11","year":2018},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-07T11:19:23.931052Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:14.731229Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:4e0d7a240309a4be6d985a89296ce6bf86928c69734e08dfe71e9c64083347b2","observation_id":"c367537a-4415-49b2-9169-6420db8b0cea","resolution":{"observed_at":"2026-08-07T11:26:15.606495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:15.581923Z","title":"From image descriptions to visual denotations: New similarity metrics for semantic inference over event descriptions","venue":null,"work_id":"42621d01-0fe5-4838-b18f-bd1efc24dd70","year":2014},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-07T11:19:23.931052Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:14.736867Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:1438f455fba9383c13a310707e63bfc76cd813848d8da830c9e8dccf566ef4e4","observation_id":"984b5b48-16a6-4047-ac45-5dbea0e582a2","resolution":{"observed_at":"2026-08-07T11:26:15.587517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:15.564946Z","title":"C., and Berg, T","venue":null,"work_id":"006590b0-8562-4102-b9b9-73e9cae7b176","year":2016},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-07T11:19:23.931052Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:14.741696Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:803f301ba4f1319df86275f21f1bc5d360bb8a969eafc419bf1424ca33001352","observation_id":"a6135983-a5c7-4bad-a1fd-8200c9309782","resolution":{"observed_at":"2026-08-07T11:26:15.570210Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:15.549146Z","title":"Convolutions die hard: Open-vocabulary segmentation with single frozen convolutional clip","venue":null,"work_id":"d2f48b5f-38eb-4367-95a3-30a22ab43221","year":2023},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-07T11:19:23.931052Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:14.746368Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:f5ab40fbb4e53e318b7dbff675d088ce7158c2f0816677713461e7e63a118801","observation_id":"74155806-e21b-4baf-881f-117b867164ee","resolution":{"observed_at":"2026-08-07T11:26:15.554372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:15.533063Z","title":"When and why vision-language models behave like bags-of-words, and what to do about it? In International Conference on Learning Representations, 2023","venue":null,"work_id":"010234fd-e363-4619-90f2-f592505deae0","year":2023},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-07T11:19:23.931052Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:14.752572Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:094e9f177bf7bcfdbf47a478a392a3853f78888fb3930f3eed6252d68cc2b58a","observation_id":"215a7a43-1c7f-4c53-bc74-17924b037985","resolution":{"observed_at":"2026-08-07T11:26:15.538506Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:14.757778Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-07T11:19:23.931052Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:14.757778Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:13545a8c8ca15a65845ea23a612217c23f5c5da4bade2b87054c0e9c22235ed8","observation_id":"2cb6e895-9f87-4c8d-8c4d-69b22d6ba8ec","resolution":{"observed_at":"2026-08-07T11:26:14.757778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.02700","last_updated":"2025-07-15T03:34:56Z","snapshot_observed_at":"2026-07-06T18:09:51.117905Z","submitted_at":"2024-05-04T16:06:50Z","title":"Unveiling Differences in Generative Models: A Scalable Differential Clustering Approach","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.02700","snapshot_observed_at":"2026-08-07T11:26:14.763166Z","title":"T., and Farnia, F","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-07T11:19:23.931052Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:14.763166Z"},"links":{"cited_paper":"/paper/2405.02700","citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:d9995d74a5c76e5a281daec141761889c1ec97c9db5a50d3c28df6f78cca5628","observation_id":"4bfa7c29-6693-46f8-b2ca-bd214c111d9c","resolution":{"observed_at":"2026-08-07T11:26:14.763166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17287","last_updated":"2024-06-14T01:37:57Z","snapshot_observed_at":"2026-07-06T17:36:01.939242Z","submitted_at":"2024-02-27T08:00:52Z","title":"An Interpretable Evaluation of Entropy-based Novelty of Generative Models","version":2},"cited_work":{"arxiv_id":"2402.17287","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.17287","snapshot_observed_at":"2026-08-07T11:26:14.864246Z","title":"An Interpretable Evaluation of Entropy-based Novelty of Generative Models","venue":"cs.LG","work_id":"0f33a635-0b23-4444-aefd-dc7e7ff8bdfd","year":2024},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-07T11:19:23.931052Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:14.769062Z"},"links":{"cited_paper":"/paper/2402.17287","citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:2f988dd32d59b41055f683fb1c37d15dc36e2cb126333fc735916d3568bc3f15","observation_id":"f147c74c-a66a-443c-a7e1-333c75204a53","resolution":{"observed_at":"2026-08-07T11:26:14.871675Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:15.504189Z","title":"Tip-adapter: Training-free adaption of clip for few-shot classification","venue":null,"work_id":"5ccd2e73-0470-4bbb-b598-90bf17be2156","year":2022},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-07T11:19:23.931052Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:14.774232Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:5bc612d7e3cf342ce872422c934dfb9c2a912fde725af6f9167cfbe25a1f9530","observation_id":"dc3159f4-8721-495b-b9dd-4cb65b7c68ef","resolution":{"observed_at":"2026-08-07T11:26:15.510047Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:15.484352Z","title":"H., Zhou, L., Dai, X., Yuan, L., Li, Y., et al","venue":null,"work_id":"436bada9-a6b4-4370-a545-590f7374c03d","year":2022},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-07T11:19:23.931052Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:14.780451Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:0216993baeab4a6189984325e462137b1a07de2f256f1b9e49214a59bc07c045","observation_id":"bd3c76e1-ac43-4256-a6c3-cb6b3b7ec446","resolution":{"observed_at":"2026-08-07T11:26:15.489436Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:14.786001Z","title":"C., and Liu, Z","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-07T11:19:23.931052Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:14.786001Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:0453aa869fde13530839a18d0521ccb0a37ad7d5d890a704d9b13ba3b62c4cd9","observation_id":"aabcead0-936a-4ad9-9929-e5d6cdbdf76a","resolution":{"observed_at":"2026-08-07T11:26:14.786001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.11824","last_updated":"2024-04-30T09:06:04Z","snapshot_observed_at":"2026-07-06T17:18:40.469815Z","submitted_at":"2024-01-22T10:37:59Z","title":"Rethinking Centered Kernel Alignment in Knowledge Distillation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.11824","snapshot_observed_at":"2026-08-07T11:26:14.790735Z","title":"Rethinking centered kernel alignment in knowledge distillation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-07T11:19:23.931052Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:14.790735Z"},"links":{"cited_paper":"/paper/2401.11824","citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:bb94a41a8dd090515585e2807793bffe4dc04e339e3b513b1f9ef25d481d35c1","observation_id":"ef46bbe8-0ec8-4a86-b913-da9bd885d844","resolution":{"observed_at":"2026-08-07T11:26:14.790735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:14.795852Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-07T11:19:23.931052Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:14.795852Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:3fb779146ca43c5e6501114546588ac2d6c025bc33c5d4d34141fc5688dbf18a","observation_id":"32880931-6e19-4a41-8cc9-ebf2088f0d25","resolution":{"observed_at":"2026-08-07T11:26:14.795852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T11:19:23.931052Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models"},"reference_resolution":{"displayed":98,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":59,"verified_exact":4,"verified_fuzzy":35},"total_outbound_references":98},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 98 of 98 outbound references and 4 inbound Pith citation observations for arXiv:2506.02557."}