Pith. sign in

Paper Citation Record · LEDGER

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models

As of 7 August 2026, this Paper Citation Record lists 98 of 98 outbound references and 4 inbound Pith citation observations for arXiv:2506.02557.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2506.02557 v1

Coverage vector

measured 98 of 98 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-07T11:26:14.795852Z

measured 102 of 102 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-07T06:34:17.273281+00:00

measured 4 of 4 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-05-20T22:07:35.021986Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-05-20T22:09:07.132811Z

Reference resolution

98 of 98 outbound references displayed

  • verified exact4
  • verified fuzzy35
  • unresolved59
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 4d16e6ee-d894-4bda-8dcc-7acfeb66ae2e · outbound

This paper cites Tallyqa: Answering complex counting questions.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Tallyqa: Answering complex counting questions

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:13.076810Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:13.076810Z digest=sha256:f8f0b65c6bf3b1a570801e5195ca3e536a25a5197a8488949d1efd89f0b77a64

Observation 9ac6405e-c393-4fe7-be5e-44e9302a72b6 · outbound

This paper cites Towards Understanding Ensemble, Knowledge Distillation and Self-Distillation in Deep Learning.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Towards Understanding Ensemble, Knowledge Distillation and Self-Distillation in Deep Learning

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:13.168645Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:13.168645Z digest=sha256:52b1f337a8c04c24987aad6e3e735fff0430eeec48acded649f36fcc766d6c52

Observation 5b8e08a7-39c5-472a-bf0b-f4305a43ef72 · outbound

This paper cites Multi-label cluster discrimination for visual representation learning.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Multi-label cluster discrimination for visual representation learning

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:13.268183Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:13.268183Z digest=sha256:ba6faf67f325d33eb3d65621f0077dc03ba96031ebb64364c98f385282dc924a

Observation dd2aea2c-c9b9-4bd1-894b-5ac1d6191e03 · outbound

This paper cites OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:13.323907Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:13.323907Z digest=sha256:05a6a9f162c378d630c914aa514bcb42f6fa97dcdd628a47b89b21c3439057d1

Observation ae69c505-1c92-4049-8542-abc0a16de6f6 · outbound

This paper cites Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:13.361069Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:13.361069Z digest=sha256:7f898791bc32dc54e6c90c6bd18bd7b1cc3a3a18cafd25ecffb292a6b5cf3d41

Observation 93b3c931-1656-477b-91ee-e9678554b1ea · outbound

This paper cites BE it: BERT pre-training of image transformers.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models BE it: BERT pre-training of image transformers

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:13.366454Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:13.366454Z digest=sha256:a08f78024af5e5b088e6ec26de70ff4ff5b2ee4f801b99c1a2180d0f3e9ceb3c

Observation 15631b84-da0c-4158-890f-8af4e5d2f0cf · outbound

This paper cites Demystifying MMD GANs.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Demystifying MMD GANs

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:13.372034Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:13.372034Z digest=sha256:1b55f291a23061e0423e85fe0b174b20df0460e674112cd4f65aad2074e3fcf1

Observation 687fedb5-d726-43a1-a2cd-2cb12ad73329 · outbound

This paper cites Domain prompt learning with quaternion networks.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Domain prompt learning with quaternion networks

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:13.379895Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:13.379895Z digest=sha256:8695f7db9945911ba83aa28e3e0669a8e8bc0f66becabb28ae01dbf34a0d73ec

Observation 18af799d-c07f-4a26-8766-b41a6ea96b33 · outbound

This paper cites Emerging properties in self-supervised vision transformers.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Emerging properties in self-supervised vision transformers

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:13.388470Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:13.388470Z digest=sha256:3e27bd27f9456041591bf3c271341e5b364b662d896e0b9b3e5b4bfca45884cd

Observation 4ae0c78d-9be3-4ee3-84a6-54fc288609ed · outbound

This paper cites Microsoft COCO Captions: Data Collection and Evaluation Server.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Microsoft COCO Captions: Data Collection and Evaluation Server

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:13.395742Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:13.395742Z digest=sha256:203b799cd474472308230e1d0ee8e9bdeb0ca059c2f9297689da37025b104385

Observation 5bc761d1-b06c-4caa-a25b-ce9284b1b416 · outbound

This paper cites Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:13.404320Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:13.404320Z digest=sha256:af8cfcec013082d99c9e0895578bc61c92807075acd6ce90d07424009eed9caf

Observation 9aa90695-3be6-400e-943d-09083641276e · outbound

This paper cites Remote sensing image scene classification: Benchmark and state of the art.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Remote sensing image scene classification: Benchmark and state of the art

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:13.413877Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:13.413877Z digest=sha256:83bb83e6e2790da13f5d8091ea647f2acb585a73695dd703aac27f24545fc3e3

Observation 2bc4a2da-efac-488c-a0ec-b5892fa02b4a · outbound

This paper cites Describing textures in the wild.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Describing textures in the wild

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:13.424318Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:13.424318Z digest=sha256:e837bc74753a83ddd97762c7884f6972c64affcfc5918bf97d4a61221af63c6b

Observation 01f684b7-2458-4e0c-844a-5c245287180d · outbound

This paper cites Locality alignment improves vision-language models.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Locality alignment improves vision-language models

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:13.433254Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:13.433254Z digest=sha256:61136a02399c04d49fea20d77cd64f423138ae75ce33c78e935f767b13aefe12

Observation 9ea5f798-9654-40d3-b615-2e300fe98c8e · outbound

This paper cites Vision transformers need registers.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Vision transformers need registers

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:13.442273Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:13.442273Z digest=sha256:a8587d0d32c36c67a2d009dd6a8f1fcd151c721520913715afd9b67dfeef9762

Observation 76f1de1f-3955-4271-956b-0e71f1f8478a · outbound

This paper cites FairerCLIP: Debiasing CLIP's Zero-Shot Predictions using Functions in RKHSs.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models FairerCLIP: Debiasing CLIP's Zero-Shot Predictions using Functions in RKHSs

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:13.449072Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:13.449072Z digest=sha256:a7454fe4298f431337c7e8c6d9c30656c6136fb34774463e61d00f3136784c7e

Observation 29001f20-7d10-4a44-aa2e-3a212bc2928b · outbound

This paper cites Imagenet: A large-scale hierarchical image database.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Imagenet: A large-scale hierarchical image database

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:13.458149Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:13.458149Z digest=sha256:6ef616664ffd53b0c07f89cb41aff17a1d2c0b1d69285b428c778f779773a233

Observation 0f19e8af-fdf4-4222-b513-e6808e566af5 · outbound

This paper cites Data Filtering Networks.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Data Filtering Networks

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:13.466593Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:13.466593Z digest=sha256:9fcd1eca219c804187b97235b86ca83dbbac76cceb7bbac3f1ee1b89fc1e961c

Observation e1768fd8-cc1c-4a4b-8fb5-cac422a01f1c · outbound

This paper cites Learning generative visual models from few training examples: An incremental bayesian approach tested on 101 object categories.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Learning generative visual models from few training examples: An incremental bayesian approach tested on 101 object categories

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:13.474213Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:13.474213Z digest=sha256:bb380a37f673a0a8612f931265c85f683a77c75ff71bc3c2379bfde62cf5c6f4

Observation f27885c4-874f-4f66-80cd-ca21c6c67bfc · outbound

This paper cites The Vendi Score: A Diversity Evaluation Metric for Machine Learning.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models The Vendi Score: A Diversity Evaluation Metric for Machine Learning

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:13.482039Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:13.482039Z digest=sha256:853e405486baa76e46d05cd6554b84a6dad0016e60d1264905b2e5843346a2fe

Observation fe8321d5-a764-48b8-9d49-79270960917b · outbound

This paper cites Y., Ilharco, G., Fang, A., Hayase, J., Smyrnis, G., Nguyen, T., Marten, R., Wortsman, M., Ghosh, D., Zhang, J., et al.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Y., Ilharco, G., Fang, A., Hayase, J., Smyrnis, G., Nguyen, T., Marten, R., Wortsman, M., Ghosh, D., Zhang, J., et al

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:13.489672Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:13.489672Z digest=sha256:fcc7a5867f6d39b0f13fe495d74f124b2bf0b2d49fc4c328a7b1ae653febbefc

Observation 5e9ed5a2-454f-4ca2-afc6-0660046e0e4a · outbound

This paper cites Clip-adapter: Better vision-language models with feature adapters.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Clip-adapter: Better vision-language models with feature adapters

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:13.498808Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:13.498808Z digest=sha256:11659fe7a3895fe2608dee7392795220a30904fcd67362facbd2d07c3ef13173

Observation 01bb1b83-88d7-447e-a6f6-e6d5055328d6 · outbound

This paper cites 3dsam-adapter: Holistic adaptation of sam from 2d to 3d for promptable tumor segmentation.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models 3dsam-adapter: Holistic adaptation of sam from 2d to 3d for promptable tumor segmentation

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:13.507737Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:13.507737Z digest=sha256:40db50f4140fd2099c386b61cfefc40c263f4c0883491f2c9cdbc05234b79acd

Observation 1b00e8df-c653-435c-8b8a-207190ba5e94 · outbound

This paper cites Boosting the visual interpretability of clip via adversarial fine-tuning.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Boosting the visual interpretability of clip via adversarial fine-tuning

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:13.514659Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:13.514659Z digest=sha256:bd83270b488aae89fb067a795aa1942cf0ee8b92e45d69875bc6f4eb1feadf7c

Observation d9c80418-3b83-47c1-9d71-9fe959274c87 · outbound

This paper cites J., Erhan, D., Carrier, P.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models J., Erhan, D., Carrier, P

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:13.523302Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:13.523302Z digest=sha256:462bea3b21c616cf27cd869ac5644573e50f8312b7b3b484c3e8fb373003f250

Observation 6930017c-288a-4408-b09a-498b9b8db2e4 · outbound

This paper cites Making the v in vqa matter: Elevating the role of image understanding in visual question answering.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Making the v in vqa matter: Elevating the role of image understanding in visual question answering

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:13.531936Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:13.531936Z digest=sha256:da7f05e33e4c2dc8075a7b170da0f6997ab5af79d8c7b7228e89abb0720bb660

Observation f2ecbac2-a02a-4822-91ae-6e21c4010444 · outbound

This paper cites Recovering low-rank matrices from few coefficients in any basis.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Recovering low-rank matrices from few coefficients in any basis

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:13.543285Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:13.543285Z digest=sha256:8a113cd219f09c8eb88b9c169bf860310a6a8aba61801db0cdfdfed907ac4e99

Observation 366ffc2e-2196-4e70-8d5f-1cc98c69c510 · outbound

This paper cites Llava-uhd: an lmm perceiving any aspect ratio and high-resolution images.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Llava-uhd: an lmm perceiving any aspect ratio and high-resolution images

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T11:26:16.322547Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T11:26:13.551090Z digest=sha256:d0777fe1b4de0b17211e6478215fc3b51714cc34b439200222df539cdc1940f3

Observation 3a7fc68b-0e04-4eca-a9b0-df2e2203c2b7 · outbound

This paper cites J., Guo, A., Lin, C., Grauman, K., Luo, J., and Bigham, J.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models J., Guo, A., Lin, C., Grauman, K., Luo, J., and Bigham, J

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:13.559218Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:13.559218Z digest=sha256:2139f0c0d7366d397b56eac1f5e12db654c6a3a0f34db8ddd5eeb0f05ec3071e

Observation b69abfb6-bd6c-44df-9b2b-e0d23c980b20 · outbound

This paper cites and Ozay, M.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models and Ozay, M

Reference 30

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T11:26:16.293617Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T11:26:13.569083Z digest=sha256:081557f6ec9c8c18bd28ff42fafd4f01d6443b23674da863350693429fdd9c72

Observation 121c676e-fa5f-48ad-9c50-690fa20805bb · outbound

This paper cites Masked autoencoders are scalable vision learners.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Masked autoencoders are scalable vision learners

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:13.577818Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:13.577818Z digest=sha256:db796b65e515fffff5ff9bb1987d66a1d277ad306c1c114cffbb35753f7627a2

Observation 2a254a0e-9dcf-4e16-949a-9b1c1abc6c1c · outbound

This paper cites Introducing eurosat: A novel dataset and deep learning benchmark for land use and land cover classification.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Introducing eurosat: A novel dataset and deep learning benchmark for land use and land cover classification

Reference 32

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T11:26:16.263624Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T11:26:13.585481Z digest=sha256:439cecbc29019309c0afa38bfef2675d9bbe9ac9dd098f80dfa8b2e7f6e9ecbd

Observation 4d7b9426-0970-4aae-b9d7-3d9b4b0597f1 · outbound

This paper cites Natural adversarial examples.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Natural adversarial examples

Reference 33

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T11:26:16.245014Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T11:26:13.594682Z digest=sha256:5f7f50438129fc7b0c612e6fe9996b6a41c73e81da047d365b51262a5947acf1

Observation cf580be8-ad12-443a-9c32-81712a0531de · outbound

This paper cites Probability inequalities for sums of bounded random variables.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Probability inequalities for sums of bounded random variables

Reference 34

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T11:26:16.227681Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T11:26:13.603893Z digest=sha256:e646c6796cf595d04f70fac136f041f5d50662027a6107ac5e42cb31b65a7b01

Observation 4416e393-5b99-45c6-9ea9-dba6335057b2 · outbound

This paper cites an unresolved cited work.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Unresolved cited work

Reference 35

Resolution
unresolved
raw_fallback, observed 2026-08-07T11:26:16.203710Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T11:26:13.611022Z digest=sha256:dfa8541e2216adf3ce0d1de26ce2ff5691a482efed0593065e0ec76d8608df61

Observation dc363e2b-3006-4734-a536-73a19962b57a · outbound

This paper cites J., yelong shen, Wallis, P., Allen-Zhu, Z., Li, Y., Wang, S., Wang, L., and Chen, W.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models J., yelong shen, Wallis, P., Allen-Zhu, Z., Li, Y., Wang, S., Wang, L., and Chen, W

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:13.622913Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:13.622913Z digest=sha256:2075cad8c36f54ab0deaf2e87e6fadbc0cf0d4692f1095bafcf5e9ffc098b072

Observation ec4452a5-ec39-44de-b667-91adde54424a · outbound

This paper cites T., and Farnia, F.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models T., and Farnia, F

Reference 37

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T11:26:16.171988Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T11:26:13.629823Z digest=sha256:4067a784e663f9eee817d72984972e912bd220816cd994ade8903e7e69d5e8e5

Observation eae863a3-ed91-4854-9112-b5ceaa723332 · outbound

This paper cites T., and Farnia, F.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models T., and Farnia, F

Reference 38

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T11:26:16.156234Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T11:26:13.639656Z digest=sha256:d082d98fa0a689906328a2ddee6a7ae92155487461b74474d33a83ded14dfc6f

Observation dbba5313-2aad-4768-8d8a-e44aa9ffa657 · outbound

This paper cites From CLIP to DINO: Visual Encoders Shout in Multi-modal Large Language Models.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models From CLIP to DINO: Visual Encoders Shout in Multi-modal Large Language Models

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:13.676257Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:13.676257Z digest=sha256:841c348113896f268f682ea38e2f33ceefd0b44f992948bf6892120938f47a58

Observation 206e2dba-54a7-45c6-8e8b-d3e48972387e · outbound

This paper cites Clevr: A diagnostic dataset for compositional language and elementary visual reasoning.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Clevr: A diagnostic dataset for compositional language and elementary visual reasoning

Reference 40

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T11:26:16.137088Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T11:26:13.710170Z digest=sha256:9d11824042b12f787b6b8606f0f95eaa6ebe46ba21875143a154153bcecec860

Observation ad4df0c3-f888-4b8c-81b7-7cf62eae08cc · outbound

This paper cites What's ''up'' with vision-language models? investigating their struggle with spatial reasoning.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models What's ''up'' with vision-language models? investigating their struggle with spatial reasoning

Reference 41

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T11:26:16.118412Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T11:26:13.745597Z digest=sha256:d4585b91cf2d26387f3397f12c3f39e6750f64728d38615d09fd3728bbf4b1c0

Observation bc348745-03d8-4a07-95c6-203ae6f6619c · outbound

This paper cites Studiogan: A taxonomy and benchmark of gans for image synthesis.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Studiogan: A taxonomy and benchmark of gans for image synthesis

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:13.769979Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:13.769979Z digest=sha256:40852c8e905d4e8c0f26b697c5b080e3ac2cccac89cd6416b33ee4d05406390e

Observation e2a1764d-f340-4029-ab33-673f15dd52c5 · outbound

This paper cites Referitgame: Referring to objects in photographs of natural scenes.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Referitgame: Referring to objects in photographs of natural scenes

Reference 43

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T11:26:16.098644Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T11:26:13.788031Z digest=sha256:c14f4197976e7d410870daa1ff220df1b3f1743b13086ddc5a88e2418f9ccbbb

Observation fd87e030-16f8-4a32-8da4-d7c713a2ebcb · outbound

This paper cites A diagram is worth a dozen images.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models A diagram is worth a dozen images

Reference 44

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T11:26:16.076987Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T11:26:13.814240Z digest=sha256:cf214c3dcb31219915dab32cbec2387588091de9b7d9e7aa2a74517f63391152

Observation 1d4571e4-a51e-4c97-a34b-51d71ddfc5ed · outbound

This paper cites The hateful memes challenge: Detecting hate speech in multimodal memes.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models The hateful memes challenge: Detecting hate speech in multimodal memes

Reference 45

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T11:26:16.058144Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T11:26:13.852337Z digest=sha256:cdf36f941c062a2dd7e3fa9552aaecaa7ea48e40af7466494b89a063c39e9416

Observation 4f904f8d-1662-4281-94b0-c76d3ac765c4 · outbound

This paper cites an unresolved cited work.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Unresolved cited work

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:13.878916Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:13.878916Z digest=sha256:c159851112e67d42d0189b859906482db4359a7f05a8a47db82dae02cf041c16

Observation da99cb35-99f2-40e9-b0d1-58ece4309242 · outbound

This paper cites Learning multiple layers of features from tiny images.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Learning multiple layers of features from tiny images

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:13.897490Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:13.897490Z digest=sha256:69b2aaee00c43d306a983b19007eb5b9171f6ff9ba32e8c87bcd79179ac3c1c3

Observation fdc3bc36-8274-4109-a257-e0b499b0d560 · outbound

This paper cites Clip benchmark: Clip-like model evaluation, 2022.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Clip benchmark: Clip-like model evaluation, 2022

Reference 48

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T11:26:16.019546Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T11:26:13.931847Z digest=sha256:c80460c8deee94b3f182d0f6b632ceeafea03264e1a885fff9691dd0fdb88409

Observation 986ea017-a1a9-423e-a162-80aa191b2015 · outbound

This paper cites Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:13.958430Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:13.958430Z digest=sha256:a315e54bd73e5040dc6f3b32efb26da8e66890c1194418bc213904075950ca47

Observation ab00bb5c-ea22-4fe4-b469-420a53fd3470 · outbound

This paper cites Transfer learning in computer vision tasks: Remember where you come from.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Transfer learning in computer vision tasks: Remember where you come from

Reference 50

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T11:26:15.987195Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T11:26:13.985748Z digest=sha256:0602696b715ff6e0b8d1a3129071c5f6fa78974d8b6ebc576df02d8f67ab5775

Observation 0e1a228a-284d-4834-acf0-c75ca3829e9a · outbound

This paper cites Evaluating object hallucination in large vision-language models.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Evaluating object hallucination in large vision-language models

Reference 51

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T11:26:15.971091Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T11:26:14.022976Z digest=sha256:bb09ee463eb1abec9245b4a01ffbed36e891e87da833d37093afa9684077fa90

Observation b55b8aa9-9a3c-492d-85ad-173108fd5013 · outbound

This paper cites an unresolved cited work.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Unresolved cited work

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:14.058425Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:14.058425Z digest=sha256:5ded77f0add90f8a9c239dd387b6eb2d2ce2d7647b9a4646bcb092b3b12ef932

Observation 941bbed5-eb97-4269-8ad7-47c1f58e61e1 · outbound

This paper cites Visual spatial reasoning.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Visual spatial reasoning

Reference 53

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T11:26:15.943536Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T11:26:14.093939Z digest=sha256:a85c5f9761664e5ddfa4694f55827aceff8709c71edc9b66c91bed51c9a4ce4a

Observation 95581358-a2dc-4a8f-8e01-5f39a1289963 · outbound

This paper cites an unresolved cited work.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Unresolved cited work

Reference 54

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:14.130078Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:14.130078Z digest=sha256:2cb0ad261782866452c8f907f22cc7f4962a23313d73dcd9cd60b53f14b7e279

Observation ad658fa4-a1d9-4e11-88d2-2c6fa4d826b1 · outbound

This paper cites Decoupled Weight Decay Regularization.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Decoupled Weight Decay Regularization

Reference 55

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:14.157884Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:14.157884Z digest=sha256:781773725fd0c08bbf86fec42d0f5e32195437147a8c5456cab1a0a3dea644b4

Observation 2b9b5496-ad13-4cc1-b52b-2c82d1c81616 · outbound

This paper cites Understanding Zero-Shot Adversarial Robustness for Large-Scale Models.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Understanding Zero-Shot Adversarial Robustness for Large-Scale Models

Reference 56

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:14.191544Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:14.191544Z digest=sha256:5299b33395511c5eb677325f9e1a67041f4ef6e851299008ac821791ffd19bba

Observation 97d40f26-43b0-4ba1-b6c8-bbf546f4a1d4 · outbound

This paper cites Ok-vqa: A visual question answering benchmark requiring external knowledge.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Ok-vqa: A visual question answering benchmark requiring external knowledge

Reference 57

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:14.214004Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:14.214004Z digest=sha256:18793c5ba63c147f27a4dfd3d0e482e29dc0422876d7fa354b44ccbe32513559

Observation 53d26859-b591-4ff0-8722-4807ae2a4770 · outbound

This paper cites Y., et al.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Y., et al

Reference 58

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:14.234636Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:14.234636Z digest=sha256:ff462f08fd32976858b2a93f175826f497f5ba3eeb60aa44a56d38cdef5511b5

Observation 76527488-a35d-443a-aab9-e2a81759f282 · outbound

This paper cites Dinov2: Learning robust visual features without supervision.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Dinov2: Learning robust visual features without supervision

Reference 59

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T11:26:15.894122Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T11:26:14.250170Z digest=sha256:3f16dd773127b2ef1df59f51c892df1be573ebf9bd720a4e0ff3189d94ceb29f

Observation dcf1e64b-a01b-4377-bd5c-3489b89a64c3 · outbound

This paper cites Do Vendi Scores Converge with Finite Samples? Truncated Vendi Score for Finite-Sample Convergence Guarantees.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Do Vendi Scores Converge with Finite Samples? Truncated Vendi Score for Finite-Sample Convergence Guarantees

Reference 60

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:14.272780Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:14.272780Z digest=sha256:0c08749e9e88fa55c106c1313947a969c420119528b492f1e0fda20480443bf0

Observation 1a5fae69-ee38-41bc-b5dc-14c10c800486 · outbound

This paper cites Scendi Score: Prompt-Aware Diversity Evaluation via Schur Complement of CLIP Embeddings.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Scendi Score: Prompt-Aware Diversity Evaluation via Schur Complement of CLIP Embeddings

Reference 61

Resolution
verified exact
local_arxiv, observed 2026-08-07T11:26:15.081496Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T11:26:14.289306Z digest=sha256:b1220aae0cda4ddf727791fe638254ce2b26944ebdee08777e9f6214e8fcb0f6

Observation 74d19f35-21aa-471d-910a-247e7ee840c8 · outbound

This paper cites Towards a scalable reference-free evaluation of generative models.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Towards a scalable reference-free evaluation of generative models

Reference 62

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T11:26:15.875218Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T11:26:14.310303Z digest=sha256:6c7d98ff9cb0e3011d4837b98874eabf86d4a5fd7f6ff1ead2b6c942e25a0f60

Observation 43bac356-ca4d-42a1-81aa-2d9b908b5fc7 · outbound

This paper cites M., Vedaldi, A., Zisserman, A., and Jawahar, C.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models M., Vedaldi, A., Zisserman, A., and Jawahar, C

Reference 63

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T11:26:15.857821Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T11:26:14.315818Z digest=sha256:a29d936fc759eda61e19e6f56d3a8a05a2f50c9cf000eb680358bb04373fe279

Observation 2618be62-08dc-4987-b436-f6c8b8b33a5d · outbound

This paper cites W., Hallacy, C., Ramesh, A., Goh, G., Agarwal, S., Sastry, G., Askell, A., Mishkin, P., Clark, J., et al.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models W., Hallacy, C., Ramesh, A., Goh, G., Agarwal, S., Sastry, G., Askell, A., Mishkin, P., Clark, J., et al

Reference 64

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:14.327491Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:14.327491Z digest=sha256:0a9778a428f88c1e14148d930e1dd3b5121e92778cdbdf4aef96c66ef813233b

Observation 36b7853d-b122-4b04-98f4-4a8a043db632 · outbound

This paper cites Am-radio: Agglomerative vision foundation model reduce all domains into one.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Am-radio: Agglomerative vision foundation model reduce all domains into one

Reference 65

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T11:26:15.828165Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T11:26:14.337840Z digest=sha256:b8b728c816d2d80f1682408703a70ffe799af6dc2a906a6faec0ebfc489a4f94

Observation 918a3279-df71-4ef6-937d-790a1d9df14b · outbound

This paper cites Be More Diverse than the Most Diverse: Optimal Mixtures of Generative Models via Mixture-UCB Bandit Algorithms.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Be More Diverse than the Most Diverse: Optimal Mixtures of Generative Models via Mixture-UCB Bandit Algorithms

Reference 66

Resolution
verified exact
local_arxiv, observed 2026-08-07T11:26:15.058806Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T11:26:14.349429Z digest=sha256:b888fc2a216621abe234cba4bcbea6726ef22e47633fb24ab53995bf39052c08

Observation 6ac9159c-f5d3-405d-81b3-fcf795583ee8 · outbound

This paper cites Improved zero-shot classification by adapting vlms with text descriptions.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Improved zero-shot classification by adapting vlms with text descriptions

Reference 67

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T11:26:15.809295Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T11:26:14.362400Z digest=sha256:d91d2709535ec302851c02c894acaa0f544975eae73c60060238f5b2e4135598

Observation 4e5c131a-6d20-4eff-b873-ca932678061f · outbound

This paper cites CLIP meets Model Zoo Experts: Pseudo-Supervision for Visual Enhancement.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models CLIP meets Model Zoo Experts: Pseudo-Supervision for Visual Enhancement

Reference 68

Resolution
verified exact
local_arxiv, observed 2026-08-07T11:26:15.035097Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T11:26:14.375483Z digest=sha256:a14b063c28f436f3be34190d43039de76ac43a2ca2531f861dcc85635804f0ef

Observation ebf584df-d99f-4edd-a28a-dc9ee716d36c · outbound

This paper cites Robust CLIP: Unsupervised Adversarial Fine-Tuning of Vision Embeddings for Robust Large Vision-Language Models.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Robust CLIP: Unsupervised Adversarial Fine-Tuning of Vision Embeddings for Robust Large Vision-Language Models

Reference 69

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:14.409174Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:14.409174Z digest=sha256:4fd15ce71f8584ac54c74323caa69ede0bbce98a53e7c6b174f0160f3d38d08d

Observation b6b6a7b7-2294-4b70-ba5a-04f1a26dbd1c · outbound

This paper cites MoME: Mixture of Multimodal Experts for Generalist Multimodal Large Language Models.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models MoME: Mixture of Multimodal Experts for Generalist Multimodal Large Language Models

Reference 70

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:14.425638Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:14.425638Z digest=sha256:fd410dfe3724fa373c34884d4c001007c1fe99f26dffab8ccf8422b08c2a6ced

Observation 73f02e0a-268b-47b9-8f9d-0ec95bc9ce56 · outbound

This paper cites Finetuning Text-to-Image Diffusion Models for Fairness.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Finetuning Text-to-Image Diffusion Models for Fairness

Reference 71

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:14.450325Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:14.450325Z digest=sha256:43e0c36d49e2caacd7a7d74ca420f30d81963ec210bd9c419c099a12441e8573

Observation 5efff50b-5682-40c5-b5d9-0ed382beb549 · outbound

This paper cites Eagle: Exploring The Design Space for Multimodal LLMs with Mixture of Encoders.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Eagle: Exploring The Design Space for Multimodal LLMs with Mixture of Encoders

Reference 72

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:14.486555Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:14.486555Z digest=sha256:745a4177c344083a66dfc158583ec78812e211b2e8690f8e4c069ce7c3fa3078

Observation 86c03fab-1dc6-414c-9dd9-3cf325655264 · outbound

This paper cites Towards vqa models that can read.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Towards vqa models that can read

Reference 73

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:14.514075Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:14.514075Z digest=sha256:ca7a4f706728adc989a870ba466c4a25d8a0d635286d2d4cded4c61d473bb0f1

Observation d5eeb4e4-5a06-4026-845f-44b8f6fe2d19 · outbound

This paper cites an unresolved cited work.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Unresolved cited work

Reference 74

Resolution
unresolved
raw_fallback, observed 2026-08-07T11:26:15.779942Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T11:26:14.532330Z digest=sha256:5a6a0da35f06f7d80354a58b1ccf23c762b46526bcc81c79667212673bcb3363

Observation a43fc90d-4703-49a7-8e49-220310d8585c · outbound

This paper cites L., Taylor, E., and Loaiza-Ganem, G.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models L., Taylor, E., and Loaiza-Ganem, G

Reference 75

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T11:26:15.758280Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T11:26:14.567592Z digest=sha256:6efbf1fb1580e177833fd8de16ddbae97700825dc42a51aa54b0d48f89a513e2

Observation 92360aea-3301-4b3a-8ae3-14ba88afdfd5 · outbound

This paper cites EVA-CLIP: Improved Training Techniques for CLIP at Scale.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models EVA-CLIP: Improved Training Techniques for CLIP at Scale

Reference 76

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:14.595926Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:14.595926Z digest=sha256:18b17aa00d2621eeb80ea24f62d4709cc0fe69da7bb6fe3e3dd9ce53ae16f19e

Observation 75fce3a4-6058-4509-a68a-2ce192512d2d · outbound

This paper cites Winoground: Probing vision and language models for visio-linguistic compositionality.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Winoground: Probing vision and language models for visio-linguistic compositionality

Reference 77

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T11:26:15.740074Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T11:26:14.633074Z digest=sha256:b534e707b64b85c1a8982abf591ae01c8ddbf260148e37e896090b53c7e91364

Observation 8a11379d-27de-4437-81c4-d11d76d335b6 · outbound

This paper cites Eyes wide shut? exploring the visual shortcomings of multimodal llms.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Eyes wide shut? exploring the visual shortcomings of multimodal llms

Reference 78

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:14.668972Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:14.668972Z digest=sha256:418009ba16f362fbc944e5ffc2380d238319f61175f772bfa0f47afbf047541f

Observation 8958d4da-88b8-4d83-a640-75d27891eb51 · outbound

This paper cites S., Linmans, J., Winkens, J., Cohen, T., and Welling, M.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models S., Linmans, J., Winkens, J., Cohen, T., and Welling, M

Reference 79

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T11:26:15.709139Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T11:26:14.688699Z digest=sha256:2f77ac76cbdaf1025d8e43b68f52038af070562883ec19706591b59a78cc7784

Observation bd473008-39b0-4582-86b0-9cf57d3e5756 · outbound

This paper cites Clip the gap: A single domain generalization approach for object detection.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Clip the gap: A single domain generalization approach for object detection

Reference 80

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T11:26:15.691181Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T11:26:14.693990Z digest=sha256:23b479b88bc23f36c93dc7425eb26517545dc49a91f0a32f9032bcf3e008cb6a

Observation e5740819-6d52-4e95-8a60-38da9a6d39f4 · outbound

This paper cites S., Steiner, A.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models S., Steiner, A

Reference 81

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T11:26:15.673241Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T11:26:14.699343Z digest=sha256:9e7ff9ac24ab111f2dd100921883eceddaba13526e0ed5c9e85c03d309c532db

Observation b7a586b6-5dc2-43c8-bc52-d27d87f85af7 · outbound

This paper cites an unresolved cited work.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Unresolved cited work

Reference 82

Resolution
unresolved
raw_fallback, observed 2026-08-07T11:26:15.655991Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T11:26:14.708069Z digest=sha256:3a6138d9b6064941fd9a1071911453cd53927c93d22bbafb59f2734a1200f783

Observation 65186142-1aa3-4919-9f62-ca235b46f4c6 · outbound

This paper cites Diffusion feedback helps clip see better.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Diffusion feedback helps clip see better

Reference 83

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T11:26:15.640372Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T11:26:14.714678Z digest=sha256:d44a3451e51e5ec446251c9391c57d1e499102e0f4ca1b5a2362b8575de41411

Observation 62d63c46-d754-4f26-828f-ce1d23533941 · outbound

This paper cites CLIPSelf: Vision Transformer Distills Itself for Open-Vocabulary Dense Prediction.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models CLIPSelf: Vision Transformer Distills Itself for Open-Vocabulary Dense Prediction

Reference 84

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:14.720443Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:14.720443Z digest=sha256:508d122ad6173f9fbeb86685901db043ac095470b0fffc4421e208f5e17e6981

Observation a43c192a-2ac7-447c-a69d-9cc493a6cfcf · outbound

This paper cites Demystifying CLIP data.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Demystifying CLIP data

Reference 85

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T11:26:15.623105Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T11:26:14.725923Z digest=sha256:d99762209a729fcb58730369a33717439cbe7dc9b200909a91a96b2928f0d51c

Observation c367537a-4415-49b2-9169-6420db8b0cea · outbound

This paper cites Explicit inductive bias for transfer learning with convolutional networks.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Explicit inductive bias for transfer learning with convolutional networks

Reference 86

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T11:26:15.606495Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T11:26:14.731229Z digest=sha256:4e0d7a240309a4be6d985a89296ce6bf86928c69734e08dfe71e9c64083347b2

Observation 984b5b48-16a6-4047-ac45-5dbea0e582a2 · outbound

This paper cites From image descriptions to visual denotations: New similarity metrics for semantic inference over event descriptions.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models From image descriptions to visual denotations: New similarity metrics for semantic inference over event descriptions

Reference 87

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T11:26:15.587517Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T11:26:14.736867Z digest=sha256:1438f455fba9383c13a310707e63bfc76cd813848d8da830c9e8dccf566ef4e4

Observation a6135983-a5c7-4bad-a1fd-8200c9309782 · outbound

This paper cites C., and Berg, T.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models C., and Berg, T

Reference 88

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T11:26:15.570210Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T11:26:14.741696Z digest=sha256:803f301ba4f1319df86275f21f1bc5d360bb8a969eafc419bf1424ca33001352

Observation 74155806-e21b-4baf-881f-117b867164ee · outbound

This paper cites Convolutions die hard: Open-vocabulary segmentation with single frozen convolutional clip.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Convolutions die hard: Open-vocabulary segmentation with single frozen convolutional clip

Reference 89

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T11:26:15.554372Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T11:26:14.746368Z digest=sha256:f5ab40fbb4e53e318b7dbff675d088ce7158c2f0816677713461e7e63a118801

Observation 215a7a43-1c7f-4c53-bc74-17924b037985 · outbound

This paper cites When and why vision-language models behave like bags-of-words, and what to do about it? In International Conference on Learning Representations, 2023.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models When and why vision-language models behave like bags-of-words, and what to do about it? In International Conference on Learning Representations, 2023

Reference 90

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T11:26:15.538506Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T11:26:14.752572Z digest=sha256:094e9f177bf7bcfdbf47a478a392a3853f78888fb3930f3eed6252d68cc2b58a

Observation 2cb6e895-9f87-4c8d-8c4d-69b22d6ba8ec · outbound

This paper cites Sigmoid loss for language image pre-training.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Sigmoid loss for language image pre-training

Reference 91

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:14.757778Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:14.757778Z digest=sha256:13545a8c8ca15a65845ea23a612217c23f5c5da4bade2b87054c0e9c22235ed8

Observation 4bfa7c29-6693-46f8-b2ca-bd214c111d9c · outbound

This paper cites Unveiling Differences in Generative Models: A Scalable Differential Clustering Approach.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Unveiling Differences in Generative Models: A Scalable Differential Clustering Approach

Reference 92

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:14.763166Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:14.763166Z digest=sha256:d9995d74a5c76e5a281daec141761889c1ec97c9db5a50d3c28df6f78cca5628

Observation f147c74c-a66a-443c-a7e1-333c75204a53 · outbound

This paper cites An Interpretable Evaluation of Entropy-based Novelty of Generative Models.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models An Interpretable Evaluation of Entropy-based Novelty of Generative Models

Reference 93

Resolution
verified exact
local_arxiv, observed 2026-08-07T11:26:14.871675Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T11:26:14.769062Z digest=sha256:2f988dd32d59b41055f683fb1c37d15dc36e2cb126333fc735916d3568bc3f15

Observation dc3159f4-8721-495b-b9dd-4cb65b7c68ef · outbound

This paper cites Tip-adapter: Training-free adaption of clip for few-shot classification.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Tip-adapter: Training-free adaption of clip for few-shot classification

Reference 94

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T11:26:15.510047Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T11:26:14.774232Z digest=sha256:5bc612d7e3cf342ce872422c934dfb9c2a912fde725af6f9167cfbe25a1f9530

Observation bd3c76e1-ac43-4256-a6c3-cb6b3b7ec446 · outbound

This paper cites H., Zhou, L., Dai, X., Yuan, L., Li, Y., et al.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models H., Zhou, L., Dai, X., Yuan, L., Li, Y., et al

Reference 95

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T11:26:15.489436Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T11:26:14.780451Z digest=sha256:0216993baeab4a6189984325e462137b1a07de2f256f1b9e49214a59bc07c045

Observation aabcead0-936a-4ad9-9929-e5d6cdbdf76a · outbound

This paper cites C., and Liu, Z.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models C., and Liu, Z

Reference 96

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:14.786001Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:14.786001Z digest=sha256:0453aa869fde13530839a18d0521ccb0a37ad7d5d890a704d9b13ba3b62c4cd9

Observation ef46bbe8-0ec8-4a86-b913-da9bd885d844 · outbound

This paper cites Rethinking Centered Kernel Alignment in Knowledge Distillation.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Rethinking Centered Kernel Alignment in Knowledge Distillation

Reference 97

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:14.790735Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:14.790735Z digest=sha256:bb94a41a8dd090515585e2807793bffe4dc04e339e3b513b1f9ef25d481d35c1

Observation 32880931-6e19-4a41-8cc9-ebf2088f0d25 · outbound

This paper cites write newline.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models write newline

Reference 98

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:14.795852Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:14.795852Z digest=sha256:3fb779146ca43c5e6501114546588ac2d6c025bc33c5d4d34141fc5688dbf18a

Pith citing papers

Observation d62736ac-a819-41bb-a7c7-eb0abf546778 · inbound

UniCon: Unified Framework for Efficient Contrastive Alignment via Kernels cites this paper.

UniCon: Unified Framework for Efficient Contrastive Alignment via Kernels Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models

Reference 3

Resolution
verified exact
arxiv_id, observed 2026-05-10T08:32:52.003486Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-10T08:32:36.729122Z digest=sha256:ad26da87829820a28436c96e7e627a1e0ec8732a6df5875d4a842b2a9da03981

Observation a3fff1ec-2d20-4ddc-ad54-cc96cf462af6 · inbound

Latent Denoising Improves Visual Alignment in Large Multimodal Models cites this paper.

Latent Denoising Improves Visual Alignment in Large Multimodal Models Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models

Reference 26

Resolution
verified exact
arxiv_id, observed 2026-05-09T23:09:26.700458Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-09T23:07:54.806529Z digest=sha256:f90e86c6b430d795581a66889576588ada24111cd877a8041fe668a252098cd1

Observation 5b84b43d-5e64-4629-a595-4b924cbc06b4 · inbound

A$_3$B$_2$: Adaptive Asymmetric Adapter for Alleviating Branch Bias in Vision-Language Image Classification with Few-Shot Learning cites this paper.

A$_3$B$_2$: Adaptive Asymmetric Adapter for Alleviating Branch Bias in Vision-Language Image Classification with Few-Shot Learning Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models

Reference 11

Resolution
verified exact
arxiv_id, observed 2026-05-14T19:17:51.075371Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-14T19:14:03.809826Z digest=sha256:812a0ddb8b552868c1b1005735021931d8c8410aa12b77373636687291eaf011

Observation 885178fa-8e7d-4394-a495-a60a3a927002 · inbound

A$_3$B$_2$: Adaptive Asymmetric Adapter for Alleviating Branch Bias in Vision-Language Image Classification with Few-Shot Learning cites this paper.

A$_3$B$_2$: Adaptive Asymmetric Adapter for Alleviating Branch Bias in Vision-Language Image Classification with Few-Shot Learning Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models

Reference 11

Resolution
verified exact
arxiv_id, observed 2026-05-20T22:09:07.135657Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-20T22:07:35.021986Z digest=sha256:5c64e718882f07adc8d5d0fd04469bd1e838af1cb1fd21d826f4883df8a9967d