Pith. sign in

Paper Citation Record · LEDGER

Language-Instructed Vision Embeddings for Controllable and Generalizable Perception

As of 6 August 2026, this Paper Citation Record lists 37 of 37 outbound references and 1 inbound Pith citation observation for arXiv:2606.19584.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2606.19584 v1

Coverage vector

measured 37 of 37 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-06-26T20:54:48.203293Z

measured 38 of 38 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-06T06:34:29.942622+00:00

measured 1 of 1 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-04T14:48:51.126553Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

37 of 37 outbound references displayed

  • verified exact23
  • verified fuzzy0
  • unresolved8
  • parse uncertain0
  • malformed identifier3
  • metadata mismatch3

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation b409a6b4-2b1c-469c-a19c-41e9306614ba · outbound

This paper cites Exploring Visual Prompts for Adapting Large-Scale Models.

Language-Instructed Vision Embeddings for Controllable and Generalizable Perception Exploring Visual Prompts for Adapting Large-Scale Models

Reference 1

Resolution
verified exact
arxiv_id, observed 2026-07-04T00:49:19.219783Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-06-26T20:54:48.203293Z digest=sha256:5f6ff2063af90793a0173c1d50060ee14c3a19d6bd61c7db62fb6bbfcd4a318b

Observation 4d801b32-0b86-45eb-a176-91299175cc09 · outbound

This paper cites PaliGemma: A versatile 3B VLM for transfer.

Language-Instructed Vision Embeddings for Controllable and Generalizable Perception PaliGemma: A versatile 3B VLM for transfer

Reference 2

Resolution
verified exact
local_arxiv, observed 2026-07-04T00:49:19.235400Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-06-26T20:54:48.203293Z digest=sha256:0b1a2b606500eb7cea20dd2cb1955cb0e21ab4e7b49f1220d09f3d946d0d7aff

Observation f65f8726-a036-4254-9f67-75bccbe48d5f · outbound

This paper cites All You May Need for VQA are Image Captions.

Language-Instructed Vision Embeddings for Controllable and Generalizable Perception All You May Need for VQA are Image Captions

Reference 3

Resolution
metadata mismatch
arxiv_id, observed 2026-07-04T00:49:19.182325Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-06-26T20:54:48.203293Z digest=sha256:dc8cff6330c0fe93441043635203e2facfee8e8373ae5b3c2a210dc19fc5dcc5

Observation 04765852-f0e7-47bf-a8a0-0e3d3f4d71f5 · outbound

This paper cites PaLI: A Jointly-Scaled Multilingual Language-Image Model.

Language-Instructed Vision Embeddings for Controllable and Generalizable Perception PaLI: A Jointly-Scaled Multilingual Language-Image Model

Reference 4

Resolution
verified exact
local_arxiv, observed 2026-07-04T00:49:19.151225Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-06-26T20:54:48.203293Z digest=sha256:af2416c2f99eb42d7c43b9f4ae9e6913ba72371c41dd87a5a467256d242fd4c4

Observation af8d776a-b5dc-4e54-93ff-56c205391feb · outbound

This paper cites Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities.

Language-Instructed Vision Embeddings for Controllable and Generalizable Perception Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities

Reference 5

Resolution
verified exact
local_arxiv, observed 2026-07-04T00:49:19.186065Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-06-26T20:54:48.203293Z digest=sha256:9b966966eced0bb9aa045920f4e74c7c55f66418e8f99a406c1d4bb6cc1e0c13

Observation fe8d1ff0-b339-427f-a452-b870f0b87148 · outbound

This paper cites Instructblip: Towards general-purpose vision-language models with instruction tuning.Advances in neural information processing systems, 36:49250–49267,.

Language-Instructed Vision Embeddings for Controllable and Generalizable Perception Instructblip: Towards general-purpose vision-language models with instruction tuning.Advances in neural information processing systems, 36:49250–49267,

Reference 6

Resolution
unresolved
no resolver link, observed 2026-06-26T20:54:48.203293Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-26T20:54:48.203293Z digest=sha256:6224b0d16f7f276ae7d42232286c72cbb969ffc047e51793fc5b383ce8861146

Observation d0a11f6c-9b33-4edd-a4bf-3dbaede5828b · outbound

This paper cites Selective Visual Representations Improve Convergence and Generalization for Embodied AI.

Language-Instructed Vision Embeddings for Controllable and Generalizable Perception Selective Visual Representations Improve Convergence and Generalization for Embodied AI

Reference 7

Resolution
verified exact
arxiv_id, observed 2026-07-04T00:49:19.230707Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-06-26T20:54:48.203293Z digest=sha256:c06290318397160ce96afb7ac0f1d7a89f6a4ab41bb6dbc13fc4f2c2e78a3c0f

Observation 74603111-ced3-4d18-9828-7fd57917637a · outbound

This paper cites Data Filtering Networks.

Language-Instructed Vision Embeddings for Controllable and Generalizable Perception Data Filtering Networks

Reference 8

Resolution
verified exact
arxiv_id, observed 2026-07-04T00:49:19.225762Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-06-26T20:54:48.203293Z digest=sha256:c1d23e909e74b8a55e0c7b07c2dc4b8abed0f6cd28cb4dff80c5a2708bd96aa0

Observation d0b878aa-956d-45f4-8003-365ac9d3cd15 · outbound

This paper cites The Llama 3 Herd of Models.

Language-Instructed Vision Embeddings for Controllable and Generalizable Perception The Llama 3 Herd of Models

Reference 9

Resolution
metadata mismatch
local_arxiv, observed 2026-07-04T00:49:19.239610Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-06-26T20:54:48.203293Z digest=sha256:88f3c59b30eb3d1eaf1582651a779f292a3168aa5b87740fe80a9941a3f25987

Observation 500065c9-714e-448b-823f-4fa100ce157f · outbound

This paper cites E5-V: Universal Embeddings with Multimodal Large Language Models.

Language-Instructed Vision Embeddings for Controllable and Generalizable Perception E5-V: Universal Embeddings with Multimodal Large Language Models

Reference 10

Resolution
verified exact
local_arxiv, observed 2026-07-04T00:49:19.214012Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-06-26T20:54:48.203293Z digest=sha256:f9424cbcbe68d019c464a61bc6e1abf88ca241d399bcc9be9c26bff77ce32a8a

Observation 0f3e7447-3d28-4bdd-bc44-5b2744a5d4ff · outbound

This paper cites Referitgame: Referring to objects in photographs of natural scenes.

Language-Instructed Vision Embeddings for Controllable and Generalizable Perception Referitgame: Referring to objects in photographs of natural scenes

Reference 11

Resolution
unresolved
no resolver link, observed 2026-06-26T20:54:48.203293Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-26T20:54:48.203293Z digest=sha256:36178984cc5c64aa0731098a83b21b99fbe756b1449229bdb04e495ce2de60ff

Observation 2f15f18c-c861-4fad-bd23-32145fe9126d · outbound

This paper cites Modeling Caption Diversity in Contrastive Vision-Language Pretraining.

Language-Instructed Vision Embeddings for Controllable and Generalizable Perception Modeling Caption Diversity in Contrastive Vision-Language Pretraining

Reference 12

Resolution
verified exact
arxiv_id, observed 2026-07-04T00:49:19.203184Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-06-26T20:54:48.203293Z digest=sha256:9e95607d733c72472bbd1deefa6e4780398b874fb49f1005f7e2d96df95febd1

Observation eb94859a-361c-4f75-bf42-d1c570f5915a · outbound

This paper cites Vx2text: End-to-end learning of video-based text generation from multimodal inputs.

Language-Instructed Vision Embeddings for Controllable and Generalizable Perception Vx2text: End-to-end learning of video-based text generation from multimodal inputs

Reference 13

Resolution
unresolved
no resolver link, observed 2026-06-26T20:54:48.203293Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-26T20:54:48.203293Z digest=sha256:6403528763b758a82549d31d42f792d814ef234a39d9dff6d10565a5fc47cd28

Observation db8e253e-c488-4afd-b7a7-b04411b59a66 · outbound

This paper cites Training-free deep concept injection enables language models for video question answering.

Language-Instructed Vision Embeddings for Controllable and Generalizable Perception Training-free deep concept injection enables language models for video question answering

Reference 14

Resolution
unresolved
no resolver link, observed 2026-06-26T20:54:48.203293Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-26T20:54:48.203293Z digest=sha256:899ced4d7f9ea5c2f4d286fdf9b9d3f67aed7a1a5b907b5b02880157615a93e0

Observation 24da8478-d867-4092-ad40-ec9f08a7b5fd · outbound

This paper cites Understanding Zero-Shot Adversarial Robustness for Large-Scale Models.

Language-Instructed Vision Embeddings for Controllable and Generalizable Perception Understanding Zero-Shot Adversarial Robustness for Large-Scale Models

Reference 15

Resolution
verified exact
arxiv_id, observed 2026-07-04T00:49:19.208818Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-06-26T20:54:48.203293Z digest=sha256:3753b37878c42e94a31c7b4a56125bcc262fdb1f796498534b480c7de5c0663d

Observation 075770d9-5c3b-40e0-99be-b6180696ee69 · outbound

This paper cites Visual Classification via Description from Large Language Models.

Language-Instructed Vision Embeddings for Controllable and Generalizable Perception Visual Classification via Description from Large Language Models

Reference 16

Resolution
verified exact
arxiv_id, observed 2026-07-04T00:49:19.244441Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-06-26T20:54:48.203293Z digest=sha256:038c8f0e1693903764629cc4fee8952faf0e2634a0a8bfb4128ae35ec4442259

Observation 39dc97ab-cd15-4c86-b94d-147a7176662e · outbound

This paper cites Task Bias in Vision-Language Models.

Language-Instructed Vision Embeddings for Controllable and Generalizable Perception Task Bias in Vision-Language Models

Reference 17

Resolution
verified exact
arxiv_id, observed 2026-07-04T00:49:19.264204Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-06-26T20:54:48.203293Z digest=sha256:d78b67cab188671b3cf2256cd3f8886a36d6cd7a6a8226bfa09a6bc704dc22c5

Observation 0ed28888-7932-4c8c-af28-f5be5c797b1d · outbound

This paper cites DINOv2: Learning Robust Visual Features without Supervision.

Language-Instructed Vision Embeddings for Controllable and Generalizable Perception DINOv2: Learning Robust Visual Features without Supervision

Reference 18

Resolution
verified exact
local_arxiv, observed 2026-07-04T00:49:19.186873Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-06-26T20:54:48.203293Z digest=sha256:e85c2ad18699b351b1e23040bcbd2438793b722fa46c43c40ee71e0ce0c2deb7

Observation b09248ad-332a-46dc-94bf-8d04a110f576 · outbound

This paper cites Pre-training image-language transformers for open-vocabulary tasks.

Language-Instructed Vision Embeddings for Controllable and Generalizable Perception Pre-training image-language transformers for open-vocabulary tasks

Reference 19

Resolution
metadata mismatch
arxiv_id, observed 2026-07-04T00:49:19.212641Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-06-26T20:54:48.203293Z digest=sha256:7741e34bb5515592f1eba6e3a54c50b729b28f9aad8c259c59c9aa23d2b94d9d

Observation 67f47f13-970e-4356-a8aa-cecdc6daa478 · outbound

This paper cites EVA-CLIP: Improved Training Techniques for CLIP at Scale.

Language-Instructed Vision Embeddings for Controllable and Generalizable Perception EVA-CLIP: Improved Training Techniques for CLIP at Scale

Reference 20

Resolution
verified exact
local_arxiv, observed 2026-07-04T00:49:19.177192Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-06-26T20:54:48.203293Z digest=sha256:9230982546d776151e28c65525b0c6fd1b6c6bf33d4d71b203e57adb8a1070c5

Observation b75a33ca-9a94-4554-8f86-a03749aacd6a · outbound

This paper cites X-Former: Unifying Contrastive and Reconstruction Learning for MLLMs.

Language-Instructed Vision Embeddings for Controllable and Generalizable Perception X-Former: Unifying Contrastive and Reconstruction Learning for MLLMs

Reference 21

Resolution
verified exact
arxiv_id, observed 2026-07-04T00:49:19.166875Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-06-26T20:54:48.203293Z digest=sha256:648f9251a9f2001200252b0ede8c5396bc5c5af971f19bf5e69df9cc178b4fed

Observation 650ab919-5ed6-4535-aa2b-f874432f07df · outbound

This paper cites Chameleon: Mixed-Modal Early-Fusion Foundation Models.

Language-Instructed Vision Embeddings for Controllable and Generalizable Perception Chameleon: Mixed-Modal Early-Fusion Foundation Models

Reference 22

Resolution
verified exact
local_arxiv, observed 2026-07-04T00:49:19.230531Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-06-26T20:54:48.203293Z digest=sha256:af68bae4d70d686933563e9a93da7e77611337ed0848eba06c713391cea5c907

Observation 6969ea20-7901-4607-abca-b9018cfccf80 · outbound

This paper cites Gemma 3 Technical Report.

Language-Instructed Vision Embeddings for Controllable and Generalizable Perception Gemma 3 Technical Report

Reference 23

Resolution
verified exact
local_arxiv, observed 2026-07-04T00:49:19.190898Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-06-26T20:54:48.203293Z digest=sha256:cbce59ec4ca53493f4df3570b225067ed9a96c2a2b9fda6f563cb6433cb3226f

Observation abfccb1c-3e97-4a79-b498-cd004b12dba1 · outbound

This paper cites SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features.

Language-Instructed Vision Embeddings for Controllable and Generalizable Perception SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features

Reference 24

Resolution
verified exact
local_arxiv, observed 2026-07-04T00:49:19.172207Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-06-26T20:54:48.203293Z digest=sha256:1976bee32470ecd580a4843823bb688859180e8c4ea6fb6f8dd1bbe113578f93

Observation bcf2fc55-31ca-4fa8-abe4-c2168bb3593c · outbound

This paper cites Scaling Pre-training to One Hundred Billion Data for Vision Language Models.

Language-Instructed Vision Embeddings for Controllable and Generalizable Perception Scaling Pre-training to One Hundred Billion Data for Vision Language Models

Reference 25

Resolution
verified exact
local_arxiv, observed 2026-07-04T00:49:19.195832Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-06-26T20:54:48.203293Z digest=sha256:9c0a2696a853ebf06d14bd39c496a4d1639a977431448e30644c3be788751969

Observation 0b3c985a-f1f3-4b88-b7af-7c74314198ab · outbound

This paper cites Demystifying CLIP Data.

Language-Instructed Vision Embeddings for Controllable and Generalizable Perception Demystifying CLIP Data

Reference 26

Resolution
verified exact
local_arxiv, observed 2026-07-04T00:49:19.181436Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-06-26T20:54:48.203293Z digest=sha256:d24c5ef57e9486fe8354610d08d8b16b781939e9440fd79c05bc9abc5217ebd2

Observation cf4f49d8-1f70-489b-8683-ce1c00aa6e29 · outbound

This paper cites Large Language Models as Optimizers.

Language-Instructed Vision Embeddings for Controllable and Generalizable Perception Large Language Models as Optimizers

Reference 27

Resolution
verified exact
local_arxiv, observed 2026-07-04T00:49:19.235077Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-06-26T20:54:48.203293Z digest=sha256:6263948a408ed466a64b32c556dd070806e5e0b833d64e2b68331cf658f4125e

Observation 950179fd-155c-499d-88e5-8da671c702dd · outbound

This paper cites CoCa: Contrastive Captioners are Image-Text Foundation Models.

Language-Instructed Vision Embeddings for Controllable and Generalizable Perception CoCa: Contrastive Captioners are Image-Text Foundation Models

Reference 28

Resolution
verified exact
local_arxiv, observed 2026-07-04T00:49:19.259387Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-06-26T20:54:48.203293Z digest=sha256:023bd76d530878f6d16dbd76166db6914bb6102aa67257afc7da1fce9e8970b4

Observation 34451644-0e85-47e9-980a-7eefb87abe42 · outbound

This paper cites Scaling vision transformers.

Language-Instructed Vision Embeddings for Controllable and Generalizable Perception Scaling vision transformers

Reference 29

Resolution
unresolved
no resolver link, observed 2026-06-26T20:54:48.203293Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-26T20:54:48.203293Z digest=sha256:8b4656a36e6be86f09b75b863f262aaae623ca528d54deac6db5d74ed88b40d6

Observation 43eea2a8-91f0-4808-b12d-7c5e1088cdb6 · outbound

This paper cites MagicLens: Self-Supervised Image Retrieval with Open-Ended Instructions.

Language-Instructed Vision Embeddings for Controllable and Generalizable Perception MagicLens: Self-Supervised Image Retrieval with Open-Ended Instructions

Reference 30

Resolution
verified exact
arxiv_id, observed 2026-07-04T00:49:19.250279Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-06-26T20:54:48.203293Z digest=sha256:92b7cced596920fc3cad40bfc3a9e3f6f15a4b7549003014f36989128cc2b1a1

Observation c764cc1d-0431-4631-ac7a-56970e5dd1b3 · outbound

This paper cites VISTA: Visualized Text Embedding For Universal Multi-Modal Retrieval.

Language-Instructed Vision Embeddings for Controllable and Generalizable Perception VISTA: Visualized Text Embedding For Universal Multi-Modal Retrieval

Reference 31

Resolution
verified exact
arxiv_id, observed 2026-07-04T00:49:19.255293Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-06-26T20:54:48.203293Z digest=sha256:821692372acddcebe8233a8d5ef83d22f1727b34b05ab00b2edf5117333a4b3b

Observation c24c57e1-e3a7-4ef1-b4f8-eda8f79322fb · outbound

This paper cites However, its practical application and further development are subject to certain limitations, which also open avenues for future research.

Language-Instructed Vision Embeddings for Controllable and Generalizable Perception However, its practical application and further development are subject to certain limitations, which also open avenues for future research

Reference 32

Resolution
unresolved
no resolver link, observed 2026-06-26T20:54:48.203293Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-26T20:54:48.203293Z digest=sha256:47b792d309ac67a4fc2c3059e8b6222969ad8377641a64107fda58712092785b

Observation 3026f273-31af-4762-aecd-544733f4dfb6 · outbound

This paper cites (2021), SigLip Zhai et al.

Language-Instructed Vision Embeddings for Controllable and Generalizable Perception (2021), SigLip Zhai et al

Reference 33

Resolution
unresolved
no resolver link, observed 2026-06-26T20:54:48.203293Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-26T20:54:48.203293Z digest=sha256:af9f3493633da925bf8c547c320ccf12ae0f5537f401fd32d316a827ef75978f

Observation b31ba3f7-e307-4343-9c7d-5eac1b8b6016 · outbound

This paper cites Interestingly, by leveraging Gemini to evolve and generate different text prompts Yang et al.

Language-Instructed Vision Embeddings for Controllable and Generalizable Perception Interestingly, by leveraging Gemini to evolve and generate different text prompts Yang et al

Reference 34

Resolution
malformed identifier
no resolver link, observed 2026-06-26T20:54:48.203293Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-26T20:54:48.203293Z digest=sha256:d89236612e807536445188c20389123dee51cf21b565c5fb14299824777e5f05

Observation 4afd2aa5-0bde-41c6-a55b-97b803725cd8 · outbound

This paper cites an unresolved cited work.

Language-Instructed Vision Embeddings for Controllable and Generalizable Perception Unresolved cited work

Reference 35

Resolution
malformed identifier
no resolver link, observed 2026-06-26T20:54:48.203293Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-26T20:54:48.203293Z digest=sha256:3b08bfe3d0e02fb26fe96e8e4f41866175c2c752675bb09538e7ea684ed0a075

Observation f6d734c5-ba85-4df6-843c-595b9a9c37be · outbound

This paper cites The resulting distribution, visualized in Figure 13, reveals significant variations in instruction fre- quency.

Language-Instructed Vision Embeddings for Controllable and Generalizable Perception The resulting distribution, visualized in Figure 13, reveals significant variations in instruction fre- quency

Reference 36

Resolution
malformed identifier
no resolver link, observed 2026-06-26T20:54:48.203293Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-26T20:54:48.203293Z digest=sha256:6cf21fa5f5ec8c27523f5fd40b2af4fa9cececc4b586fa8f463d56d31e4fdb1e

Observation 1f6a59b5-a165-44a2-99d0-43b7855c8550 · outbound

This paper cites an unresolved cited work.

Language-Instructed Vision Embeddings for Controllable and Generalizable Perception Unresolved cited work

Reference 37

Resolution
unresolved
no resolver link, observed 2026-06-26T20:54:48.203293Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-26T20:54:48.203293Z digest=sha256:7589764a06acdbf7cdab928809235b2cb3f5f6a409f16fc5b41f0fd884bdeff3

Pith citing papers

Observation bfdd4eff-2c2d-400e-bbbe-6f7e1f2e63ef · inbound

HAFI-VLM: A Frequency Perspective for Diagnosing and Enhancing Visual Perception in Vision-Language Models cites this paper.

HAFI-VLM: A Frequency Perspective for Diagnosing and Enhancing Visual Perception in Vision-Language Models Language-Instructed Vision Embeddings for Controllable and Generalizable Perception

Reference 68

Resolution
unresolved
no resolver link, observed 2026-08-04T14:48:51.126553Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T14:48:51.126553Z digest=sha256:0a2a5c0b69d948c44e52df4c51369a1089fb74216b1339f8a0a2fb1f74d3271f