Pith. sign in

Paper Citation Record · LEDGER

FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training

As of 13 August 2026, this Paper Citation Record lists 65 of 65 outbound references and 1 inbound Pith citation observation for arXiv:2411.11927.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2411.11927 v3

Coverage vector

measured 65 of 65 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-12T18:38:19.066615Z

measured 66 of 66 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-13T06:32:02.005865+00:00

measured 1 of 1 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-03T04:20:50.578691Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

65 of 65 outbound references displayed

  • verified exact0
  • verified fuzzy39
  • unresolved25
  • parse uncertain0
  • malformed identifier1
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 5fc2996f-d8e4-4fdc-8e1c-b26acbc91c16 · outbound

This paper cites Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone.

FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-12T18:38:18.787439Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T18:38:18.787439Z digest=sha256:8566c96e3dbd1d806784ad65cea929d13a58817c9b1a47d7809da6cab9004e3e

Observation 771fe683-689f-441d-b6e9-682a5f800c57 · outbound

This paper cites GPT-4 Technical Report.

FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training GPT-4 Technical Report

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-12T18:38:18.792629Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T18:38:18.792629Z digest=sha256:d61a096553ae67ace08182f6a015f0742dfcdc2aae23f1480f25b73753ad0ae8

Observation 660777d5-cb9c-4b98-b151-3a197f179d4e · outbound

This paper cites Qwen Technical Report.

FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training Qwen Technical Report

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-12T18:38:18.797615Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T18:38:18.797615Z digest=sha256:af273d5607b5ce7ecc5e110dca1ba1e446592f60fd8ea46ee77a14290ee8a2c5

Observation ffdf892f-bd6e-4a73-abd7-c55e88b008fd · outbound

This paper cites Is a 3D-Tokenized LLM the Key to Reliable Autonomous Driving?.

FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training Is a 3D-Tokenized LLM the Key to Reliable Autonomous Driving?

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-12T18:38:18.802194Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T18:38:18.802194Z digest=sha256:71ad5d8dc3df459f2471b6099231ec324f1287dd4e1c5173c01fa71a875e69f2

Observation 4c869d3f-597c-4e61-92cc-3786a74a9fb0 · outbound

This paper cites Ar- trackv2: Prompting autoregressive tracker where to look and how to describe.

FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training Ar- trackv2: Prompting autoregressive tracker where to look and how to describe

Reference 5

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T18:38:19.991922Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T18:38:18.806733Z digest=sha256:66acb9d6faff2570c5d53088bc84d94ab9c3073a2f1c438ee62793c048781529

Observation c4c56f93-3de8-484b-a1ad-86a340e98125 · outbound

This paper cites LLM2Vec: Large Language Models Are Secretly Powerful Text Encoders.

FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training LLM2Vec: Large Language Models Are Secretly Powerful Text Encoders

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-12T18:38:18.810790Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T18:38:18.810790Z digest=sha256:8bf99f8e40aa470964244380eaaa25fe358f953784fafd4a5305f57604544bbd

Observation 5e25dad2-cdbc-4c67-a9af-08fa36885ddf · outbound

This paper cites Language models are few-shot learners.

FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training Language models are few-shot learners

Reference 7

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T18:38:19.981028Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T18:38:18.815209Z digest=sha256:a40ebe6533eb22f1bc42ddae17c57b5c935ad47dcccb2bc2072eb1a32185a8b2

Observation 0c0df006-4258-4b48-ba93-2aa5bcbf47b9 · outbound

This paper cites Cross-lingual and multilingual clip.

FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training Cross-lingual and multilingual clip

Reference 8

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T18:38:19.968846Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T18:38:18.819267Z digest=sha256:89c360b049cf353a328bca392b395c47488f9b37037809603bad6b0c14bd6c02

Observation f2176700-0419-4c48-b9f3-f506a023749c · outbound

This paper cites ShareGPT4V: Improving Large Multi-Modal Models with Better Captions.

FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training ShareGPT4V: Improving Large Multi-Modal Models with Better Captions

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-12T18:38:18.823234Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T18:38:18.823234Z digest=sha256:575db86c2e8f7157dee885e2da4e8648ce5427bfc49c0eb9a4ff80a8b59eca05

Observation 99a2709e-9a1a-4d99-890b-3cf78d420f12 · outbound

This paper cites Pali: A jointly- scaled multilingual language-image model.

FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training Pali: A jointly- scaled multilingual language-image model

Reference 10

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T18:38:19.954196Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T18:38:18.827882Z digest=sha256:1a94b48a2b24457da581582f6d969437c268e18eb5cbc6fd042d2f5c573c751f

Observation d1b03554-275a-471a-bd59-81be51e97053 · outbound

This paper cites Altclip: Altering the language encoder in clip for extended language capabilities.

FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training Altclip: Altering the language encoder in clip for extended language capabilities

Reference 11

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T18:38:19.941293Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T18:38:18.833993Z digest=sha256:2fb017473e221c5bf0c3f3533f4aca273d4721136ee5a1e82fbb0b9652605ef1

Observation 818f101b-df01-47cb-9ef8-8d580dbea403 · outbound

This paper cites Maskclip: Masked self-distillation advances contrastive language-image pretraining.

FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training Maskclip: Masked self-distillation advances contrastive language-image pretraining

Reference 12

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T18:38:19.927385Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T18:38:18.840322Z digest=sha256:269f827db095b8d97a4ddf7ba1db584b2733aa3d94baec39d19cf0de2f26ffb2

Observation d7465e84-03ff-4c58-ba74-e7446b4560ab · outbound

This paper cites An image is worth 16x16 words: Transform- ers for image recognition at scale.

FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training An image is worth 16x16 words: Transform- ers for image recognition at scale

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T18:38:19.906995Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T18:38:18.845096Z digest=sha256:54e38602e313c4f6c50998372079eb02106836cc5585bcc667d0487128c7aa8b

Observation 10bec2c1-eddb-469a-9391-df7cae57fefa · outbound

This paper cites Improving clip training with language rewrites.

FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training Improving clip training with language rewrites

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T18:38:19.891952Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T18:38:18.849417Z digest=sha256:2d06a8db4439e99e2a63d7ae7eca0a00d022b7d76617b4f8c27c2e2e34a5ecc0

Observation 2dc147cf-df78-40ce-8f07-695493844f6b · outbound

This paper cites Pyramidclip: Hierarchical feature alignment for vision-language model pretraining.

FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training Pyramidclip: Hierarchical feature alignment for vision-language model pretraining

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-12T18:38:18.853452Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T18:38:18.853452Z digest=sha256:a9c4646306be278e00b9ee707062371154e5c085c46e46078b0d221c0faaad31

Observation f562151e-0523-4909-994a-422254de4be5 · outbound

This paper cites Softclip: Softer cross-modal alignment makes clip stronger.

FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training Softclip: Softer cross-modal alignment makes clip stronger

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T18:38:19.873648Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T18:38:18.857225Z digest=sha256:da03a3317d3d3e7710d90552f6b1ad8ba93e5450219f9eca87b5fd7b9190790d

Observation a44e35a2-0ca5-42d9-9767-00719897ee77 · outbound

This paper cites Hiclip: Contrastive language-image pre- training with hierarchy-aware attention.

FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training Hiclip: Contrastive language-image pre- training with hierarchy-aware attention

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T18:38:19.861679Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T18:38:18.861394Z digest=sha256:c249ff92b2d89f7ef164adc9508a9445b6c03187a106322154392b6770eae049

Observation f8b962ac-6dc7-4488-a66d-56777c37f4a0 · outbound

This paper cites Sugarcrepe: Fixing hack- able benchmarks for vision-language compositionality.

FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training Sugarcrepe: Fixing hack- able benchmarks for vision-language compositionality

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T18:38:19.849945Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T18:38:18.865235Z digest=sha256:8662208735439b207f434d85c15edc46a556e30bc9030ceb200ccb5237ea8749

Observation 8a850156-b50c-410f-a52f-a7e55f11e682 · outbound

This paper cites Openclip, 2021.

FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training Openclip, 2021

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T18:38:19.837127Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T18:38:18.869235Z digest=sha256:11712302ee7101458471d3953d8f62a8ff84cd5a44d32acff799186139e3eadc

Observation cd64749d-6852-4338-bceb-c524d5dfda4c · outbound

This paper cites Scaling up visual and vision-language representation learning with noisy text supervision.

FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training Scaling up visual and vision-language representation learning with noisy text supervision

Reference 20

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T18:38:19.824649Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T18:38:18.873432Z digest=sha256:f7ed3a8f2996707468eb00f221fcada41ea009c9e0ec07dc4e62e8b44faaf029

Observation 00cb0a3b-3899-409a-b0e7-2a1a893c0f8f · outbound

This paper cites Mistral 7B.

FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training Mistral 7B

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-12T18:38:18.878448Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T18:38:18.878448Z digest=sha256:2717b094826e06753045f1f976c9fd78f4e3b5f647ad2d3757994c87e25879e3

Observation 8d033562-e4e6-40c2-97d8-eb4b9b788d4f · outbound

This paper cites Scaling Sentence Embeddings with Large Language Models.

FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training Scaling Sentence Embeddings with Large Language Models

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-12T18:38:18.882734Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T18:38:18.882734Z digest=sha256:82d42d76a74940fd31241c8e0b519d48a6e8779d488eddfecc538f2673c3ebb4

Observation 9523231a-5fe3-433f-b323-a0f5e73eb07c · outbound

This paper cites Misalign, contrast then distill: Rethinking misalign- ments in language-image pre-training.

FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training Misalign, contrast then distill: Rethinking misalign- ments in language-image pre-training

Reference 23

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T18:38:19.812134Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T18:38:18.886495Z digest=sha256:7327790cab9f76f9ce90dc2f62d5a00dc8302079c75314e57f3ac70b8e1eb0fe

Observation 03a6eaf3-1f33-47d8-b5fd-cbadd5602711 · outbound

This paper cites Jina CLIP: Your CLIP Model Is Also Your Text Retriever.

FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training Jina CLIP: Your CLIP Model Is Also Your Text Retriever

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-12T18:38:18.890177Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T18:38:18.890177Z digest=sha256:022c87e3f3226d16c53f1df8458e2d3cfbcabc739386cf8b210bf8ed9027767a

Observation df8046fa-aa08-4e92-9781-8bcb8859ac51 · outbound

This paper cites VeCLIP: Improving CLIP Training via Visual-enriched Captions.

FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training VeCLIP: Improving CLIP Training via Visual-enriched Captions

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-12T18:38:18.894281Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T18:38:18.894281Z digest=sha256:d3d693f136d8122979c3fd9fdebf5a299716c47f6a31926d43ffdb45e3da585c

Observation e468e0e3-9f0b-4f11-9434-debbc4ba3d07 · outbound

This paper cites Uni- clip: Unified framework for contrastive language-image pre- training.

FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training Uni- clip: Unified framework for contrastive language-image pre- training

Reference 26

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T18:38:19.800689Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T18:38:18.898476Z digest=sha256:470f921f226ebccbe0fdae602711d4cf2961af9bfb6900adf4b4f86e0172926b

Observation e9c16874-4ff8-4c72-9d0b-036dbe818bdc · outbound

This paper cites Gecko: Versatile Text Embeddings Distilled from Large Language Models.

FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training Gecko: Versatile Text Embeddings Distilled from Large Language Models

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-12T18:38:18.902333Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T18:38:18.902333Z digest=sha256:14964dc40a7f559dda216bf7a5e52a4ac6c7f2feb38e885e6a90f34c20a3c482

Observation 10ee5516-cff1-45b8-be52-193017adfe4b · outbound

This paper cites Meta-task prompting elicits embedding from large language models.

FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training Meta-task prompting elicits embedding from large language models

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T18:38:19.788710Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T18:38:18.906723Z digest=sha256:248d8bc519ee6c63eb062e203fc8ccc199967a996ff7977d3af0e2bb422258b2

Observation 6eccc694-931a-4ab0-8990-fbe6fecc8037 · outbound

This paper cites Scene graph generation: A comprehensive survey.

FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training Scene graph generation: A comprehensive survey

Reference 29

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T18:38:19.775909Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T18:38:18.910853Z digest=sha256:5284b91f3d79c736a56094787a1c49615edff1bd671e7179af29564776480b9c

Observation 16d083a4-7b19-4f7e-861f-e3aa071eb484 · outbound

This paper cites Grounded language- image pre-training.

FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training Grounded language- image pre-training

Reference 30

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T18:38:19.764217Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T18:38:18.914822Z digest=sha256:6f390e18fa433cfb8f30fd20d22dd8754e907109e08056bcb42838def4027ece

Observation c291c074-5c93-4778-b7b3-73303cae886f · outbound

This paper cites An inverse scaling law for clip training.

FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training An inverse scaling law for clip training

Reference 31

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T18:38:19.752353Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T18:38:18.919615Z digest=sha256:b84a9ee2d213148d5b4a7ddfbd83e6b726a23a49d22eb495d8df4f6f4e267e14

Observation ad7acedf-ad08-4128-aa9b-576f699a806f · outbound

This paper cites Scene graph generation from objects, phrases and region captions.

FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training Scene graph generation from objects, phrases and region captions

Reference 32

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T18:38:19.741521Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T18:38:18.923463Z digest=sha256:097f195db337cead6e2988e7543e5070a4ec970b66b3fde59249229283a796aa

Observation a00fbd1f-04a6-4e30-bb3a-28cd27b1015b · outbound

This paper cites Supervi- sion exists everywhere: A data efficient contrastive language- image pre-training paradigm.

FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training Supervi- sion exists everywhere: A data efficient contrastive language- image pre-training paradigm

Reference 33

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T18:38:19.729879Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T18:38:18.927328Z digest=sha256:ff6c73260ee73aa0ac5f704b0b44effa7dc3b130d5a7f1b4d8a07f5e7730f8b5

Observation 27244eb8-92a5-4a14-9c51-e2409d99e880 · outbound

This paper cites Scaling language-image pre-training via masking.

FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training Scaling language-image pre-training via masking

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-12T18:38:18.931234Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T18:38:18.931234Z digest=sha256:efd2bc9f087e3014f99a4861d0b93db64b3af8898cc19a911aa9957097351b39

Observation 7358f3c8-a38c-4ecc-ac23-1f39083baa42 · outbound

This paper cites Language quantized autoencoders: Towards unsupervised text-image alignment.

FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training Language quantized autoencoders: Towards unsupervised text-image alignment

Reference 35

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T18:38:19.709761Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T18:38:18.935183Z digest=sha256:72ebe60a0d8e71ed6bffc32fc7903e5dfdd63d3ddbbae4e331c74d44cebd945c

Observation 07d857dd-9ef6-473b-aeff-8efc72d12d18 · outbound

This paper cites MLLMs-Augmented Visual-Language Representation Learning.

FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training MLLMs-Augmented Visual-Language Representation Learning

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-12T18:38:18.940013Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T18:38:18.940013Z digest=sha256:f15ca62d1411ffef04eeb7c910becfeea2f31f63ccf34acd604d4dbddd97f3af

Observation eb291ae4-5fcb-422f-bd0d-46559506bd91 · outbound

This paper cites Decoupled Weight Decay Regularization.

FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training Decoupled Weight Decay Regularization

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-12T18:38:18.944402Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T18:38:18.944402Z digest=sha256:253e2be3780c949f4100998279039851f974a51b52b805a26dfae1d66a9ed9ac

Observation 0686173c-cdf0-4d4b-b1df-3615ec2ce85e · outbound

This paper cites Slip: Self-supervision meets language-image pre- training.

FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training Slip: Self-supervision meets language-image pre- training

Reference 38

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T18:38:19.696620Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T18:38:18.948730Z digest=sha256:7af9ee2e5ff9d2e08cfad0483d95a6f05f93ebcb31dc52ab2ef0243ca7ecdb96

Observation ecf32336-bbed-4254-bbdc-e17cb97b2bcf · outbound

This paper cites Generative Representational Instruction Tuning.

FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training Generative Representational Instruction Tuning

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-12T18:38:18.952619Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T18:38:18.952619Z digest=sha256:36f285bc00f0201d91414a536eafb3a09d27364746be1e36186947c2294f8f30

Observation e9fcf66c-1c73-49af-a6c7-910c486ad503 · outbound

This paper cites Docci: De- scriptions of connected and contrasting images.

FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training Docci: De- scriptions of connected and contrasting images

Reference 40

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T18:38:19.683887Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T18:38:18.956758Z digest=sha256:951b17defac69c5e92d424cf27ece6cb646822b2d88ae4e31ca8ac0cf5416bec

Observation 37cbdc5f-e82c-4926-8245-1520109e40ca · outbound

This paper cites Learning transferable visual models from natural language supervision.

FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training Learning transferable visual models from natural language supervision

Reference 41

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T18:38:19.670928Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T18:38:18.960633Z digest=sha256:461c7eb280d6ccae5716b2375fd683609459ae88ac8357814834fe940c8b3fa3

Observation 5d1b15dd-82f4-4705-b955-ae8943f16fcc · outbound

This paper cites High-resolution image synthesis with latent diffusion models.

FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training High-resolution image synthesis with latent diffusion models

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-12T18:38:18.964348Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T18:38:18.964348Z digest=sha256:6f421c6c72e7b4eb22f17461d18b5d3788a440bc475e11d38e7b5291b396f3ba

Observation 00ea4c14-7c8a-47b0-b0eb-3be3273f8e55 · outbound

This paper cites Conceptual captions: A cleaned, hypernymed, image alt-text dataset for automatic image captioning.

FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training Conceptual captions: A cleaned, hypernymed, image alt-text dataset for automatic image captioning

Reference 43

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T18:38:19.648904Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T18:38:18.968709Z digest=sha256:d2ca3e2e9d387c4d2b54f2cc9770eb633807ce029349b3cfe6943e91ea529969

Observation b94bf483-407b-4f26-b040-3338f133aeb3 · outbound

This paper cites Repetition Improves Language Model Embeddings.

FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training Repetition Improves Language Model Embeddings

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-12T18:38:18.973434Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T18:38:18.973434Z digest=sha256:3f4acd40bad6e5c8423fff3bc091a80d6f12c0a61a16fd232ff4c3386e267ee2

Observation 1b1a5244-7d1c-4258-b856-f9a6ca575b3c · outbound

This paper cites EVA-CLIP: Improved Training Techniques for CLIP at Scale.

FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training EVA-CLIP: Improved Training Techniques for CLIP at Scale

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-12T18:38:18.979973Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T18:38:18.979973Z digest=sha256:1698c7afff964d65b473f16ec68a19d5930269bfdf7d4d32701b72eaad6c9e8a

Observation 64e4cd87-453e-4e07-aac4-042fc769be0f · outbound

This paper cites Crossmodal-3600: A massively multilingual multi- modal evaluation dataset.

FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training Crossmodal-3600: A massively multilingual multi- modal evaluation dataset

Reference 46

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T18:38:19.635017Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T18:38:18.985183Z digest=sha256:fa7e1a71a17a2fe3db204a17091e65cc53953f317db1b8b65b67d0cfd4260393

Observation a603a36f-318c-49e6-9fb0-e34cf50d15a4 · outbound

This paper cites Winoground: Probing vision and language models for visio- linguistic compositionality.

FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training Winoground: Probing vision and language models for visio- linguistic compositionality

Reference 47

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T18:38:19.620165Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T18:38:18.989037Z digest=sha256:c22b414219a431129091d7fffd601f4ab8d329cbb2e8ee3b87e7f68d5cbdc90d

Observation 49222733-a491-46c9-accc-61f176f490a4 · outbound

This paper cites Stablerep: Synthetic images from text-to- image models make strong visual representation learners.

FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training Stablerep: Synthetic images from text-to- image models make strong visual representation learners

Reference 48

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T18:38:19.608271Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T18:38:18.992900Z digest=sha256:180e352ad2eb00dbd834593780e2e3691cf07389f62cfbeec78826e445ca7cfe

Observation 3d212d76-ad4e-4472-a9a6-86c71f9e7b44 · outbound

This paper cites Llama 2: Open Foundation and Fine-Tuned Chat Models.

FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training Llama 2: Open Foundation and Fine-Tuned Chat Models

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-12T18:38:18.997000Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T18:38:18.997000Z digest=sha256:d3458c6838d69e6423d3723f93a4498eb9556093a755ba87c665b674b8a91a43

Observation 181ea0ff-5cca-4aec-aaee-a07ffa20816e · outbound

This paper cites Multimodal few-shot learning with frozen language models.

FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training Multimodal few-shot learning with frozen language models

Reference 50

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T18:38:19.596000Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T18:38:19.001300Z digest=sha256:94bf877a65b4add6572d6df7fffc8e09eef2921ae059fe1c8a44f21ed45d23e6

Observation ee888382-854d-4e60-8872-239e223ef6e8 · outbound

This paper cites NLLB-CLIP -- train performant multilingual image retrieval model on a budget.

FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training NLLB-CLIP -- train performant multilingual image retrieval model on a budget

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-12T18:38:19.006394Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T18:38:19.006394Z digest=sha256:ca64aa85111ee06ba9b53f1663f8ef6b7f6ca9e302619cc97cee45f78e5ae74d

Observation b07fbd1e-0b69-4a54-bc5e-52af05dbb357 · outbound

This paper cites Improving Text Embeddings with Large Language Models.

FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training Improving Text Embeddings with Large Language Models

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-12T18:38:19.011691Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T18:38:19.011691Z digest=sha256:8d4c4acbb9b35695a1f438dc3963129b3147998662dfc7dde00be8d8a4f64f9c

Observation ef407a48-25e3-4da7-8ac7-cbc02f5c9153 · outbound

This paper cites Groupvit: Semantic segmentation emerges from text supervision.

FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training Groupvit: Semantic segmentation emerges from text supervision

Reference 53

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T18:38:19.584093Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T18:38:19.017503Z digest=sha256:e8687155772d248cac781054ead390ef89b9667654c6ea89cb56d2dcb98c766a

Observation 5ba97f96-d30f-4d48-8a22-a1c68accd075 · outbound

This paper cites Chinese CLIP: Contrastive Vision-Language Pretraining in Chinese.

FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training Chinese CLIP: Contrastive Vision-Language Pretraining in Chinese

Reference 54

Resolution
unresolved
no resolver link, observed 2026-08-12T18:38:19.021241Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T18:38:19.021241Z digest=sha256:5f0afada10146ba5f419de43eabb139c1fd68ffebafd0f3b4f6961717a245ae2

Observation 0d6bbb8b-f28e-4df6-b230-c09b5f4bffa4 · outbound

This paper cites Alip: Adaptive language-image pre-training with synthetic caption.

FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training Alip: Adaptive language-image pre-training with synthetic caption

Reference 55

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T18:38:19.572338Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T18:38:19.025421Z digest=sha256:b862ce0a904d25650cbfa732af35d7b731f97043eb9bb650e5bf5ddf8b9fc2d8

Observation 08a0c0fb-f71e-41cd-9394-4ac6a690eb78 · outbound

This paper cites FILIP: Fine-grained Interactive Language-Image Pre-Training.

FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training FILIP: Fine-grained Interactive Language-Image Pre-Training

Reference 56

Resolution
unresolved
no resolver link, observed 2026-08-12T18:38:19.029722Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T18:38:19.029722Z digest=sha256:3dca6b57c9a90feb5ca47b6231c878a6264ebdd2e82ee1caadeeee25937788c6

Observation b9688f0f-3c42-4e1c-8b41-f20410f578c1 · outbound

This paper cites CoCa: Contrastive Captioners are Image-Text Foundation Models.

FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training CoCa: Contrastive Captioners are Image-Text Foundation Models

Reference 57

Resolution
unresolved
no resolver link, observed 2026-08-12T18:38:19.034360Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T18:38:19.034360Z digest=sha256:99ebcc74cdec1fcbc1235bda79539d4090e1af06e4407645105c8ded11e5c7bb

Observation 6700abaa-d14e-4096-b8d4-80892ca4f79f · outbound

This paper cites Spae: Semantic pyramid autoencoder for multimodal generation with frozen llms.

FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training Spae: Semantic pyramid autoencoder for multimodal generation with frozen llms

Reference 58

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T18:38:19.456970Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T18:38:19.038843Z digest=sha256:f760e4d8dd117cce950bd0322cec5f1fff9863ecda8dedbd8cf14645c8f48f23

Observation 46fbb959-e44a-465c-a66f-4232af836c81 · outbound

This paper cites Lit: Zero-shot transfer with locked-image text tuning.

FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training Lit: Zero-shot transfer with locked-image text tuning

Reference 59

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T18:38:19.445829Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T18:38:19.042838Z digest=sha256:a7cb03232dbcbc4e50a1c8099ab7a0d2352ee26bf03b3dfb9a268478ba50d160

Observation 24684c16-7b27-4655-9deb-003400c7547c · outbound

This paper cites Sigmoid loss for language image pre-training.

FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training Sigmoid loss for language image pre-training

Reference 60

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T18:38:19.433717Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T18:38:19.046846Z digest=sha256:1cf5dd7681fd609a623124ac8fccf5212677a11b14bad399f8584a02b2b9da9e

Observation 0a8f4552-a5fc-4809-bdf8-9683dbfab0d1 · outbound

This paper cites Simple techniques for enhancing sentence embeddings in generative language models.

FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training Simple techniques for enhancing sentence embeddings in generative language models

Reference 61

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T18:38:19.420132Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T18:38:19.051036Z digest=sha256:8e392469efeb24c963cb9387cd1ed6f432137bdf8fe7157bc340e19c0474fb46

Observation 688377fb-d2d8-4516-b32b-70dc64e34dc9 · outbound

This paper cites Long-clip: Unlocking the long-text capability of clip.

FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training Long-clip: Unlocking the long-text capability of clip

Reference 62

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T18:38:19.406652Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T18:38:19.054747Z digest=sha256:28e8fb5fd962de9e93c2aaf9555a96744bf4bb24f1cb04dbed48f11d8b78d5e6

Observation d5678b42-79b4-4865-aee6-2f0a69950a5f · outbound

This paper cites Dreamlip: Language- image pre-training with long captions.

FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training Dreamlip: Language- image pre-training with long captions

Reference 63

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T18:38:19.394875Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T18:38:19.058927Z digest=sha256:45859ff6e29d142ed063e6debf1088dfe5b802e6f2251a23f5863241e60e5fe9

Observation 31db733f-781e-4cc3-a199-1dcc8e19c9c8 · outbound

This paper cites Beyond text: Frozen large language models in visual signal comprehension.

FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training Beyond text: Frozen large language models in visual signal comprehension

Reference 64

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T18:38:19.382821Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T18:38:19.062778Z digest=sha256:1f668db5835ac77fcb414254a6b4eb9551d6b45a3751b49a8adf5073d07aeee1

Observation bbb638db-a5df-4c67-a476-1f77e401f0d7 · outbound

This paper cites yi”. After thinking step by step, the category of the main object in this image means in just one word:.

FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training yi”. After thinking step by step, the category of the main object in this image means in just one word:

Reference 65

Resolution
malformed identifier
raw_fallback, observed 2026-08-12T18:38:19.370466Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T18:38:19.066615Z digest=sha256:42e4f06ac1916cbbfa75d99cabbb474aeedb62895fad1000e5bb85741a5a593c

Pith citing papers

Observation dccbc202-eb71-431c-a90a-e929ada7b54e · inbound

Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs cites this paper.

Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-03T04:20:50.578691Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T04:20:50.578691Z digest=sha256:93e83fb1a355ab54b5a14958b30c02f9e61a0d917b47a4b301a8e21e6a9a0053