Pith. sign in

Paper Citation Record · LEDGER

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey

As of 12 August 2026, this Paper Citation Record lists 100 of 229 outbound references and 0 inbound Pith citation observations for arXiv:2412.08158.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2412.08158 v1

Coverage vector

measured 100 of 229 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-11T18:11:54.632569Z

measured 100 of 100 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-12T06:34:41.77262+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

100 of 229 outbound references displayed

  • verified exact8
  • verified fuzzy0
  • unresolved92
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 465a3771-17b5-4231-846f-1cc1323618ff · outbound

This paper cites Multimodal research in vision and language: A review of current and emerging trends,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Multimodal research in vision and language: A review of current and emerging trends,

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.151310Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.151310Z digest=sha256:1b5ba3e871c63eb65f6a79f39118f1568a2cf3d56d1147c441bfa5a590d125c5

Observation e66d460d-6aa1-481a-a634-6b91c7030011 · outbound

This paper cites Vision+ language applications: A survey,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Vision+ language applications: A survey,

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.156570Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.156570Z digest=sha256:ec2e7db22a01e370ab2b7d7b8da40444cf3e1944e8de1e2637399b7969428517

Observation 6b767473-ee29-4f33-b9f8-cbfc86dd314d · outbound

This paper cites Bottom-up and top-down attention for image captioning and visual question answering,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Bottom-up and top-down attention for image captioning and visual question answering,

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.161338Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.161338Z digest=sha256:a1ef2748a971023c0dcf57f40aa90966995908423a96fe2eac920fe86aa8d8ef

Observation 7b637dd1-c0a8-4628-b170-8131f064ef99 · outbound

This paper cites Swinbert: End-to-end transformers with sparse attention for video captioning,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Swinbert: End-to-end transformers with sparse attention for video captioning,

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.166132Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.166132Z digest=sha256:fd54e486479f4ae51755aef242a9c320450bc9f218d17711281ef227000bd4bc

Observation 0d68d81b-31f0-4f7b-8883-95817f80ffb7 · outbound

This paper cites Vqa: Visual question answering,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Vqa: Visual question answering,

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.170653Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.170653Z digest=sha256:72f409a0b7d221612eece20e0bf1c8a59bbf1f3c97354cc27c4f1ac161435241

Observation 80602856-cd1a-40fa-baf5-3d5d9bb7d2c7 · outbound

This paper cites Movieqa: Understanding stories in movies through question- answering,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Movieqa: Understanding stories in movies through question- answering,

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.175805Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.175805Z digest=sha256:a34b78107a57eb14cee40d93330a085e64560762b09a519380380c9c7c9d153e

Observation 4d63aff3-6753-4266-84fc-e51fd504f63c · outbound

This paper cites Context-aware attention network for image-text retrieval,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Context-aware attention network for image-text retrieval,

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.181811Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.181811Z digest=sha256:9af4e8e42d0c7c26119a88e81dd03a03c6b3b92a1865d49f0a2d62f6d170fcbd

Observation a0348ba6-a5ba-4010-9c44-d6577e71f2fe · outbound

This paper cites Fine-grained video-text retrieval with hierarchical graph reasoning,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Fine-grained video-text retrieval with hierarchical graph reasoning,

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.186677Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.186677Z digest=sha256:c5909a953b9ef0ee70a65b0836f58c4c40d768327582c30a7a644f0da38a0b9b

Observation 62a87f97-baf3-4fd0-af55-356f5642acd2 · outbound

This paper cites Visual classification via description from large language models,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Visual classification via description from large language models,

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.191266Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.191266Z digest=sha256:17b7c1db90ae12ee8fd329b4ffde0a8e3743013aa9064680c777b7f0a56a8593

Observation 8d00e512-bfd5-431c-b450-887cb665d8c2 · outbound

This paper cites Learning concise and descriptive attributes for visual recognition,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Learning concise and descriptive attributes for visual recognition,

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.195864Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.195864Z digest=sha256:d67351f1e84fbdc388f0c1d0215a817fe993c2fdcccdad1447157557f71f5681

Observation 7384dc51-6dad-4064-8d14-69096b248792 · outbound

This paper cites Exploring large language models for multi-modal out-of-distribution detection,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Exploring large language models for multi-modal out-of-distribution detection,

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.201342Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.201342Z digest=sha256:9f1ed020f59cafa1bd43610335ffe688fa9ace588c6f5c47e08e232f26c684e0

Observation 37c035fb-ab3d-44eb-9a01-a2425d584e56 · outbound

This paper cites Chatgpt-powered hierarchical comparisons for image classification,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Chatgpt-powered hierarchical comparisons for image classification,

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.206793Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.206793Z digest=sha256:3af8ee0100754f6aef5ea337fc39322d440eaaeab41fdea3d9659c0cfd954576

Observation 113f8511-064d-4e5d-9e0d-58c165307694 · outbound

This paper cites Vision-language pre-training: Basics, recent advances, and future trends,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Vision-language pre-training: Basics, recent advances, and future trends,

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.211313Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.211313Z digest=sha256:1bcbadeb3d3e81ead70040a55bbc4db7b9cd5fef0224a6bfba62def28ea6682d

Observation c6d701e4-6fe3-4ef0-ae53-625cbee3e4e7 · outbound

This paper cites Show and tell: A neural image caption generator,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Show and tell: A neural image caption generator,

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.216289Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.216289Z digest=sha256:9d70423a0d0bf158fb9b16aa5f19cbe7961ea5690d49ee3ab7b96437a76b2038

Observation ccd0f2f0-41e3-4719-a7ab-d991b54b9756 · outbound

This paper cites Deep correlation for matching images and text,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Deep correlation for matching images and text,

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.220881Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.220881Z digest=sha256:f7f0312f6b8087dd7e1f453a8ca6f31e9bba51fba8204891c30cd0ed7bc315c4

Observation 049e467a-40f8-4420-902e-054327aa82c9 · outbound

This paper cites Draw: A recurrent neural network for image generation,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Draw: A recurrent neural network for image generation,

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.226747Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.226747Z digest=sha256:dd08ef704fddca5ff75578ea017fa95344d686c92d661b60e36f09756a3243ce

Observation 02f00c2e-05b1-4615-bec1-e2e2787eb9e1 · outbound

This paper cites Memory- attended recurrent network for video captioning,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Memory- attended recurrent network for video captioning,

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.231254Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.231254Z digest=sha256:45b7a165fe7d065c78ccf6d1a16d08312a7123a1cfa882808b99e5aab3f6db08

Observation 25b134f8-93c0-45cd-b0eb-da13c31ee43a · outbound

This paper cites Heterogeneous memory enhanced multimodal attention model for video question answering,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Heterogeneous memory enhanced multimodal attention model for video question answering,

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.235684Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.235684Z digest=sha256:5cb9c275a0151a9f34e522aeba31b752976f7b33001a16d365f5d676e8e8dc54

Observation 441a07d7-01f5-4ab6-ba82-411924c14c60 · outbound

This paper cites Mocogan: Decompos- ing motion and content for video generation,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Mocogan: Decompos- ing motion and content for video generation,

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.240343Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.240343Z digest=sha256:3b2e0a788a178fe485dc8a1273458ad7b927e22741ff2f4f5c34594a7ae7d4bf

Observation b03707cf-9f9d-4114-b41e-61f5a28a89bb · outbound

This paper cites Rethinking the bottom-up framework for query-based video localiza- tion,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Rethinking the bottom-up framework for query-based video localiza- tion,

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.246246Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.246246Z digest=sha256:aa55def5bda0f996f2f0da6caa1e5f7cdbf6c99b58abe1b84eb2c3e577726c78

Observation 6572cfa6-72b4-4359-8923-c15656023beb · outbound

This paper cites Object detection in 20 years: A survey,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Object detection in 20 years: A survey,

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.250908Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.250908Z digest=sha256:ad23a49df6ae1d4468032dc7a652911a2a4c827702ffc46c7368461836a3c611

Observation ca14498b-3398-4a7a-a899-c85219ef154f · outbound

This paper cites Neural motifs: Scene graph parsing with global context,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Neural motifs: Scene graph parsing with global context,

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.255555Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.255555Z digest=sha256:0b84b390f5e3b2442d98f2d4c235c2c885d8ada4a1fba808a145c72f91fc9be7

Observation f7a5829d-9b4f-4852-9d32-3b905c77a6dd · outbound

This paper cites From recognition to cognition: Visual commonsense reasoning,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey From recognition to cognition: Visual commonsense reasoning,

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.260138Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.260138Z digest=sha256:6def46ed5cd2b3dbb69d33f6580eedb3e56f8998b038481cbb7e824cac4e5bab

Observation a9cf5749-a14b-49cf-a287-d85fbfe0464a · outbound

This paper cites Visual Entailment: A Novel Task for Fine-Grained Image Understanding.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Visual Entailment: A Novel Task for Fine-Grained Image Understanding

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.264684Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.264684Z digest=sha256:e6a792b1c5e587007b852c6ed8b0b61909001a17f998abf6446ac5c07f0148d5

Observation 8bf45281-434a-4669-bd68-c9686711b375 · outbound

This paper cites The abduction of sherlock holmes: A dataset for visual abductive reasoning,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey The abduction of sherlock holmes: A dataset for visual abductive reasoning,

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.269433Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.269433Z digest=sha256:e5088d6ce899ab0f1614b0ee20b93f4826209f9bcfadf37acaa63e35544ac011

Observation 7ae55b5e-b01a-4e42-a129-6e59542c8514 · outbound

This paper cites Breaking common sense: Whoops! a vision-and-language benchmark of synthetic and compositional im- ages,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Breaking common sense: Whoops! a vision-and-language benchmark of synthetic and compositional im- ages,

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.273497Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.273497Z digest=sha256:4f7df1fbbca3c6f035caf89624ffc252ba94cdf1093c557b8cf22844ca0e849d

Observation 1044258a-ee6d-4523-9597-e09e7efe5f26 · outbound

This paper cites Let’s think outside the box: Exploring leap-of-thought in large language models with creative humor generation,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Let’s think outside the box: Exploring leap-of-thought in large language models with creative humor generation,

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.277674Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.277674Z digest=sha256:de48d0b1eec9b698dfc34c15d7ebd78957f912ce3291a16a9a784cc4c5873cd6

Observation f2c03e37-b057-4178-9e91-6bc2f01d31d9 · outbound

This paper cites Pre-train, prompt, and predict: A systematic survey of prompting methods in natural language processing,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Pre-train, prompt, and predict: A systematic survey of prompting methods in natural language processing,

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.281912Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.281912Z digest=sha256:e67bd6324c2dc3f2280e9c9a2dd726e7d56f5a693ed91aa21fa0c9cba95566ed

Observation 6b439e0a-614b-4537-9e9c-7ea086b7be0d · outbound

This paper cites LLaMA: Open and Efficient Foundation Language Models.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey LLaMA: Open and Efficient Foundation Language Models

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.285863Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.285863Z digest=sha256:c60ae6bf249ef8a17473641b396ae4b9a7f92af258e4c4d2ab95fca319ae91fd

Observation 8d8fe502-67f9-4e77-95f4-8d041814d40e · outbound

This paper cites Vicuna: An open-source chatbot impressing gpt-4 with 90%* chatgpt quality,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Vicuna: An open-source chatbot impressing gpt-4 with 90%* chatgpt quality,

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.290558Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.290558Z digest=sha256:f560935f9e17b1446ae6dbf2de31b3d4aacad40f3708a41bdd0873f6058a09d9

Observation 57c302c3-26c4-4bfa-bfea-458cca150c6f · outbound

This paper cites Qwen Technical Report.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Qwen Technical Report

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.295187Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.295187Z digest=sha256:f0a3b1b21502f4b6239be536f3e7270f069d661d196dc55eda3944f38e27ca61

Observation 3bbaebfa-4c5a-4149-805d-5941bcb5e467 · outbound

This paper cites Learning transferable visual models from natural language supervision,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Learning transferable visual models from natural language supervision,

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.300089Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.300089Z digest=sha256:2a69cb613040061b6b3f4bc92b7b6e51d34b1b06cbdc36f43af935f28b80ba11

Observation 209d48e2-4ca2-4878-a91a-59c43472ebf0 · outbound

This paper cites Scaling up visual and vision-language representation learning with noisy text supervision,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Scaling up visual and vision-language representation learning with noisy text supervision,

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.305441Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.305441Z digest=sha256:d821a62d6505f30605984b7904b6ea00ddfc03b5f922d1522c54e1696e97a540

Observation 019bd6a3-336d-4a83-aef0-8412d20200a9 · outbound

This paper cites Vlmo: Unified vision-language pre- training with mixture-of-modality-experts,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Vlmo: Unified vision-language pre- training with mixture-of-modality-experts,

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.310428Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.310428Z digest=sha256:a3b3611bd4a998ffa575e8bb49c27aabfbdddac644a8ca68fb91dab2dfb32d6b

Observation 7dc86bcb-35af-4f97-9c0a-d329449e0029 · outbound

This paper cites FILIP: Fine-grained Interactive Language-Image Pre-Training.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey FILIP: Fine-grained Interactive Language-Image Pre-Training

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.315913Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.315913Z digest=sha256:d3d03a43b2e7e45889083800a58425c63637b0ea8a0591d2881928e02dfdd19d

Observation 094d7387-96b0-4ee9-9e74-8735de932580 · outbound

This paper cites Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation,

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.321522Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.321522Z digest=sha256:c96cbfd57a887e319b0e24db6215980bd723d56ff24fd00e43e7f047864ae23d

Observation 3a3b5abe-6d1b-4b02-8605-626e79e5c783 · outbound

This paper cites MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.326673Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.326673Z digest=sha256:c3feaad1c132e54d98385ddc409e85fbdfafbf626cf83b1c8980a84515a5a02e

Observation d57faeb6-6edd-4ab4-8c11-7641c2b71ad5 · outbound

This paper cites Visual instruction tuning,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Visual instruction tuning,

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.331796Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.331796Z digest=sha256:893e022f630bf52e704598c6e9f9d6212016fb005fbad5f7167da9f1b086823a

Observation 5af0e801-e2e4-4aa7-91c6-e70814e66f80 · outbound

This paper cites Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.336578Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.336578Z digest=sha256:67b8f674b5ca749bc8b9fff19c3ceceb280071a9d28dcf562372ac570f3dab6a

Observation d99eec56-064d-4396-975f-4191cec24c0a · outbound

This paper cites A Survey of Large Language Models.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey A Survey of Large Language Models

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.342321Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.342321Z digest=sha256:61a6fb53cc942543a123122225534054bd44932e13b9f0a595f6e2f77f8a8c4d

Observation 1c683867-9394-43cb-9f99-3e4b42a8682e · outbound

This paper cites A Comprehensive Overview of Large Language Models.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey A Comprehensive Overview of Large Language Models

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.347750Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.347750Z digest=sha256:e67ac8d907229b28219027bdbc5dacc62e2bb038a18d9fbefcd14aab5a5f0eab

Observation f4e04d6d-f6ac-4623-9bd1-af9457097593 · outbound

This paper cites A survey on evaluation of large language models,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey A survey on evaluation of large language models,

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.352851Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.352851Z digest=sha256:c4a5e0cbcb98a9dd810f8c3b225a30cd7edc3084af8f15b2030ffce48a57b8c4

Observation c9093796-6795-45a6-aea2-2e049f1d89bc · outbound

This paper cites Large-scale multi-modal pre-trained models: A com- prehensive survey,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Large-scale multi-modal pre-trained models: A com- prehensive survey,

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.357550Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.357550Z digest=sha256:fcaabce7a421015075f1f9d392ed1858188ed97ca8bcd979366f4ba2ee21b3c7

Observation 2f77d8d7-9b74-4845-a7fb-b5b0cd345367 · outbound

This paper cites Foundational Models Defining a New Era in Vision: A Survey and Outlook.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Foundational Models Defining a New Era in Vision: A Survey and Outlook

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.362248Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.362248Z digest=sha256:7a8378c2fc65cbeaa49e72535dda0543c23c48e04ccfd975ba42e1b1a73c2985

Observation 937aaa72-68e8-4300-bb23-e48d3e8bfdf0 · outbound

This paper cites A Survey on Multimodal Large Language Models.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey A Survey on Multimodal Large Language Models

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.367070Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.367070Z digest=sha256:e9cdd8a7cdafc2d485757bc2d4d801b4454500f91b4d1a725c575f8e46c5a270

Observation f53a411d-e9ab-4795-97cd-e5dd1d4dd464 · outbound

This paper cites MM-LLMs: Recent Advances in MultiModal Large Language Models.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey MM-LLMs: Recent Advances in MultiModal Large Language Models

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.372006Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.372006Z digest=sha256:b14a9aa8fbdf2fc7eb4dd2ccb8e834215828ff1c9a0f931fc958fbb27639ebc1

Observation cf56b006-35a9-45ed-8df3-63d30f45dcc5 · outbound

This paper cites Exploring the Reasoning Abilities of Multimodal Large Language Models (MLLMs): A Comprehensive Survey on Emerging Trends in Multimodal Reasoning.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Exploring the Reasoning Abilities of Multimodal Large Language Models (MLLMs): A Comprehensive Survey on Emerging Trends in Multimodal Reasoning

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.376675Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.376675Z digest=sha256:75d273678208ca99b508638a333305bdfc2d5fe11773e9a7387004fef90d9a38

Observation f911f90b-f4e9-483d-856f-4c2bc6699771 · outbound

This paper cites Video understanding with large language models: A survey,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Video understanding with large language models: A survey,

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.381148Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.381148Z digest=sha256:28aeb045c7bbbe36f16320382cbf6ea7a806ba3fa2c31a856aaef7c82856f71c

Observation f2612d6b-e681-4543-8935-783877968ab5 · outbound

This paper cites Vision-language models for vision tasks: A survey,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Vision-language models for vision tasks: A survey,

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.385442Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.385442Z digest=sha256:73a11f0b796edeb7c3d1ec324b2b09c1df37cc36eea32cc1f30676e2c15b6a27

Observation 0a3844b0-08ef-4666-96a1-3a72e29532e6 · outbound

This paper cites LLMs Meet Multimodal Generation and Editing: A Survey.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey LLMs Meet Multimodal Generation and Editing: A Survey

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.389662Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.389662Z digest=sha256:8ce4deddcdcab0b1988339cfdef98600d1eaec623d31f9b65d189742bb2db0c9

Observation e47f553e-4c25-427d-ba29-e9b5d4b483a4 · outbound

This paper cites Generalized Out-of-Distribution Detection and Beyond in Vision Language Model Era: A Survey.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Generalized Out-of-Distribution Detection and Beyond in Vision Language Model Era: A Survey

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.394298Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.394298Z digest=sha256:093ec416cd86d67e90d0a72d4638358bb669b41a0e3f674e65ee8ca1b67eb923

Observation 7f8641d0-b904-46d4-9278-50960230ec98 · outbound

This paper cites BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.400421Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.400421Z digest=sha256:20779e231a1645a83c26d7b547df50b4df0cc06cbb6778375a30e3a3189cd5a3

Observation 375c1fd8-4966-42f4-baab-4334bda14734 · outbound

This paper cites ERNIE: Enhanced Representation through Knowledge Integration.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey ERNIE: Enhanced Representation through Knowledge Integration

Reference 53

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.405469Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.405469Z digest=sha256:895cac908156e958a5fbd74ab4beabf9b34b07c9569f72133c68d59e79f4249d

Observation c67356c9-fef1-474b-b6cd-a9eee42e6c1a · outbound

This paper cites Language mod- els are few-shot learners,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Language mod- els are few-shot learners,

Reference 54

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.410963Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.410963Z digest=sha256:c25df9738911ba96ac5cf91a503adc98bb467e31c835424d3f9cfd611978e5cb

Observation 621ba948-3326-426d-b485-20f283a3945a · outbound

This paper cites Image Captioning with Very Scarce Supervised Data: Adversarial Semi-Supervised Learning Approach.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Image Captioning with Very Scarce Supervised Data: Adversarial Semi-Supervised Learning Approach

Reference 55

Resolution
verified exact
local_arxiv, observed 2026-08-11T18:11:56.657530Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-11T18:11:54.416016Z digest=sha256:ee53095503966d1955804685e8d1988cad3398683500e184ac40b79fca3887aa

Observation 3c8eb5e4-e7d0-4d0a-b407-e960894fd2f2 · outbound

This paper cites Semi-supervised cross-modal retrieval with label prediction,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Semi-supervised cross-modal retrieval with label prediction,

Reference 56

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.421123Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.421123Z digest=sha256:384bb99dd737bd7c7de85ff73f60db1c6232f7cffe39d805dc91d2e115397ec7

Observation b693d6ff-cbd0-4b9c-9a8e-d07f25b26752 · outbound

This paper cites Weakly supervised dense event captioning in videos,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Weakly supervised dense event captioning in videos,

Reference 57

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.425724Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.425724Z digest=sha256:21b1aa0c47c235008de26bc011ca9235c6bb866266ac382e00ec657b771ba7fe

Observation 827313f4-0b87-447e-ab64-b9be562b090f · outbound

This paper cites Weakly-Supervised Visual-Retriever-Reader for Knowledge-based Question Answering.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Weakly-Supervised Visual-Retriever-Reader for Knowledge-based Question Answering

Reference 58

Resolution
verified exact
local_arxiv, observed 2026-08-11T18:11:56.635511Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-11T18:11:54.430275Z digest=sha256:ccf3de7548daa562eb81111985e00a00c48115892fde9cddf3e72a4da0895f4a

Observation 76650929-8efa-47c4-bfce-76f3bac47aa4 · outbound

This paper cites Unsupervised image captioning,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Unsupervised image captioning,

Reference 59

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.435131Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.435131Z digest=sha256:fc37fe1ab97e51bf791ef327ea9b5f1c1b6dd9735c35d2785cb84ffbd7fb0a85

Observation d0adeb38-a699-458e-9157-311fff23ffc9 · outbound

This paper cites Towards unsupervised image captioning with shared multimodal embeddings,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Towards unsupervised image captioning with shared multimodal embeddings,

Reference 60

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.439820Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.439820Z digest=sha256:0e5b4bea61b026c4314a0de1dcfd428b31ab0c241f64304bd6eb4ee343d212f4

Observation 1bc79c32-a43a-4665-926d-0ea5ddf24a4a · outbound

This paper cites Zerocap: Zero-shot image-to-text generation for visual-semantic arithmetic,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Zerocap: Zero-shot image-to-text generation for visual-semantic arithmetic,

Reference 61

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.444320Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.444320Z digest=sha256:acdae6ed6ac42ef5cb98ff8c4ea0f6704c4d864116e9ad6a95a7455b8e2cfd51

Observation 1de9018c-e31b-4f18-9c49-fa2fd8f7f403 · outbound

This paper cites Language Models Can See: Plugging Visual Controls in Text Generation.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Language Models Can See: Plugging Visual Controls in Text Generation

Reference 62

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.449739Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.449739Z digest=sha256:6756156929f6131ddd9c094f445156306e9650218cd3d9dbb89c48c791e5fb98

Observation 06928aad-7ea1-4ccd-9ff3-24df7dbc80c4 · outbound

This paper cites Conzic: Controllable zero-shot image captioning by sampling-based polishing,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Conzic: Controllable zero-shot image captioning by sampling-based polishing,

Reference 63

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.454925Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.454925Z digest=sha256:1241e2129a2021ffd7af2bdc2430890a7cddcf838c00c1a05492a1ec55842bf1

Observation c4fa8a1e-202f-488d-9e21-1d809851ea6d · outbound

This paper cites MeaCap: Memory-Augmented Zero-shot Image Captioning.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey MeaCap: Memory-Augmented Zero-shot Image Captioning

Reference 64

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.459435Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.459435Z digest=sha256:f75ac4fbb71f463f4447dcddb46f5f34f9a5341c60a1c8b217357964c36b6f28

Observation f79e658c-c6a3-4275-b3c7-d2721a6cc561 · outbound

This paper cites Text-only training for visual storytelling,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Text-only training for visual storytelling,

Reference 65

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.464285Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.464285Z digest=sha256:d01b27474e312ec453aef59a1bfb87a64494c6ec27d81533889efec2da87d170

Observation 50cf5717-8a82-4a0f-a8c2-d066e766c04d · outbound

This paper cites Zero-Shot Video Captioning with Evolving Pseudo-Tokens.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Zero-Shot Video Captioning with Evolving Pseudo-Tokens

Reference 66

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.468557Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.468557Z digest=sha256:ebfcb56cb6b87ac7fb4f7fbd56bdeee5b5801fa0f98a54e5105a7821e7232d56

Observation ade0ec7a-597a-4360-b8f9-d52de4825d53 · outbound

This paper cites Zero-Shot Dense Video Captioning by Jointly Optimizing Text and Moment.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Zero-Shot Dense Video Captioning by Jointly Optimizing Text and Moment

Reference 67

Resolution
verified exact
local_arxiv, observed 2026-08-11T18:11:56.564086Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-11T18:11:54.473486Z digest=sha256:559dc3fc6fa5107bcd20950f7eb10056f8217314d8096fa317d957dab76fc186

Observation 33f3847e-a73c-4d95-b38b-ffb1e24975a7 · outbound

This paper cites CLIP Models are Few-shot Learners: Empirical Studies on VQA and Visual Entailment.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey CLIP Models are Few-shot Learners: Empirical Studies on VQA and Visual Entailment

Reference 68

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.478596Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.478596Z digest=sha256:16c3a5c01bfaff716b3ae7d156e04d6981671a8904ede1d6a1e482f4f1ad71f3

Observation 91445399-f281-4bb0-aaa1-2d80af804f73 · outbound

This paper cites Towards counterfactual image manipulation via clip,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Towards counterfactual image manipulation via clip,

Reference 69

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.482923Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.482923Z digest=sha256:ea9c64fcd3962bdfc3c97c18a8c1f598860f047ab90e63ecb1eb3ce9f7c10f0a

Observation 465e523a-e738-4514-8366-aefe48971188 · outbound

This paper cites An empirical study of gpt-3 for few-shot knowledge-based vqa,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey An empirical study of gpt-3 for few-shot knowledge-based vqa,

Reference 70

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.487500Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.487500Z digest=sha256:6a3ec4ec552bd3fe58bf56e58d5d55f656cb7ba5392a2426ba338fc8a91e9742

Observation 525e4b92-0071-41d0-89d7-dcc4583a17f6 · outbound

This paper cites Plug-and-Play VQA: Zero-shot VQA by Conjoining Large Pretrained Models with Zero Training.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Plug-and-Play VQA: Zero-shot VQA by Conjoining Large Pretrained Models with Zero Training

Reference 71

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.491641Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.491641Z digest=sha256:8be4d9d761c5c94b5767b31b68be28b9195f10afd68357120c73bbb62a0e1702

Observation 60c89bcf-60fc-4346-b080-90997eed73af · outbound

This paper cites Language models with image descriptors are strong few-shot video-language learners,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Language models with image descriptors are strong few-shot video-language learners,

Reference 72

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.496115Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.496115Z digest=sha256:67cacdcacf2faa3d710b33665bf5a8a0825d23ca73889cfb0682af24e5434ec2

Observation db0487ce-303f-4a8d-b77b-6d2977114b46 · outbound

This paper cites Language as the Medium: Multimodal Video Classification through text only.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Language as the Medium: Multimodal Video Classification through text only

Reference 73

Resolution
verified exact
local_arxiv, observed 2026-08-11T18:11:56.508315Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-11T18:11:54.500386Z digest=sha256:f277e000a110430fa4b6e69c49564ae89d57be8ecdfded9dc3cb4b2024f07f76

Observation 01040397-161d-470d-b440-3202c125e6b5 · outbound

This paper cites A Video Is Worth 4096 Tokens: Verbalize Videos To Understand Them In Zero Shot.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey A Video Is Worth 4096 Tokens: Verbalize Videos To Understand Them In Zero Shot

Reference 74

Resolution
verified exact
local_arxiv, observed 2026-08-11T18:11:56.486309Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-11T18:11:54.506310Z digest=sha256:2b9cce4c6a3b9f7963019b0a740ff755ef4f6940b639d4aecce7afbb1ac1f058

Observation a32b45dd-6a49-4ecb-8d6a-4a7ac9906df4 · outbound

This paper cites Retrieving-to-Answer: Zero-Shot Video Question Answering with Frozen Large Language Models.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Retrieving-to-Answer: Zero-Shot Video Question Answering with Frozen Large Language Models

Reference 75

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.511203Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.511203Z digest=sha256:2fdd688f68cd1a6562bdd347f722019f09ac6a146d4ea09f2110400c0429d170

Observation 295e36b9-0db3-4fc6-8ef7-a83019bf49f5 · outbound

This paper cites Text-Only Training for Image Captioning using Noise-Injected CLIP.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Text-Only Training for Image Captioning using Noise-Injected CLIP

Reference 76

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.516711Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.516711Z digest=sha256:a489245b3e97076a705f22299b3faea4b503aa8a12fe0214397922153ae45e0b

Observation a7fc2b48-b02b-4eb6-aade-2f88c4a4e2cc · outbound

This paper cites I Can't Believe There's No Images! Learning Visual Tasks Using only Language Supervision.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey I Can't Believe There's No Images! Learning Visual Tasks Using only Language Supervision

Reference 77

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.521893Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.521893Z digest=sha256:c162a431cf84d5e8c481d929273318238628147f43a61ce4fdb74dcdca1db0cc

Observation a6ef1573-ff90-4843-9aa7-833e60eea867 · outbound

This paper cites DeCap: Decoding CLIP Latents for Zero-Shot Captioning via Text-Only Training.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey DeCap: Decoding CLIP Latents for Zero-Shot Captioning via Text-Only Training

Reference 78

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.526672Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.526672Z digest=sha256:96f22b62a37d1c09724f19720dec8b8388301ba65939e7cbfc42ad7294b718b1

Observation 5564bba4-21b8-4a19-9800-9fd834cb580c · outbound

This paper cites From Association to Generation: Text-only Captioning by Unsupervised Cross-modal Mapping.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey From Association to Generation: Text-only Captioning by Unsupervised Cross-modal Mapping

Reference 79

Resolution
verified exact
local_arxiv, observed 2026-08-11T18:11:56.400451Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-11T18:11:54.531612Z digest=sha256:c720a1b33603fd18feae8aeee6b1df022248ad6b5f0a04e5bf6e34dd88e5714a

Observation e8d35d51-2e52-48f2-9935-f296ab10917f · outbound

This paper cites Zero-shot Image Captioning by Anchor-augmented Vision-Language Space Alignment.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Zero-shot Image Captioning by Anchor-augmented Vision-Language Space Alignment

Reference 80

Resolution
verified exact
local_arxiv, observed 2026-08-11T18:11:56.377916Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-11T18:11:54.536179Z digest=sha256:8d8c3c15247a103335c6956bce0c8f4d012d46cb8491f91a5b5523f4fe9625b3

Observation 21e5e519-d460-4f18-83e6-26aa7154c4f2 · outbound

This paper cites Transferable decoding with visual entities for zero-shot image captioning,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Transferable decoding with visual entities for zero-shot image captioning,

Reference 81

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.540954Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.540954Z digest=sha256:ba5ee523ee6825eddd0b1545856eb3495180c2acfd4cbc6b0c36d5e6aa59b1c9

Observation 1dde8750-f1fc-4f1c-b7dc-89205ee3b4f7 · outbound

This paper cites Language-free training for zero-shot video grounding,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Language-free training for zero-shot video grounding,

Reference 82

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.545994Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.545994Z digest=sha256:fb1af51b45ab8d20db54f2ea676f07c374c7bbe51c92be5434a0b75edcf82b39

Observation 7b895ac4-d2b2-4224-9f9e-fff8f3f4666c · outbound

This paper cites CLIP-GEN: Language-Free Training of a Text-to-Image Generator with CLIP.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey CLIP-GEN: Language-Free Training of a Text-to-Image Generator with CLIP

Reference 83

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.551267Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.551267Z digest=sha256:1f3efd14806a857d1e45d907022377b9fd4c2d572fdd2b9dc633abb591cb0f74

Observation 14f7226d-3ea3-4178-97d3-a69d0bcd57cb · outbound

This paper cites Image captioning with multi-context synthetic data,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Image captioning with multi-context synthetic data,

Reference 84

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.556270Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.556270Z digest=sha256:fd789d48aa3973d25fd3581cf55443e50b0422c7b95c89ea543e18d673b1c958

Observation 551c90a3-e164-4757-bce3-a4d6b755947b · outbound

This paper cites Improving cross-modal alignment with synthetic pairs for text-only image captioning,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Improving cross-modal alignment with synthetic pairs for text-only image captioning,

Reference 85

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.560774Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.560774Z digest=sha256:331ddf90c57079d244249bcdf8e70cfb7b7a4433de8ce693110d7ae361bc069a

Observation cb24d4eb-5337-48b7-97d5-be80ac94b343 · outbound

This paper cites FreeMask: Synthetic Images with Dense Annotations Make Stronger Segmentation Models.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey FreeMask: Synthetic Images with Dense Annotations Make Stronger Segmentation Models

Reference 86

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.565504Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.565504Z digest=sha256:2c309ab1458adcb30e207dafe05989477cb437f5207ffe66890f10ce62dee7cc

Observation 72c2b9e4-9c40-43c3-b8f6-f4e782951e39 · outbound

This paper cites Towards language-free training for text-to-image generation,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Towards language-free training for text-to-image generation,

Reference 87

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.570501Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.570501Z digest=sha256:ca54a5b0f5c9aea701695cffef3b65f48870e88fd03345ae1e696f54ad704325

Observation 1e7d941f-6c12-4b9e-90a4-30d6526632be · outbound

This paper cites See, Think, Confirm: Interactive Prompting Between Vision and Language Models for Knowledge-based Visual Reasoning.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey See, Think, Confirm: Interactive Prompting Between Vision and Language Models for Knowledge-based Visual Reasoning

Reference 88

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.574723Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.574723Z digest=sha256:98a5b0437df73c1c2cbd92eb84e17c4347e3db1adcc1ef275fe51f71a154a252

Observation a2289860-351f-43ba-aac1-583212c2a10b · outbound

This paper cites ViCor: Bridging Visual Understanding and Commonsense Reasoning with Large Language Models.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey ViCor: Bridging Visual Understanding and Commonsense Reasoning with Large Language Models

Reference 89

Resolution
verified exact
local_arxiv, observed 2026-08-11T18:11:56.301186Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-11T18:11:54.578985Z digest=sha256:f62f7e019cf9ea4a6f4c6626c0585866cab9c7132394b2c146f3120b4513a77c

Observation 098f0d44-7b83-40e2-8474-5d52c8782d03 · outbound

This paper cites DOMINO: A Dual-System for Multi-step Visual Language Reasoning.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey DOMINO: A Dual-System for Multi-step Visual Language Reasoning

Reference 90

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.583677Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.583677Z digest=sha256:b7854cef219c14f24b19efcf9c40cb20e6b4c4ecf293577fd34a42e534857a0e

Observation 37d12aea-6eab-41bc-8174-cfae4e241446 · outbound

This paper cites IdealGPT: Iteratively decomposing vision and language reasoning via large language models,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey IdealGPT: Iteratively decomposing vision and language reasoning via large language models,

Reference 91

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.588732Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.588732Z digest=sha256:e451c2640e3128cbdec317d31fc8b1dc93ead077ecbc8c7a0de57957882180bb

Observation 9670f636-c851-4df2-a8c3-24a601df6408 · outbound

This paper cites Good Questions Help Zero-Shot Image Reasoning.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Good Questions Help Zero-Shot Image Reasoning

Reference 92

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.593526Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.593526Z digest=sha256:3f1724ffde9d259e606855cd1f9af2b8b08f40ec1aa572a3cb8c8031a7574e5a

Observation 4e8bd70e-00ea-4de7-b212-7bafd3efbe37 · outbound

This paper cites The art of SOCRATIC QUESTIONING: Recursive thinking with large language models,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey The art of SOCRATIC QUESTIONING: Recursive thinking with large language models,

Reference 93

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.598411Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.598411Z digest=sha256:76df1879acadc4ef7cf30d4ef4edd67c55ee046224a1df1b54cfea8f6dacb962

Observation 2b38e2a4-fbac-4dca-9f5e-b4890fd7db45 · outbound

This paper cites Filling the image information gap for VQA: Prompting large language models to proactively ask questions,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Filling the image information gap for VQA: Prompting large language models to proactively ask questions,

Reference 94

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.602828Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.602828Z digest=sha256:1b1626eedc3ee214f8d31d8f675cc90daa5739317e1576914f0a8babcb99e161

Observation 8fb3cfa1-2d26-4465-b9ad-035fa9fb644c · outbound

This paper cites Multimodal Multi-Hop Question Answering Through a Conversation Between Tools and Efficiently Finetuned Large Language Models.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Multimodal Multi-Hop Question Answering Through a Conversation Between Tools and Efficiently Finetuned Large Language Models

Reference 95

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.607488Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.607488Z digest=sha256:fb710a4bd2f6deed7398ed61aff142588a9ea543fe6fd789a9d19762d817141c

Observation f6e5080b-05b7-40a7-9c26-0962906a8d4a · outbound

This paper cites Learn to explain: Multimodal reasoning via thought chains for science question answering,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Learn to explain: Multimodal reasoning via thought chains for science question answering,

Reference 96

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.612605Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.612605Z digest=sha256:fc1acff41a90381eb3aa8763aed7c53d63b984ca0049e9d3d86d929becebed47

Observation 8dd6dd2c-66ee-4dad-b0b4-aad6157d1847 · outbound

This paper cites Multimodal Chain-of-Thought Reasoning in Language Models.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Multimodal Chain-of-Thought Reasoning in Language Models

Reference 97

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.616979Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.616979Z digest=sha256:aa88ddf179b9648c01f19d467b63766d2203bc062cb50d8e157d86fc207edbe6

Observation bd57b404-b707-4b78-8729-20a2c0ed20ea · outbound

This paper cites T-sciq: Teaching multimodal chain-of-thought reasoning via large language model signals for science question answering,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey T-sciq: Teaching multimodal chain-of-thought reasoning via large language model signals for science question answering,

Reference 98

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.622299Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.622299Z digest=sha256:1ce93cfee134c2c2e218a7c67ecce8790735c9f28da99bebf7280c0de22d13ec

Observation 170d0af2-a920-4136-be48-68ded2fa38b2 · outbound

This paper cites KAM-CoT: Knowledge Augmented Multimodal Chain-of-Thoughts Reasoning.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey KAM-CoT: Knowledge Augmented Multimodal Chain-of-Thoughts Reasoning

Reference 99

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.627119Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.627119Z digest=sha256:1e2d18ba1e1d3c028f7aaaf8f3a9e558d0c0d9b0afce4a1018f3c9b3676c2c04

Observation c4cdba88-c0cf-4eb1-a42a-def771209950 · outbound

This paper cites Measuring and Improving Chain-of-Thought Reasoning in Vision-Language Models.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Measuring and Improving Chain-of-Thought Reasoning in Vision-Language Models

Reference 100

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.632569Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.632569Z digest=sha256:3ffd12634083e6882f710ee4fab542266f1bde75c58b45df04fcddc6ec814933

Pith citing papers

No inbound Pith citation observations are available.