Pith. sign in

Paper Citation Record · LEDGER

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey

As of 22 August 2026, this Paper Citation Record lists 100 of 229 outbound references and 0 inbound Pith citation observations for arXiv:2412.08158.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2412.08158 v1

Coverage vector

measured 100 of 229 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-11T18:11:54.632569Z

measured 100 of 100 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-21T06:32:19.484+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

100 of 229 outbound references displayed

  • verified exact8
  • verified fuzzy0
  • unresolved92
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 465a3771-17b5-4231-846f-1cc1323618ff · outbound

This paper cites Multimodal research in vision and language: A review of current and emerging trends,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Multimodal research in vision and language: A review of current and emerging trends,

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.151310Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.151310Z digest=sha256:f0acb1b3c2d222a4f9e1401d0555aed13cdc48560f6cf402e640a1c4c07d8919

Observation e66d460d-6aa1-481a-a634-6b91c7030011 · outbound

This paper cites Vision+ language applications: A survey,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Vision+ language applications: A survey,

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.156570Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.156570Z digest=sha256:346fdecfc97cbcbdb2d7363ba1233d6c916d6e2f58211dd82a7a70db04ee6c2f

Observation 6b767473-ee29-4f33-b9f8-cbfc86dd314d · outbound

This paper cites Bottom-up and top-down attention for image captioning and visual question answering,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Bottom-up and top-down attention for image captioning and visual question answering,

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.161338Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.161338Z digest=sha256:e3227528fee425301400c4ba2135f1bd62241ef61c5615f23adfdca7466e0353

Observation 7b637dd1-c0a8-4628-b170-8131f064ef99 · outbound

This paper cites Swinbert: End-to-end transformers with sparse attention for video captioning,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Swinbert: End-to-end transformers with sparse attention for video captioning,

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.166132Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.166132Z digest=sha256:2d975d19932ee157831bf89c11ebb50b2687ffbaeda938251627ebd7eedc641d

Observation 0d68d81b-31f0-4f7b-8883-95817f80ffb7 · outbound

This paper cites Vqa: Visual question answering,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Vqa: Visual question answering,

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.170653Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.170653Z digest=sha256:a7230c2d45280541fcecfda038d6fc37d8f44199b77d684ee8986d0b681171e4

Observation 80602856-cd1a-40fa-baf5-3d5d9bb7d2c7 · outbound

This paper cites Movieqa: Understanding stories in movies through question- answering,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Movieqa: Understanding stories in movies through question- answering,

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.175805Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.175805Z digest=sha256:d1e6e3cec0d8422531f92469b7cc0fbe227ff33436933142e4aa77496bb6ad71

Observation 4d63aff3-6753-4266-84fc-e51fd504f63c · outbound

This paper cites Context-aware attention network for image-text retrieval,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Context-aware attention network for image-text retrieval,

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.181811Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.181811Z digest=sha256:10b18d752c8841bdc23eb8c3556414d13d346b0662a2cb05a1a050d62bf7b0b7

Observation a0348ba6-a5ba-4010-9c44-d6577e71f2fe · outbound

This paper cites Fine-grained video-text retrieval with hierarchical graph reasoning,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Fine-grained video-text retrieval with hierarchical graph reasoning,

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.186677Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.186677Z digest=sha256:7632fa29cc0722305f508057e5e92f3de5df2d09577f231c57d20b1d03a9e3a4

Observation 62a87f97-baf3-4fd0-af55-356f5642acd2 · outbound

This paper cites Visual classification via description from large language models,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Visual classification via description from large language models,

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.191266Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.191266Z digest=sha256:aa9a4ba2676a85e73b3903bfd3bd365eba98d346df884d31cc42233df4fcc8d8

Observation 8d00e512-bfd5-431c-b450-887cb665d8c2 · outbound

This paper cites Learning concise and descriptive attributes for visual recognition,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Learning concise and descriptive attributes for visual recognition,

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.195864Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.195864Z digest=sha256:ee67bc625a75829bf4b0be754e2c3724c112fb4eb0744600575adba85f9544c9

Observation 7384dc51-6dad-4064-8d14-69096b248792 · outbound

This paper cites Exploring large language models for multi-modal out-of-distribution detection,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Exploring large language models for multi-modal out-of-distribution detection,

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.201342Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.201342Z digest=sha256:83eeebcbea7d4ac4ed65c3befdaefea42e7c950ac2ac51899cd212fc166090f0

Observation 37c035fb-ab3d-44eb-9a01-a2425d584e56 · outbound

This paper cites Chatgpt-powered hierarchical comparisons for image classification,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Chatgpt-powered hierarchical comparisons for image classification,

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.206793Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.206793Z digest=sha256:8bd09762c47627c1c2be396335ad0ef6987b8ae63ccac60a175e7b52b09acea3

Observation 113f8511-064d-4e5d-9e0d-58c165307694 · outbound

This paper cites Vision-language pre-training: Basics, recent advances, and future trends,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Vision-language pre-training: Basics, recent advances, and future trends,

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.211313Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.211313Z digest=sha256:345ef125133ce77c2edc5937099143914e7309559d3ffdc5238755c093c6b995

Observation c6d701e4-6fe3-4ef0-ae53-625cbee3e4e7 · outbound

This paper cites Show and tell: A neural image caption generator,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Show and tell: A neural image caption generator,

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.216289Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.216289Z digest=sha256:6440a3e29a0e03c3bbf90f807cecb59581b4f91367a5aa9b9171cf46be433ec6

Observation ccd0f2f0-41e3-4719-a7ab-d991b54b9756 · outbound

This paper cites Deep correlation for matching images and text,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Deep correlation for matching images and text,

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.220881Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.220881Z digest=sha256:1c907a0517393088df4bcfcf2be526560c4022ef4efbc2dba3c2d03eee17face

Observation 049e467a-40f8-4420-902e-054327aa82c9 · outbound

This paper cites Draw: A recurrent neural network for image generation,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Draw: A recurrent neural network for image generation,

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.226747Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.226747Z digest=sha256:8305c41680c3fd548f7b4015e882677c8a651639f3937ab05be075f8ed10423f

Observation 02f00c2e-05b1-4615-bec1-e2e2787eb9e1 · outbound

This paper cites Memory- attended recurrent network for video captioning,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Memory- attended recurrent network for video captioning,

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.231254Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.231254Z digest=sha256:f38d1c7827d96b0a7cad2d44556591a6f2e3215cac3c4f99f338ddc55437900b

Observation 25b134f8-93c0-45cd-b0eb-da13c31ee43a · outbound

This paper cites Heterogeneous memory enhanced multimodal attention model for video question answering,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Heterogeneous memory enhanced multimodal attention model for video question answering,

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.235684Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.235684Z digest=sha256:27f01eb8e47226446c2442a780e356cf0e3db6f1545417c3b7a03e6cab056257

Observation 441a07d7-01f5-4ab6-ba82-411924c14c60 · outbound

This paper cites Mocogan: Decompos- ing motion and content for video generation,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Mocogan: Decompos- ing motion and content for video generation,

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.240343Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.240343Z digest=sha256:7d746d08394730388ef29c08200a6a3f49ebee6713e7b690918eb24377151f24

Observation b03707cf-9f9d-4114-b41e-61f5a28a89bb · outbound

This paper cites Rethinking the bottom-up framework for query-based video localiza- tion,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Rethinking the bottom-up framework for query-based video localiza- tion,

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.246246Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.246246Z digest=sha256:691d52210bbf65ddce1e3a9e93b27147a37b2f6bee2b17596d31e9d30607136e

Observation 6572cfa6-72b4-4359-8923-c15656023beb · outbound

This paper cites Object detection in 20 years: A survey,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Object detection in 20 years: A survey,

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.250908Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.250908Z digest=sha256:4f0cc1c3ed7c0f74b412d969787075331e45ba737979a244e908e8cd7fcf191e

Observation ca14498b-3398-4a7a-a899-c85219ef154f · outbound

This paper cites Neural motifs: Scene graph parsing with global context,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Neural motifs: Scene graph parsing with global context,

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.255555Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.255555Z digest=sha256:06a8292bdf102d822dd2cffbb06fff90f2e12c1a3f1bf67638af7e68fe9a29cb

Observation f7a5829d-9b4f-4852-9d32-3b905c77a6dd · outbound

This paper cites From recognition to cognition: Visual commonsense reasoning,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey From recognition to cognition: Visual commonsense reasoning,

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.260138Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.260138Z digest=sha256:4b1e1662bc5186383492f89f4bbe75f873f3749260b61105e91496052b5a6d12

Observation a9cf5749-a14b-49cf-a287-d85fbfe0464a · outbound

This paper cites Visual Entailment: A Novel Task for Fine-Grained Image Understanding.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Visual Entailment: A Novel Task for Fine-Grained Image Understanding

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.264684Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.264684Z digest=sha256:7556a8ace56290e527a304cb9b28ed797cc66a7026067ac8e7c6c547eae05251

Observation 8bf45281-434a-4669-bd68-c9686711b375 · outbound

This paper cites The abduction of sherlock holmes: A dataset for visual abductive reasoning,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey The abduction of sherlock holmes: A dataset for visual abductive reasoning,

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.269433Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.269433Z digest=sha256:0df9f80b8b99be89a415e35b93920100dc6af2af7d934cc9e8682bc0065e425f

Observation 7ae55b5e-b01a-4e42-a129-6e59542c8514 · outbound

This paper cites Breaking common sense: Whoops! a vision-and-language benchmark of synthetic and compositional im- ages,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Breaking common sense: Whoops! a vision-and-language benchmark of synthetic and compositional im- ages,

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.273497Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.273497Z digest=sha256:f770808d7ba989612d2919881b6a9dde37cc010f4694ad38f2a50a61d525bc85

Observation 1044258a-ee6d-4523-9597-e09e7efe5f26 · outbound

This paper cites Let’s think outside the box: Exploring leap-of-thought in large language models with creative humor generation,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Let’s think outside the box: Exploring leap-of-thought in large language models with creative humor generation,

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.277674Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.277674Z digest=sha256:7297c28c14a007c5561370f09c7280f7c0a0ea74402ec14cf0c005378fdc6409

Observation f2c03e37-b057-4178-9e91-6bc2f01d31d9 · outbound

This paper cites Pre-train, prompt, and predict: A systematic survey of prompting methods in natural language processing,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Pre-train, prompt, and predict: A systematic survey of prompting methods in natural language processing,

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.281912Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.281912Z digest=sha256:2296238ead16bc926c7143277de398e32c89624b34c48757bab8f2bce5e1afe2

Observation 6b439e0a-614b-4537-9e9c-7ea086b7be0d · outbound

This paper cites LLaMA: Open and Efficient Foundation Language Models.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey LLaMA: Open and Efficient Foundation Language Models

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.285863Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.285863Z digest=sha256:ebb706c954d8b1f543eb085e547307f3b7bbda28e522adf0c4925ec097041dbc

Observation 8d8fe502-67f9-4e77-95f4-8d041814d40e · outbound

This paper cites Vicuna: An open-source chatbot impressing gpt-4 with 90%* chatgpt quality,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Vicuna: An open-source chatbot impressing gpt-4 with 90%* chatgpt quality,

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.290558Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.290558Z digest=sha256:d57b948c06bfbd372f1afa3914ce76fbdf509f952cb02f5dee93f020ded75f9c

Observation 57c302c3-26c4-4bfa-bfea-458cca150c6f · outbound

This paper cites Qwen Technical Report.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Qwen Technical Report

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.295187Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.295187Z digest=sha256:89ec19765621a6ef9697c5795baac714cc276937dcf9460a27aded4d40f1aaba

Observation 3bbaebfa-4c5a-4149-805d-5941bcb5e467 · outbound

This paper cites Learning transferable visual models from natural language supervision,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Learning transferable visual models from natural language supervision,

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.300089Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.300089Z digest=sha256:1afad2e975320c14d473a54511240c98481018a755841ac67a0658fac826dda6

Observation 209d48e2-4ca2-4878-a91a-59c43472ebf0 · outbound

This paper cites Scaling up visual and vision-language representation learning with noisy text supervision,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Scaling up visual and vision-language representation learning with noisy text supervision,

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.305441Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.305441Z digest=sha256:17b0488a1c986a9b7de857ed214e63128702bed6a65e325d8bfff6ff4c3413bc

Observation 019bd6a3-336d-4a83-aef0-8412d20200a9 · outbound

This paper cites Vlmo: Unified vision-language pre- training with mixture-of-modality-experts,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Vlmo: Unified vision-language pre- training with mixture-of-modality-experts,

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.310428Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.310428Z digest=sha256:57bf3624741eba4e5783481f39bed1213d92391750ed0ded3a4e40732653d11d

Observation 7dc86bcb-35af-4f97-9c0a-d329449e0029 · outbound

This paper cites FILIP: Fine-grained Interactive Language-Image Pre-Training.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey FILIP: Fine-grained Interactive Language-Image Pre-Training

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.315913Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.315913Z digest=sha256:31b249927cd8425db42d04d70ec8f7d576229be967ef189f807630c1438cccc8

Observation 094d7387-96b0-4ee9-9e74-8735de932580 · outbound

This paper cites Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation,

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.321522Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.321522Z digest=sha256:44954bde70e89bf38fed1f03b7c1b59fe614e62a56c4534c2e3767404e3b8441

Observation 3a3b5abe-6d1b-4b02-8605-626e79e5c783 · outbound

This paper cites MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.326673Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.326673Z digest=sha256:cf60094d1678c4c768b8cfff822f61d6b6231d54ea50f25e3939b771a0ac89a7

Observation d57faeb6-6edd-4ab4-8c11-7641c2b71ad5 · outbound

This paper cites Visual instruction tuning,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Visual instruction tuning,

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.331796Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.331796Z digest=sha256:62eaf24130b6f41d08d79596aa9d8767d7812a49f2d6fd7fc5f2eaa504e440a4

Observation 5af0e801-e2e4-4aa7-91c6-e70814e66f80 · outbound

This paper cites Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.336578Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.336578Z digest=sha256:a88d8f33d83b28ea912f4569e96373a05b13f186032dfc04228aaf9ee09c23b1

Observation d99eec56-064d-4396-975f-4191cec24c0a · outbound

This paper cites A Survey of Large Language Models.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey A Survey of Large Language Models

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.342321Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.342321Z digest=sha256:b1f58b692c95fff93a1771b7e749ec69d87f083da49f3cc63b5b81bb79d4428f

Observation 1c683867-9394-43cb-9f99-3e4b42a8682e · outbound

This paper cites A Comprehensive Overview of Large Language Models.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey A Comprehensive Overview of Large Language Models

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.347750Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.347750Z digest=sha256:5548bf2e7d3a0c90edc6c1b51f3771950ab22a0dc5279a98e69a98b49a3ac508

Observation f4e04d6d-f6ac-4623-9bd1-af9457097593 · outbound

This paper cites A survey on evaluation of large language models,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey A survey on evaluation of large language models,

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.352851Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.352851Z digest=sha256:7d2a45679f950dc27ae2d8f85b05272dc6c6c2cfcc8d05e076d966e44fc6c806

Observation c9093796-6795-45a6-aea2-2e049f1d89bc · outbound

This paper cites Large-scale multi-modal pre-trained models: A com- prehensive survey,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Large-scale multi-modal pre-trained models: A com- prehensive survey,

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.357550Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.357550Z digest=sha256:422313db097d97d8bd53ad5a2a8d46ff8bce30debdcd75b4b04f9a12844e63e2

Observation 2f77d8d7-9b74-4845-a7fb-b5b0cd345367 · outbound

This paper cites Foundational Models Defining a New Era in Vision: A Survey and Outlook.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Foundational Models Defining a New Era in Vision: A Survey and Outlook

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.362248Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.362248Z digest=sha256:1ebcd85c6877af5f9993391d53088460e4c6228ae75c3f4639ebc4642fa21e27

Observation 937aaa72-68e8-4300-bb23-e48d3e8bfdf0 · outbound

This paper cites A Survey on Multimodal Large Language Models.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey A Survey on Multimodal Large Language Models

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.367070Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.367070Z digest=sha256:d6cfee8a006dc43bbff8b3f9f6e2c2fcdc7e8982c703754417c1e857f9ec5f6e

Observation f53a411d-e9ab-4795-97cd-e5dd1d4dd464 · outbound

This paper cites MM-LLMs: Recent Advances in MultiModal Large Language Models.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey MM-LLMs: Recent Advances in MultiModal Large Language Models

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.372006Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.372006Z digest=sha256:78e3a2456191bd2067080135430f3ab9d86abf78ed9cc5c56ae11e0ed539185e

Observation cf56b006-35a9-45ed-8df3-63d30f45dcc5 · outbound

This paper cites Exploring the Reasoning Abilities of Multimodal Large Language Models (MLLMs): A Comprehensive Survey on Emerging Trends in Multimodal Reasoning.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Exploring the Reasoning Abilities of Multimodal Large Language Models (MLLMs): A Comprehensive Survey on Emerging Trends in Multimodal Reasoning

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.376675Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.376675Z digest=sha256:ac07896dc5a420ba680015e110c3c70e7affb2295eb7389517aa2ef3587d2f73

Observation f911f90b-f4e9-483d-856f-4c2bc6699771 · outbound

This paper cites Video understanding with large language models: A survey,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Video understanding with large language models: A survey,

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.381148Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.381148Z digest=sha256:40473968ab7213356fd636d76b53468e538f16537d212038cb89c2f42bf79d3c

Observation f2612d6b-e681-4543-8935-783877968ab5 · outbound

This paper cites Vision-language models for vision tasks: A survey,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Vision-language models for vision tasks: A survey,

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.385442Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.385442Z digest=sha256:1c4fa672817439b5dda0864898b03acb1b6266256b9b29e2ddb5fe6cbbb9c513

Observation 0a3844b0-08ef-4666-96a1-3a72e29532e6 · outbound

This paper cites LLMs Meet Multimodal Generation and Editing: A Survey.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey LLMs Meet Multimodal Generation and Editing: A Survey

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.389662Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.389662Z digest=sha256:5d74edd0bdc1b15055594f77a8b3524f5d783dadb0b1d31bbd346580f367b9cc

Observation e47f553e-4c25-427d-ba29-e9b5d4b483a4 · outbound

This paper cites Generalized Out-of-Distribution Detection and Beyond in Vision Language Model Era: A Survey.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Generalized Out-of-Distribution Detection and Beyond in Vision Language Model Era: A Survey

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.394298Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.394298Z digest=sha256:e6456c283c1b84c34ed6212b6fcf3f060d1efbb820c897229d65d8aafeb0bec5

Observation 7f8641d0-b904-46d4-9278-50960230ec98 · outbound

This paper cites BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.400421Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.400421Z digest=sha256:827c71810cfa44df6c123c2ac5bb204f48c7ac5f80d368d3fa969ecd0cfde7f4

Observation 375c1fd8-4966-42f4-baab-4334bda14734 · outbound

This paper cites ERNIE: Enhanced Representation through Knowledge Integration.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey ERNIE: Enhanced Representation through Knowledge Integration

Reference 53

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.405469Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.405469Z digest=sha256:557e1fd573623998497cdc03876a0766622914ea96637461f5c8a6b2eb5b07a8

Observation c67356c9-fef1-474b-b6cd-a9eee42e6c1a · outbound

This paper cites Language mod- els are few-shot learners,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Language mod- els are few-shot learners,

Reference 54

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.410963Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.410963Z digest=sha256:baafecaa1b642e175faff30ccf2ce2fe3c880ba5fcc36a939d0e815fcc9173fb

Observation 621ba948-3326-426d-b485-20f283a3945a · outbound

This paper cites Image Captioning with Very Scarce Supervised Data: Adversarial Semi-Supervised Learning Approach.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Image Captioning with Very Scarce Supervised Data: Adversarial Semi-Supervised Learning Approach

Reference 55

Resolution
verified exact
local_arxiv, observed 2026-08-11T18:11:56.657530Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-11T18:11:54.416016Z digest=sha256:f711d16b769a38df52b4c9dcfd2109e932b2496e3ad6f5beb81d1873bb345e39

Observation 3c8eb5e4-e7d0-4d0a-b407-e960894fd2f2 · outbound

This paper cites Semi-supervised cross-modal retrieval with label prediction,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Semi-supervised cross-modal retrieval with label prediction,

Reference 56

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.421123Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.421123Z digest=sha256:5b71735ff90f0d2840729cb1c43678ab907d497c6ab240bbdc85793eb8a2b497

Observation b693d6ff-cbd0-4b9c-9a8e-d07f25b26752 · outbound

This paper cites Weakly supervised dense event captioning in videos,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Weakly supervised dense event captioning in videos,

Reference 57

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.425724Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.425724Z digest=sha256:7acab74f9909f5a0807c421d42168636d3a2bfd1cc329bd2ff906eab7e033aff

Observation 827313f4-0b87-447e-ab64-b9be562b090f · outbound

This paper cites Weakly-Supervised Visual-Retriever-Reader for Knowledge-based Question Answering.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Weakly-Supervised Visual-Retriever-Reader for Knowledge-based Question Answering

Reference 58

Resolution
verified exact
local_arxiv, observed 2026-08-11T18:11:56.635511Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-11T18:11:54.430275Z digest=sha256:b7e4d705585c632cd718f9498d5c97493e00e01b37db389b13f74a063e88cab3

Observation 76650929-8efa-47c4-bfce-76f3bac47aa4 · outbound

This paper cites Unsupervised image captioning,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Unsupervised image captioning,

Reference 59

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.435131Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.435131Z digest=sha256:34b370a0152b9e02895bb34e1cd523ed8bf9c4cb0d0a9eb8133173e578cad3e3

Observation d0adeb38-a699-458e-9157-311fff23ffc9 · outbound

This paper cites Towards unsupervised image captioning with shared multimodal embeddings,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Towards unsupervised image captioning with shared multimodal embeddings,

Reference 60

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.439820Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.439820Z digest=sha256:c013743d98f8d61dd4d93d25aa34559e55d2daef2829d6dd635749d157808bf8

Observation 1bc79c32-a43a-4665-926d-0ea5ddf24a4a · outbound

This paper cites Zerocap: Zero-shot image-to-text generation for visual-semantic arithmetic,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Zerocap: Zero-shot image-to-text generation for visual-semantic arithmetic,

Reference 61

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.444320Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.444320Z digest=sha256:b3c419e4d72e65a676302e27dc9665ef72b18bd11f5c51990371c7b5892120d8

Observation 1de9018c-e31b-4f18-9c49-fa2fd8f7f403 · outbound

This paper cites Language Models Can See: Plugging Visual Controls in Text Generation.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Language Models Can See: Plugging Visual Controls in Text Generation

Reference 62

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.449739Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.449739Z digest=sha256:2cec5a534b1feb501cb00de6843e08032eaee8ee8126ed6781619c4400b4b816

Observation 06928aad-7ea1-4ccd-9ff3-24df7dbc80c4 · outbound

This paper cites Conzic: Controllable zero-shot image captioning by sampling-based polishing,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Conzic: Controllable zero-shot image captioning by sampling-based polishing,

Reference 63

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.454925Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.454925Z digest=sha256:6b14d04ce352179f8c14742cbba93846d85c3991d98d67a2811d056b490cd5c5

Observation c4fa8a1e-202f-488d-9e21-1d809851ea6d · outbound

This paper cites MeaCap: Memory-Augmented Zero-shot Image Captioning.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey MeaCap: Memory-Augmented Zero-shot Image Captioning

Reference 64

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.459435Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.459435Z digest=sha256:93835c0262c7e9e7f7f6b097b3b99c8a497c450f0d7a0f93df29d80699787059

Observation f79e658c-c6a3-4275-b3c7-d2721a6cc561 · outbound

This paper cites Text-only training for visual storytelling,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Text-only training for visual storytelling,

Reference 65

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.464285Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.464285Z digest=sha256:48f9dd7dd57c5b677f3c8101947545e3371c29522d7ce813f1c0cf8d1337c866

Observation 50cf5717-8a82-4a0f-a8c2-d066e766c04d · outbound

This paper cites Zero-Shot Video Captioning with Evolving Pseudo-Tokens.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Zero-Shot Video Captioning with Evolving Pseudo-Tokens

Reference 66

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.468557Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.468557Z digest=sha256:2f51fb6cd0c7a0aad143ece935fbaedc5ff73ab1262d7532b21fb92547f638fa

Observation ade0ec7a-597a-4360-b8f9-d52de4825d53 · outbound

This paper cites Zero-Shot Dense Video Captioning by Jointly Optimizing Text and Moment.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Zero-Shot Dense Video Captioning by Jointly Optimizing Text and Moment

Reference 67

Resolution
verified exact
local_arxiv, observed 2026-08-11T18:11:56.564086Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-11T18:11:54.473486Z digest=sha256:6775123eaf596f9e218ac23ef6e456a602de5e10b53eabe29ee7b6ab7ef392c5

Observation 33f3847e-a73c-4d95-b38b-ffb1e24975a7 · outbound

This paper cites CLIP Models are Few-shot Learners: Empirical Studies on VQA and Visual Entailment.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey CLIP Models are Few-shot Learners: Empirical Studies on VQA and Visual Entailment

Reference 68

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.478596Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.478596Z digest=sha256:ed37c01987162c03f24ad54781bb90c98a8481438753a0f1999f4341b688a718

Observation 91445399-f281-4bb0-aaa1-2d80af804f73 · outbound

This paper cites Towards counterfactual image manipulation via clip,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Towards counterfactual image manipulation via clip,

Reference 69

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.482923Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.482923Z digest=sha256:650820d51e67718672c629aaee13160db09dc6d5d699c642193f6a2e93b3c4e6

Observation 465e523a-e738-4514-8366-aefe48971188 · outbound

This paper cites An empirical study of gpt-3 for few-shot knowledge-based vqa,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey An empirical study of gpt-3 for few-shot knowledge-based vqa,

Reference 70

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.487500Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.487500Z digest=sha256:fa92a1ea1741c0b596aa40661c98f821a6ce0e08722586312e8bb52f00b91735

Observation 525e4b92-0071-41d0-89d7-dcc4583a17f6 · outbound

This paper cites Plug-and-Play VQA: Zero-shot VQA by Conjoining Large Pretrained Models with Zero Training.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Plug-and-Play VQA: Zero-shot VQA by Conjoining Large Pretrained Models with Zero Training

Reference 71

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.491641Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.491641Z digest=sha256:334cae3c46051094856d89797a3dca8e9cc4b897cbf5b813775acc3cc5edcb7e

Observation 60c89bcf-60fc-4346-b080-90997eed73af · outbound

This paper cites Language models with image descriptors are strong few-shot video-language learners,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Language models with image descriptors are strong few-shot video-language learners,

Reference 72

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.496115Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.496115Z digest=sha256:7765e330da31c3a84d64f703be12d9c8302a9b180637fd46b82b9032904f9069

Observation db0487ce-303f-4a8d-b77b-6d2977114b46 · outbound

This paper cites Language as the Medium: Multimodal Video Classification through text only.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Language as the Medium: Multimodal Video Classification through text only

Reference 73

Resolution
verified exact
local_arxiv, observed 2026-08-11T18:11:56.508315Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-11T18:11:54.500386Z digest=sha256:c55963056da5466f786cf6bbef7445ea7d71a081dbc6cdc9e0d2d717a0776ad3

Observation 01040397-161d-470d-b440-3202c125e6b5 · outbound

This paper cites A Video Is Worth 4096 Tokens: Verbalize Videos To Understand Them In Zero Shot.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey A Video Is Worth 4096 Tokens: Verbalize Videos To Understand Them In Zero Shot

Reference 74

Resolution
verified exact
local_arxiv, observed 2026-08-11T18:11:56.486309Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-11T18:11:54.506310Z digest=sha256:89bb177386f9fd56371c3e25dd445f0693dd8b4d411aeb35f9dc86c426b4fd58

Observation a32b45dd-6a49-4ecb-8d6a-4a7ac9906df4 · outbound

This paper cites Retrieving-to-Answer: Zero-Shot Video Question Answering with Frozen Large Language Models.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Retrieving-to-Answer: Zero-Shot Video Question Answering with Frozen Large Language Models

Reference 75

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.511203Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.511203Z digest=sha256:fe1eb947e435245dffd7dbb36bab6c89f40794d09065c4961d40a05ccf3bbcd8

Observation 295e36b9-0db3-4fc6-8ef7-a83019bf49f5 · outbound

This paper cites Text-Only Training for Image Captioning using Noise-Injected CLIP.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Text-Only Training for Image Captioning using Noise-Injected CLIP

Reference 76

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.516711Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.516711Z digest=sha256:1a63d56879800aa46164d365f9233fd210716b629bd59401a5306032aca8dae6

Observation a7fc2b48-b02b-4eb6-aade-2f88c4a4e2cc · outbound

This paper cites I Can't Believe There's No Images! Learning Visual Tasks Using only Language Supervision.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey I Can't Believe There's No Images! Learning Visual Tasks Using only Language Supervision

Reference 77

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.521893Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.521893Z digest=sha256:cb82bfdb4da7b84030b8070ec1b1e0d7f36694dcf47af7a21f3ce1ac5e7583ef

Observation a6ef1573-ff90-4843-9aa7-833e60eea867 · outbound

This paper cites DeCap: Decoding CLIP Latents for Zero-Shot Captioning via Text-Only Training.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey DeCap: Decoding CLIP Latents for Zero-Shot Captioning via Text-Only Training

Reference 78

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.526672Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.526672Z digest=sha256:be6bb314691a3623278924813360dc8f6756890866cbcfbc19b602949fcaf536

Observation 5564bba4-21b8-4a19-9800-9fd834cb580c · outbound

This paper cites From Association to Generation: Text-only Captioning by Unsupervised Cross-modal Mapping.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey From Association to Generation: Text-only Captioning by Unsupervised Cross-modal Mapping

Reference 79

Resolution
verified exact
local_arxiv, observed 2026-08-11T18:11:56.400451Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-11T18:11:54.531612Z digest=sha256:a58d7a80b83ea30bd64e4d50fe08d7cc843a4757e6b7a8cecd73af804506419d

Observation e8d35d51-2e52-48f2-9935-f296ab10917f · outbound

This paper cites Zero-shot Image Captioning by Anchor-augmented Vision-Language Space Alignment.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Zero-shot Image Captioning by Anchor-augmented Vision-Language Space Alignment

Reference 80

Resolution
verified exact
local_arxiv, observed 2026-08-11T18:11:56.377916Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-11T18:11:54.536179Z digest=sha256:790ef28c1a0cf4949c6096d73511e018297b0bcb15fb24a797e8a7c9539a02ad

Observation 21e5e519-d460-4f18-83e6-26aa7154c4f2 · outbound

This paper cites Transferable decoding with visual entities for zero-shot image captioning,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Transferable decoding with visual entities for zero-shot image captioning,

Reference 81

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.540954Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.540954Z digest=sha256:366a43269c6f0cd77b719071d630a6a3a3cef94576d7e0a6f115c197d711b9ad

Observation 1dde8750-f1fc-4f1c-b7dc-89205ee3b4f7 · outbound

This paper cites Language-free training for zero-shot video grounding,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Language-free training for zero-shot video grounding,

Reference 82

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.545994Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.545994Z digest=sha256:297084212614bbbf21f0d0f1866ef92d558ae0b26dbd53bc65f2cc52f4a9c29e

Observation 7b895ac4-d2b2-4224-9f9e-fff8f3f4666c · outbound

This paper cites CLIP-GEN: Language-Free Training of a Text-to-Image Generator with CLIP.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey CLIP-GEN: Language-Free Training of a Text-to-Image Generator with CLIP

Reference 83

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.551267Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.551267Z digest=sha256:580a6f956e604f328f0f179815b0ac172778806512c1dbecef7793cc86eaee58

Observation 14f7226d-3ea3-4178-97d3-a69d0bcd57cb · outbound

This paper cites Image captioning with multi-context synthetic data,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Image captioning with multi-context synthetic data,

Reference 84

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.556270Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.556270Z digest=sha256:b385684b6b206370dc925fa0e8ea0cfe4f0cbadd78b9ee9b91cae48261340cb6

Observation 551c90a3-e164-4757-bce3-a4d6b755947b · outbound

This paper cites Improving cross-modal alignment with synthetic pairs for text-only image captioning,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Improving cross-modal alignment with synthetic pairs for text-only image captioning,

Reference 85

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.560774Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.560774Z digest=sha256:52b33beb58a89168a2fd3583cf3e19f920966ddd1434abf512d991188bb8af05

Observation cb24d4eb-5337-48b7-97d5-be80ac94b343 · outbound

This paper cites FreeMask: Synthetic Images with Dense Annotations Make Stronger Segmentation Models.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey FreeMask: Synthetic Images with Dense Annotations Make Stronger Segmentation Models

Reference 86

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.565504Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.565504Z digest=sha256:6887232a236263fa33da81fb336b044d93fff64f6552dbe523c2bc3d846cc364

Observation 72c2b9e4-9c40-43c3-b8f6-f4e782951e39 · outbound

This paper cites Towards language-free training for text-to-image generation,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Towards language-free training for text-to-image generation,

Reference 87

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.570501Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.570501Z digest=sha256:b2595072516de6703ae42be565f458181b202c51cb02b0d16be7cabb05975c3a

Observation 1e7d941f-6c12-4b9e-90a4-30d6526632be · outbound

This paper cites See, Think, Confirm: Interactive Prompting Between Vision and Language Models for Knowledge-based Visual Reasoning.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey See, Think, Confirm: Interactive Prompting Between Vision and Language Models for Knowledge-based Visual Reasoning

Reference 88

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.574723Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.574723Z digest=sha256:8b269200e681cfda81791b6f5e1df001bfe805ed98979a42d1af98f4352e203a

Observation a2289860-351f-43ba-aac1-583212c2a10b · outbound

This paper cites ViCor: Bridging Visual Understanding and Commonsense Reasoning with Large Language Models.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey ViCor: Bridging Visual Understanding and Commonsense Reasoning with Large Language Models

Reference 89

Resolution
verified exact
local_arxiv, observed 2026-08-11T18:11:56.301186Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-11T18:11:54.578985Z digest=sha256:04ec8a06f1fd1447a05f10a884e2e1356d89461b3208d921452e17b3ff8c21d9

Observation 098f0d44-7b83-40e2-8474-5d52c8782d03 · outbound

This paper cites DOMINO: A Dual-System for Multi-step Visual Language Reasoning.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey DOMINO: A Dual-System for Multi-step Visual Language Reasoning

Reference 90

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.583677Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.583677Z digest=sha256:07cbf020e5b404ea8adcf50f567d237e259507bd8bdacd3aa202584984442c1a

Observation 37d12aea-6eab-41bc-8174-cfae4e241446 · outbound

This paper cites IdealGPT: Iteratively decomposing vision and language reasoning via large language models,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey IdealGPT: Iteratively decomposing vision and language reasoning via large language models,

Reference 91

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.588732Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.588732Z digest=sha256:4e057af8be4b55aa16ac9cae0a4a0d7bd0db6da430ce24fc6fc8cbdcc41c1b1f

Observation 9670f636-c851-4df2-a8c3-24a601df6408 · outbound

This paper cites Good Questions Help Zero-Shot Image Reasoning.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Good Questions Help Zero-Shot Image Reasoning

Reference 92

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.593526Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.593526Z digest=sha256:d602d425a60a6527e0f723cb7f0e8f8e4a3d22bdaf59ea17eb54988f4964b4d9

Observation 4e8bd70e-00ea-4de7-b212-7bafd3efbe37 · outbound

This paper cites The art of SOCRATIC QUESTIONING: Recursive thinking with large language models,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey The art of SOCRATIC QUESTIONING: Recursive thinking with large language models,

Reference 93

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.598411Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.598411Z digest=sha256:ec02c2c2c1e9afb80f67cca37466ba52d9178dc0b880684edd7b8b717054a9ff

Observation 2b38e2a4-fbac-4dca-9f5e-b4890fd7db45 · outbound

This paper cites Filling the image information gap for VQA: Prompting large language models to proactively ask questions,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Filling the image information gap for VQA: Prompting large language models to proactively ask questions,

Reference 94

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.602828Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.602828Z digest=sha256:80288e5363ee7d15cf1462b5d208864f56814ecc4884f491112a71400a3a5582

Observation 8fb3cfa1-2d26-4465-b9ad-035fa9fb644c · outbound

This paper cites Multimodal Multi-Hop Question Answering Through a Conversation Between Tools and Efficiently Finetuned Large Language Models.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Multimodal Multi-Hop Question Answering Through a Conversation Between Tools and Efficiently Finetuned Large Language Models

Reference 95

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.607488Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.607488Z digest=sha256:4148f501eb7712036bddb15f27ec8f492e00f5d57246c6b14a3cf34fd0e751d5

Observation f6e5080b-05b7-40a7-9c26-0962906a8d4a · outbound

This paper cites Learn to explain: Multimodal reasoning via thought chains for science question answering,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Learn to explain: Multimodal reasoning via thought chains for science question answering,

Reference 96

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.612605Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.612605Z digest=sha256:812cbcd453107cbc5399ac726d993a1df2e05db89bb090c75d962947387fd9be

Observation 8dd6dd2c-66ee-4dad-b0b4-aad6157d1847 · outbound

This paper cites Multimodal Chain-of-Thought Reasoning in Language Models.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Multimodal Chain-of-Thought Reasoning in Language Models

Reference 97

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.616979Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.616979Z digest=sha256:403ab64b7760471503ccadb0247126d1dbcaa010c9a30fc7cd5f56f4c1c52aaf

Observation bd57b404-b707-4b78-8729-20a2c0ed20ea · outbound

This paper cites T-sciq: Teaching multimodal chain-of-thought reasoning via large language model signals for science question answering,.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey T-sciq: Teaching multimodal chain-of-thought reasoning via large language model signals for science question answering,

Reference 98

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.622299Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.622299Z digest=sha256:088beb4c182a5374005f4c0cb9a312f78028aba33f8c9449a701a9cf65e13014

Observation 170d0af2-a920-4136-be48-68ded2fa38b2 · outbound

This paper cites KAM-CoT: Knowledge Augmented Multimodal Chain-of-Thoughts Reasoning.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey KAM-CoT: Knowledge Augmented Multimodal Chain-of-Thoughts Reasoning

Reference 99

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.627119Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.627119Z digest=sha256:b4bdd49ede0e37d7a7e7d755dee4413bdeef2817cc354a3eb65e89a23de710b9

Observation c4cdba88-c0cf-4eb1-a42a-def771209950 · outbound

This paper cites Measuring and Improving Chain-of-Thought Reasoning in Vision-Language Models.

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey Measuring and Improving Chain-of-Thought Reasoning in Vision-Language Models

Reference 100

Resolution
unresolved
no resolver link, observed 2026-08-11T18:11:54.632569Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:11:54.632569Z digest=sha256:4ddfb8d874176f8b282ffd408a024a4d3eb839cfe1a7bf435cf40ae23de9502d

Pith citing papers

No inbound Pith citation observations are available.