Pith. sign in

Paper Citation Record · LEDGER

Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective

As of 23 August 2026, this Paper Citation Record lists 100 of 142 outbound references and 0 inbound Pith citation observations for arXiv:2502.01524.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2502.01524 v1

Coverage vector

measured 100 of 142 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-09T15:04:40.168560Z

measured 100 of 100 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-22T06:32:14.747728+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

100 of 142 outbound references displayed

  • verified exact2
  • verified fuzzy8
  • unresolved90
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation e6d437cd-146a-4b77-a2d4-69c028ed7f5a · outbound

This paper cites A survey of vision-language pre-trained models.

Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective A survey of vision-language pre-trained models

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-09T15:04:39.867620Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T15:04:39.867620Z digest=sha256:ae5f5f21fdf359ed983996a4d81827fbf99f662d0be601a8a5d48eccc8f428bb

Observation 1e443c2d-445c-4abd-8f04-3800e1afa15d · outbound

This paper cites A survey on multimodal large language models.

Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective A survey on multimodal large language models

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-09T15:04:39.872201Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T15:04:39.872201Z digest=sha256:c80d6fd2f304ad263927a79e1292db3c3f3c82efce3619593c22b173b404a65f

Observation 6daf3c52-c715-42ee-8f23-7c07cdbd0bb7 · outbound

This paper cites OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models.

Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-09T15:04:39.875630Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T15:04:39.875630Z digest=sha256:3f7ba13a6b9194d2c8aa49475a31bb8bcf86be40c3acc3ccbeae838bf7400f02

Observation 164ad24e-cf08-4bff-b421-2bb11d9c1dca · outbound

This paper cites BLIP: Bootstrapping language-image pre-training for unified vision-language understanding and generation.

Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective BLIP: Bootstrapping language-image pre-training for unified vision-language understanding and generation

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-09T15:04:39.879606Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T15:04:39.879606Z digest=sha256:4b89b52a1ec63ebe0c552a91e7a94c1eb2a4ab1a9382747c14e68dfdba91d7ee

Observation b5c87fe2-625d-4855-a27f-335b72e9376b · outbound

This paper cites CoCa: Contrastive captioners are image-text foundation models.

Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective CoCa: Contrastive captioners are image-text foundation models

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-09T15:04:39.883096Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T15:04:39.883096Z digest=sha256:5fbed96fefd3fea9a8da95fefc42f2ea775e89c5c0899eedc1cf9aed8547fb1a

Observation f426c724-45ed-4418-adba-dd5e62354e62 · outbound

This paper cites Multimodal few-shot learning with frozen language models.

Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective Multimodal few-shot learning with frozen language models

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-09T15:04:39.886565Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T15:04:39.886565Z digest=sha256:103f471e094fc2dc4b41e830d0a8ebd4f6f651f917b03bf47179a808d9e180e7

Observation 46a9367c-c561-4218-95e6-3298602c00f0 · outbound

This paper cites BLIP-2: Bootstrapping language-image pre-training with frozen image encoders and large language models.

Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective BLIP-2: Bootstrapping language-image pre-training with frozen image encoders and large language models

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-09T15:04:39.889977Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T15:04:39.889977Z digest=sha256:1e07f558b3e21e16aae19a1b6760a7a0b4c86a8cd5d004135fbc7f6ccecc6aba

Observation 6ede9358-135c-49ac-a1b7-166d4138f130 · outbound

This paper cites Visual instruction tuning.

Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective Visual instruction tuning

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-09T15:04:39.893311Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T15:04:39.893311Z digest=sha256:37e11dfaf030569a8256c4b63d8a5e8f4758feaf9c6ced18f7fad2d1b6d6534b

Observation 22c3ea26-8cb7-4be9-93ee-c0317562134d · outbound

This paper cites LLaMA-Adapter V2: Parameter-Efficient Visual Instruction Model.

Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective LLaMA-Adapter V2: Parameter-Efficient Visual Instruction Model

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-09T15:04:39.896772Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T15:04:39.896772Z digest=sha256:1894d107ad37122797116a3ececf13a5927c66f632bc9f13a03d7542c2f3544c

Observation ef4f0941-7721-4946-9159-2ba47d851006 · outbound

This paper cites Enhance Reasoning Ability of Visual-Language Models via Large Language Models.

Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective Enhance Reasoning Ability of Visual-Language Models via Large Language Models

Reference 10

Resolution
verified exact
local_arxiv, observed 2026-08-09T15:04:40.716519Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-09T15:04:39.900226Z digest=sha256:6576d52eb4bbe98ae3565ad92eaeb353c46b8ca0931eed9de40c63c10097405d

Observation c987c973-45c6-4dc3-a7b1-1ae724bd7c58 · outbound

This paper cites Learn to explain: Multimodal reasoning via thought chains for science question answering.

Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective Learn to explain: Multimodal reasoning via thought chains for science question answering

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-09T15:04:39.903844Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T15:04:39.903844Z digest=sha256:8d6e9f108e01a57eeb965bdf4e4c1a5d2218249ce8f9dd205fa4a6ff1bfb859f

Observation 6dedc236-47b4-4c04-85f6-228e1aee63f0 · outbound

This paper cites MMBench: Is Your Multi-modal Model an All-around Player?.

Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective MMBench: Is Your Multi-modal Model an All-around Player?

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-09T15:04:39.907109Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T15:04:39.907109Z digest=sha256:9e8f59c93b2fc3ecb6f5fcc760c472de7e5a01c8d66025c142d0afbcb34a739d

Observation 6dcf1de6-7740-40ac-864b-634065d7126e · outbound

This paper cites MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models.

Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-09T15:04:39.910736Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T15:04:39.910736Z digest=sha256:9396e393435f2e1957d6c26b9f855432c9d69218f208d582917e198b832a1909

Observation cd67d5d3-1d84-4aa8-acaf-d9ba6fbd9704 · outbound

This paper cites Efficient multimodal large language models: A survey.

Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective Efficient multimodal large language models: A survey

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-09T15:04:39.914137Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T15:04:39.914137Z digest=sha256:48e7deff02ae5d5a3db9db33410597773a3e661f882cb7167018988c827bc7be

Observation 647b4678-9837-4bb3-947a-1a1e691f536e · outbound

This paper cites Parameter-Efficient Fine-Tuning Methods for Pretrained Language Models: A Critical Review and Assessment.

Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective Parameter-Efficient Fine-Tuning Methods for Pretrained Language Models: A Critical Review and Assessment

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-09T15:04:39.917367Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T15:04:39.917367Z digest=sha256:92972bd5015bb870c3c661fa1d6d22fcca9183599612f5a5708bb6f108684bf7

Observation a29d29bf-7d17-4e2f-ac16-41e4e9e7d1b1 · outbound

This paper cites Flamingo: A visual language model for few-shot learning.

Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective Flamingo: A visual language model for few-shot learning

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-09T15:04:39.920901Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T15:04:39.920901Z digest=sha256:b64eb7911efd0a7fd585db4b603e02c2a0afd0cd3f4db082966383a37553f25c

Observation e0b950ca-9483-42a5-b8e3-d2a945e9fbc9 · outbound

This paper cites ClipCap: CLIP Prefix for Image Captioning.

Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective ClipCap: CLIP Prefix for Image Captioning

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-09T15:04:39.924340Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T15:04:39.924340Z digest=sha256:aa93c0f0321a05409f9ceac302c8aa10bf983bf20681a9d27b25d82178e3b5d6

Observation b564ca1b-22f3-463b-9742-65a1c236502c · outbound

This paper cites MAPL: Parameter-efficient adaptation of unimodal pre-trained models for vision-language few-shot prompting.

Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective MAPL: Parameter-efficient adaptation of unimodal pre-trained models for vision-language few-shot prompting

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-09T15:04:39.927544Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T15:04:39.927544Z digest=sha256:927b6c75079b38de9f4c2ec48bc9d5e1d1db13cb1ca6ec18b09a3e375523e05e

Observation 298d19fb-73cc-4deb-920e-49a02a55fae5 · outbound

This paper cites Meta learning to bridge vision and language models for multimodal few-shot learning.

Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective Meta learning to bridge vision and language models for multimodal few-shot learning

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-09T15:04:39.930180Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T15:04:39.930180Z digest=sha256:0651b420a6eace4d8505a3a649b9f8e7e7f7ec1280135e038679dd9b0e22d5c2

Observation e2705466-79f1-4220-8889-99aff244a97a · outbound

This paper cites Grounding language models to images for multimodal inputs and outputs.

Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective Grounding language models to images for multimodal inputs and outputs

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-09T15:04:39.932638Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T15:04:39.932638Z digest=sha256:7f9b448fcb7b9eecf768f154a214af7b7f3aaba23c3409056c31bd0222be0e9c

Observation 498abddf-ebeb-4656-8571-af2692ff48ad · outbound

This paper cites MiniGPT-4: Enhancing vision- language understanding with advanced large language models.

Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective MiniGPT-4: Enhancing vision- language understanding with advanced large language models

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-09T15:04:39.935038Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T15:04:39.935038Z digest=sha256:3e94bfbb9002e2a3527f6dd3ef511c132d0cf3a30c6757a0247b0ed5d6989970

Observation 7f630ceb-7b5a-4204-923b-fb43ffb6d6e5 · outbound

This paper cites CogVLM: Visual Expert for Pretrained Language Models.

Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective CogVLM: Visual Expert for Pretrained Language Models

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-09T15:04:39.937725Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T15:04:39.937725Z digest=sha256:a3a6798da57fa53760d762ba39b735e17392977736b4bb31e66e918cc682ef3d

Observation 0269ea58-282b-475a-998b-a714a920f942 · outbound

This paper cites Zero-shot video question answering via frozen bidirectional language models.

Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective Zero-shot video question answering via frozen bidirectional language models

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-09T15:04:39.940432Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T15:04:39.940432Z digest=sha256:be68a726d87cc47a696623f369b7557e40cfd685d55361ecdad43ab22be5c040

Observation 60e8302d-1e73-4e18-bb87-d65cc6f04b2e · outbound

This paper cites Video-LLaMA: An instruction-tuned audio-visual language model for video understanding.

Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective Video-LLaMA: An instruction-tuned audio-visual language model for video understanding

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-09T15:04:39.943147Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T15:04:39.943147Z digest=sha256:190b1dc91f8d5c499d8a148738875b95420397d03ab2deb834c1e2c83e5bd0d2

Observation fb9d8667-ce3b-4569-8819-10fae47b825d · outbound

This paper cites Improved baselines with visual instruction tuning.

Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective Improved baselines with visual instruction tuning

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-09T15:04:39.946263Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T15:04:39.946263Z digest=sha256:ac9a6d0dd50fbc0b09bcc2e80a22e25c8ec3b92ba6f782ac949ba77ace1f13dc

Observation 939da5a9-fefe-4e2e-8126-3e87f6f7a102 · outbound

This paper cites Qwen Technical Report.

Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective Qwen Technical Report

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-09T15:04:39.948925Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T15:04:39.948925Z digest=sha256:9997c59a68b2a2b8f09a7919165a210b52681aacdf94783cdd7aaf18822b813e

Observation 9b7213fb-94c0-42ab-b8d1-8f55e76ea7f0 · outbound

This paper cites mPLUG-Owl2: Revolutionizing multi-modal large language model with modality collaboration.

Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective mPLUG-Owl2: Revolutionizing multi-modal large language model with modality collaboration

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-09T15:04:39.952130Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T15:04:39.952130Z digest=sha256:98810d4d5bd179e6b85419d45971aa46f5158335c92fe5378d03261c127f0a81

Observation 4b0aa42d-dad9-46f8-a9de-823a1f6ef859 · outbound

This paper cites mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality.

Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-09T15:04:39.955349Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T15:04:39.955349Z digest=sha256:8d407036d72c62d4bf55b5130a303185e4e47c95d9ea3538c6961f4e058eb7da

Observation eb78acd7-16a6-4749-8518-77d4829a4d38 · outbound

This paper cites LoRA: Low-rank adaptation of large language models.

Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective LoRA: Low-rank adaptation of large language models

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-09T15:04:39.958683Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T15:04:39.958683Z digest=sha256:8c8a442853d6b63d38e32fbaf5d954c4a38281dfaabd0aab2cea01bfe2abcb22

Observation 872f33cc-f8e6-4364-b6fe-8a3940391320 · outbound

This paper cites MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices.

Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-09T15:04:39.961643Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T15:04:39.961643Z digest=sha256:f5bd3d5f87ea632c417878880c27f8657b5f10860a6829b9faf8f2a8b074fed5

Observation 205ed56e-b783-45c7-be21-eeb7ba56ca4e · outbound

This paper cites MobileVLM V2: Faster and Stronger Baseline for Vision Language Model.

Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective MobileVLM V2: Faster and Stronger Baseline for Vision Language Model

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-09T15:04:39.965044Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T15:04:39.965044Z digest=sha256:2ebe99f396461ad0fecb274f08b06e9c53266b5364c86a46d727864ab3d70201

Observation 320076f9-1530-4cd8-8348-30a4b87f2868 · outbound

This paper cites VL-Mamba: Exploring State Space Models for Multimodal Learning.

Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective VL-Mamba: Exploring State Space Models for Multimodal Learning

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-09T15:04:39.968203Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T15:04:39.968203Z digest=sha256:70d9c558173abbeeb090b5a383056baead02844a628928e3e88c4379f8074632

Observation 5996fdf1-abec-4886-a158-75ea0c9a31fd · outbound

This paper cites VL-Adapter: Parameter-efficient transfer learning for vision-and- language tasks.

Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective VL-Adapter: Parameter-efficient transfer learning for vision-and- language tasks

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-09T15:04:39.971642Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T15:04:39.971642Z digest=sha256:e8e34ac0bc5aba704464e67a423350ffd274c253d1ff2e29ca1c3151fd258b1f

Observation 365c8f04-35c6-4d65-96fd-b0fec66bcd56 · outbound

This paper cites eP-ALM: Efficient perceptual augmentation of language models.

Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective eP-ALM: Efficient perceptual augmentation of language models

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-09T15:04:39.974572Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T15:04:39.974572Z digest=sha256:f1c1e0dd56b019dfdee83d971137de2afb1f45a24f4d78d440938203092b4560

Observation b2703f53-58c3-4817-884a-bc2848fea02d · outbound

This paper cites Modular and parameter-efficient multimodal fusion with prompting.

Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective Modular and parameter-efficient multimodal fusion with prompting

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-09T15:04:39.977405Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T15:04:39.977405Z digest=sha256:a619f89c74e131d7d431a7d0aa01e42149cb929618cefdc0045a918e4a916f90

Observation 5b3af116-f719-4f8f-b741-c6ed778b100e · outbound

This paper cites Memory-space visual prompting for efficient vision-language fine-tuning.

Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective Memory-space visual prompting for efficient vision-language fine-tuning

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-09T15:04:39.980372Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T15:04:39.980372Z digest=sha256:9cdd10c2df15700e27db0a9a6b4a0f9f21e63152d3ebb83f0f1261ecea3b084c

Observation ce314d64-5d73-4e5c-ae4d-192615ba2de4 · outbound

This paper cites LLaMA- Adapter: Efficient fine-tuning of large language models with zero-initialized attention.

Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective LLaMA- Adapter: Efficient fine-tuning of large language models with zero-initialized attention

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-09T15:04:39.983200Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T15:04:39.983200Z digest=sha256:59a530d6a0002d669d8ca78f3eaa402c8085ec7f1b1e7fdff39e5af59f82251e

Observation d589512b-9208-4fc7-9e5d-dd8029137ec2 · outbound

This paper cites LST: Ladder side-tuning for parameter and memory efficient transfer learning.

Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective LST: Ladder side-tuning for parameter and memory efficient transfer learning

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-09T15:04:39.986215Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T15:04:39.986215Z digest=sha256:56c6a14604d61b9ef39152eb554a6bfaf23d2da8c82195696c71fcbfe33a3d37

Observation cd8b9769-22f6-4504-bf24-bb786ac0c34b · outbound

This paper cites Querying as Prompt: Parameter-efficient learning for multimodal language model.

Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective Querying as Prompt: Parameter-efficient learning for multimodal language model

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-09T15:04:39.989148Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T15:04:39.989148Z digest=sha256:5a86367827f2b5f661214db2a1d213d0f8b8a7b31b0dd89ac65f98f74a184a33

Observation 174c3a02-9cea-4510-a5ba-43ec66a4061a · outbound

This paper cites VL-PET: Vision-and-language parameter-efficient tuning via granularity control.

Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective VL-PET: Vision-and-language parameter-efficient tuning via granularity control

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-09T15:04:39.992123Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T15:04:39.992123Z digest=sha256:444e395d609b3de0264335fc52daf8509e548abe0196a33115a14975b92b0e2f

Observation 3531df63-6c86-4d50-9622-6f928072a227 · outbound

This paper cites Cheap and Quick: Efficient vision-language instruction tuning for large language models.

Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective Cheap and Quick: Efficient vision-language instruction tuning for large language models

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-09T15:04:39.995219Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T15:04:39.995219Z digest=sha256:727017c2c3692820d8af376b9425847b00c37372a0e2f05e7ead18c49a5a1310

Observation 8a02be6a-ca0a-410d-805b-27517172b903 · outbound

This paper cites https://scholar.google.com/, accessed 3 February 2025.

Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective https://scholar.google.com/, accessed 3 February 2025

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-09T15:04:39.998099Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T15:04:39.998099Z digest=sha256:2961ee28befa0d45fb20767eb3bd7f347162a0e7b4d4467d6797421983e069b6

Observation d57eb153-3b91-44a0-9dff-b049c42df845 · outbound

This paper cites https://ccf.atom.im/, accessed 3 February 2025.

Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective https://ccf.atom.im/, accessed 3 February 2025

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-09T15:04:40.001097Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T15:04:40.001097Z digest=sha256:aee8154307606ff4d24409ca64edb6d7f3e5abdfbfb20151e25f67ddf4d37b0e

Observation 3238c389-7e2a-4016-92f6-276a361469c5 · outbound

This paper cites MAGMA – Multimodal augmentation of generative models through adapter-based finetuning.

Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective MAGMA – Multimodal augmentation of generative models through adapter-based finetuning

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-09T15:04:40.004049Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T15:04:40.004049Z digest=sha256:ac5b7e6b2a114f34824d84df72cfa9fb957d29e603cb81652363bd15e8de62b1

Observation 89db0d2b-9a55-4f5f-bbcb-e66c5c8cda71 · outbound

This paper cites Fusing pre-trained language models with multimodal prompts through reinforcement learning.

Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective Fusing pre-trained language models with multimodal prompts through reinforcement learning

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-09T15:04:40.006975Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T15:04:40.006975Z digest=sha256:7aa0079fbed837be24f67cd0edcbaa519a9ae3809265c53f6cd4e7ae5e5d705e

Observation 98198cd3-20b6-4985-87af-7510cc8920bd · outbound

This paper cites Aligning large multimodal models with factually augmented RLHF.

Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective Aligning large multimodal models with factually augmented RLHF

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-09T15:04:40.009864Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T15:04:40.009864Z digest=sha256:b78440d2d96da433ff74189b7f4a31a4393965a5d3ca78d6d9f723ea1ec31f98

Observation 13933274-9c49-48b4-a150-00ad65d5e30c · outbound

This paper cites Honeybee: Locality-enhanced projector for multimodal LLM.

Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective Honeybee: Locality-enhanced projector for multimodal LLM

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-09T15:04:40.012962Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T15:04:40.012962Z digest=sha256:1c53b23d8f8445ba06210d5fd23ce7009a1517b3adf2db20bf4853623642ae22

Observation 309f6c3a-8f81-4b20-ad4b-905e202c53b6 · outbound

This paper cites Tuning large multimodal models for videos using reinforcement learning from AI feedback.

Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective Tuning large multimodal models for videos using reinforcement learning from AI feedback

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-09T15:04:40.016197Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T15:04:40.016197Z digest=sha256:eef7a77c53db6d2b751109ea1fb20fdaf0013fc0703fd3f7103c4097ed208478

Observation ebffaf42-cce5-4b44-a99f-94a273ea8917 · outbound

This paper cites X-LLM: Bootstrapping Advanced Large Language Models by Treating Multi-Modalities as Foreign Languages.

Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective X-LLM: Bootstrapping Advanced Large Language Models by Treating Multi-Modalities as Foreign Languages

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-09T15:04:40.019790Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T15:04:40.019790Z digest=sha256:f017660f659c7a29abd48d587a08736e0de1f75ba15bb7704fd34e0b78c5f612

Observation c6e04b1b-5c38-4d0a-b2ac-7feecbfcff68 · outbound

This paper cites Attention is all you need.

Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective Attention is all you need

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-09T15:04:40.023001Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T15:04:40.023001Z digest=sha256:7ade94ce23a4f1253fae0c9f2fd02efee1d62d024bbe12e6ee2c593d6b53da5d

Observation 7e9f69bd-b610-4224-abd1-26373140a28f · outbound

This paper cites RoBERTa: A Robustly Optimized BERT Pretraining Approach.

Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective RoBERTa: A Robustly Optimized BERT Pretraining Approach

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-09T15:04:40.025902Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T15:04:40.025902Z digest=sha256:a2eaed8e446f155ffef4cc97effc3cec435730a591a088ee933da59b5a6a6ac8

Observation 8daa8679-7691-43cf-8aa1-b3ce9a17c000 · outbound

This paper cites DeBERTa: Decoding-enhanced BERT with disentangled attention.

Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective DeBERTa: Decoding-enhanced BERT with disentangled attention

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-09T15:04:40.029101Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T15:04:40.029101Z digest=sha256:8f662c9e7679747fa1b56f67b430975f247f0a62f5616a8f79a53a7757f8ad39

Observation 9c3a6450-afbb-476d-b6be-8b73bff3c758 · outbound

This paper cites Exploring the limits of transfer learning with a unified text-to-text transformer.

Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective Exploring the limits of transfer learning with a unified text-to-text transformer

Reference 53

Resolution
unresolved
no resolver link, observed 2026-08-09T15:04:40.031596Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T15:04:40.031596Z digest=sha256:c24be36bb886509a5e01eefb2cd67852ff28644e08961491802d3e1ed53221d2

Observation 3409ea1b-91f4-4a2a-939c-bf0e6b79dd54 · outbound

This paper cites BART: Denoising sequence-to-sequence pre-training for natural language generation, translation, and comprehension.

Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective BART: Denoising sequence-to-sequence pre-training for natural language generation, translation, and comprehension

Reference 54

Resolution
unresolved
no resolver link, observed 2026-08-09T15:04:40.034055Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T15:04:40.034055Z digest=sha256:4267557700dad9e566314928e9108dcbdeb317569b75a0f7327b0592378201f7

Observation 5dec0e91-c574-4940-aa2e-156a8acf3e2f · outbound

This paper cites LLaMA: Open and Efficient Foundation Language Models.

Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective LLaMA: Open and Efficient Foundation Language Models

Reference 55

Resolution
unresolved
no resolver link, observed 2026-08-09T15:04:40.036831Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T15:04:40.036831Z digest=sha256:5c745ca8b91e38664de1108938687912f3ea89965ae8d94297f4b11f102b7651

Observation 1e1968f0-f36c-48d8-b779-7a1d39c5b6a9 · outbound

This paper cites VICUNA: An open-source chatbot impressing gpt-4 with 90% chatgpt quality.

Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective VICUNA: An open-source chatbot impressing gpt-4 with 90% chatgpt quality

Reference 56

Resolution
unresolved
no resolver link, observed 2026-08-09T15:04:40.039400Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T15:04:40.039400Z digest=sha256:9737cb007591277e61e5c0ce15c76f68bc4b35d0c69e32884b105286de0e408d

Observation f2ec3af0-cfb1-4232-84d4-06ff68551f05 · outbound

This paper cites OPT: Open Pre-trained Transformer Language Models.

Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective OPT: Open Pre-trained Transformer Language Models

Reference 57

Resolution
unresolved
no resolver link, observed 2026-08-09T15:04:40.042291Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T15:04:40.042291Z digest=sha256:1d6bc5012c774f25ac757174eb193825460e76194c12f2ffc3360b07ec44594a

Observation a7f6d2ac-d41b-4473-8924-c4bbb317bf08 · outbound

This paper cites GPT-3: Its nature, scope, limits, and consequences.

Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective GPT-3: Its nature, scope, limits, and consequences

Reference 58

Resolution
unresolved
no resolver link, observed 2026-08-09T15:04:40.044988Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T15:04:40.044988Z digest=sha256:2fbbb865e214ed22181eb507f086aac76832c8e1c138820f9c89f5de2c675f3a

Observation 36bb6093-3351-473d-84be-da66d9b7fe31 · outbound

This paper cites GPT-4 Technical Report.

Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective GPT-4 Technical Report

Reference 59

Resolution
unresolved
no resolver link, observed 2026-08-09T15:04:40.047541Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T15:04:40.047541Z digest=sha256:711ffcc1b26ae6884f134e187133ffb5029d41a206f745b1eb80f84432630d5a

Observation 78122603-8fd6-4c47-91e7-f392efa82edd · outbound

This paper cites ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Tools.

Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Tools

Reference 60

Resolution
unresolved
no resolver link, observed 2026-08-09T15:04:40.050595Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T15:04:40.050595Z digest=sha256:dd3764d4884b6909191fa9a7fc498204e2112f57f9299ca61c40d75c7e60e062

Observation 48c4d7dc-be62-45ef-827e-c53a22c52833 · outbound

This paper cites Mamba: Linear-Time Sequence Modeling with Selective State Spaces.

Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective Mamba: Linear-Time Sequence Modeling with Selective State Spaces

Reference 61

Resolution
unresolved
no resolver link, observed 2026-08-09T15:04:40.053774Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T15:04:40.053774Z digest=sha256:a23890acb456e6a31f1e30856dcb5db5480f7f22fd3b205432f51a85b7a6193a

Observation 22dd2925-29ef-4c1e-9b24-b3a4edf80ffa · outbound

This paper cites Scaling instruction-finetuned language models.

Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective Scaling instruction-finetuned language models

Reference 62

Resolution
unresolved
no resolver link, observed 2026-08-09T15:04:40.057046Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T15:04:40.057046Z digest=sha256:b1ea0a3a94ccd2906ce0f1571bc076fcd5bc086d6d886a7e1c1ad3ed46b64986

Observation 294a6f7b-3705-4a1e-b48b-650688d5e136 · outbound

This paper cites Language models are few-shot learners.

Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective Language models are few-shot learners

Reference 63

Resolution
unresolved
no resolver link, observed 2026-08-09T15:04:40.059978Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T15:04:40.059978Z digest=sha256:23834b390c850911782d12589ec159a4aa941553d663604963b915d6761e8060

Observation 033162df-9bbd-4cce-8b43-068b24bc71b9 · outbound

This paper cites GPT-J-6B: A 6 Billion Parameter Autoregressive Language Model [software].

Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective GPT-J-6B: A 6 Billion Parameter Autoregressive Language Model [software]

Reference 64

Resolution
unresolved
no resolver link, observed 2026-08-09T15:04:40.062934Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T15:04:40.062934Z digest=sha256:a12867dda6be5dfa2c7e97b97566268b017c869fe0fb983a39a3bb5df006b580

Observation eb6aef89-43f0-47fd-8ff1-2ac67ddfd510 · outbound

This paper cites An empirical analysis of compute-optimal large language model training.

Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective An empirical analysis of compute-optimal large language model training

Reference 65

Resolution
unresolved
no resolver link, observed 2026-08-09T15:04:40.066175Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T15:04:40.066175Z digest=sha256:8439e85b6e89df0bb544f747b81469ce16827cf7f6e4085e7a6a416b6beff32e

Observation a961051f-5c53-4d48-9d8f-d55d5f0e04e9 · outbound

This paper cites Introducing MPT-7B: A New Standard for Open-Source, Commercially Usable LLMs [software].

Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective Introducing MPT-7B: A New Standard for Open-Source, Commercially Usable LLMs [software]

Reference 66

Resolution
unresolved
no resolver link, observed 2026-08-09T15:04:40.069197Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T15:04:40.069197Z digest=sha256:7a3b18f5a2d055c19c14a541d4a72fabb4f18e2103de4d8fd9faf63bc2577774

Observation 3f2584fb-627e-4d84-a5d0-3f4f72252b71 · outbound

This paper cites Releasing 3B and 7B RedPajama-INCITE family of models including base, instruction-tuned & chat models [software].

Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective Releasing 3B and 7B RedPajama-INCITE family of models including base, instruction-tuned & chat models [software]

Reference 67

Resolution
unresolved
no resolver link, observed 2026-08-09T15:04:40.072233Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T15:04:40.072233Z digest=sha256:1c44373e9644bd7b4cc604f476bb03015d60c9a46febc95a25bc61158b3a7f2d

Observation f252bce0-b004-404c-9a07-ae4224e21174 · outbound

This paper cites Llama 2: Open Foundation and Fine-Tuned Chat Models.

Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective Llama 2: Open Foundation and Fine-Tuned Chat Models

Reference 68

Resolution
unresolved
no resolver link, observed 2026-08-09T15:04:40.074970Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T15:04:40.074970Z digest=sha256:aa6402cfcc2503f17ebbc8def9f1824b7a4feec8c0a64cea97b6e3d4a8038656

Observation b3c53c0a-839b-4ab3-833d-851c92904839 · outbound

This paper cites GLU Variants Improve Transformer.

Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective GLU Variants Improve Transformer

Reference 69

Resolution
unresolved
no resolver link, observed 2026-08-09T15:04:40.078158Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T15:04:40.078158Z digest=sha256:826d4b24ffe21b2d74d9ea2c6087a8ff02ffc00e2d0d033d4f4b908ce99f380f

Observation fb8b7ef8-928d-4190-8167-b2b3c3b0c29c · outbound

This paper cites Prefix-Tuning: Optimizing continuous prompts for generation.

Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective Prefix-Tuning: Optimizing continuous prompts for generation

Reference 70

Resolution
unresolved
no resolver link, observed 2026-08-09T15:04:40.081565Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T15:04:40.081565Z digest=sha256:bba5c0aec0ab382e4035cd4a63b59f47b4bee34e1ac8469de6205f151fe1989e

Observation 87cccc94-30f8-40fd-9fff-9c2c956b221f · outbound

This paper cites The power of scale for parameter-efficient prompt tuning.

Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective The power of scale for parameter-efficient prompt tuning

Reference 71

Resolution
unresolved
no resolver link, observed 2026-08-09T15:04:40.084499Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T15:04:40.084499Z digest=sha256:50cfb9d70e429f268e16077eb5f87aa9ed8499bf9804a3803cfc69f39180eaa4

Observation ecf87842-a444-41d5-8f8c-aa1d74bf042d · outbound

This paper cites Parameter-efficient transfer learning for NLP.

Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective Parameter-efficient transfer learning for NLP

Reference 72

Resolution
unresolved
no resolver link, observed 2026-08-09T15:04:40.087547Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T15:04:40.087547Z digest=sha256:e496084c6a5dc92ead893bb8f6003ca5374830c3c789ad0282c28d433a330d0c

Observation eb915d4a-a094-4644-acfc-726a530bac7a · outbound

This paper cites QLoRA: Efficient finetuning of quantized llms.

Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective QLoRA: Efficient finetuning of quantized llms

Reference 73

Resolution
unresolved
no resolver link, observed 2026-08-09T15:04:40.090638Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T15:04:40.090638Z digest=sha256:0a1efc6e8f1b4cc3a3b39181eb6ac52e292cebb94372be860b0f4e9da3220caf

Observation cdf36ff4-ae60-4626-bac8-637268b8744d · outbound

This paper cites DoRA: Weight-Decomposed Low-Rank Adaptation.

Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective DoRA: Weight-Decomposed Low-Rank Adaptation

Reference 74

Resolution
unresolved
no resolver link, observed 2026-08-09T15:04:40.093575Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T15:04:40.093575Z digest=sha256:f7d13502ec8c227634e8926d8178a71980ac391cafd1ba1a0196544345e73918

Observation 2f36c6d8-c326-4c23-ac71-f4480cf7a73e · outbound

This paper cites Visual prompt tuning.

Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective Visual prompt tuning

Reference 75

Resolution
unresolved
no resolver link, observed 2026-08-09T15:04:40.096753Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T15:04:40.096753Z digest=sha256:bad6f9a8a873e5855d8bce23298350b7a454c86248a955dfc259919968a74645

Observation 4455784a-1e4c-46c3-971c-1ae0d508118e · outbound

This paper cites Exploring versatile generative language model via parameter- efficient transfer learning.

Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective Exploring versatile generative language model via parameter- efficient transfer learning

Reference 76

Resolution
unresolved
no resolver link, observed 2026-08-09T15:04:40.099802Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T15:04:40.099802Z digest=sha256:8bda41fa2b515fa10a081a16334a1817573dd250ce52fdac4fde42e7b3081fc7

Observation 22772174-463a-40ff-bfcf-78d869e83a38 · outbound

This paper cites Towards a unified view of parameter-efficient transfer learning.

Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective Towards a unified view of parameter-efficient transfer learning

Reference 77

Resolution
unresolved
no resolver link, observed 2026-08-09T15:04:40.102650Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T15:04:40.102650Z digest=sha256:053c60bee7ba8f6f43a55efd2085158887d1e9eec3fe9f7475031e2333a6051d

Observation 3caed64f-01e2-421f-84d0-f561d203eecd · outbound

This paper cites AdapterSoup: Weight averaging to improve generalization of pretrained language models.

Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective AdapterSoup: Weight averaging to improve generalization of pretrained language models

Reference 78

Resolution
unresolved
no resolver link, observed 2026-08-09T15:04:40.105545Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T15:04:40.105545Z digest=sha256:dd74b1b2283d6b9980c918ec3e115d34e4207d345d2492756f50afe304bedcd7

Observation 61074ac1-edc3-4e83-9567-321dfa50f885 · outbound

This paper cites Multi-Task Deep Neural Networks for Natural Language Understanding.

Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective Multi-Task Deep Neural Networks for Natural Language Understanding

Reference 79

Resolution
unresolved
no resolver link, observed 2026-08-09T15:04:40.108448Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T15:04:40.108448Z digest=sha256:ac13ab1e1cb2c4f6d59dedeea81125b397c2e025820b4d02bc6240027b76790f

Observation 145829e4-82f3-4838-b307-254595175fa7 · outbound

This paper cites Multitask learning.

Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective Multitask learning

Reference 80

Resolution
unresolved
no resolver link, observed 2026-08-09T15:04:40.111423Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T15:04:40.111423Z digest=sha256:66828a3544d2822416a5383ebe58a1d48f948f5bd53821fe4316ad269e7d612a

Observation 9c6b41fd-7495-4f55-b266-31b88dff6087 · outbound

This paper cites A survey of multi-task learning in natural language processing: Regarding task relatedness and training methods.

Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective A survey of multi-task learning in natural language processing: Regarding task relatedness and training methods

Reference 81

Resolution
unresolved
no resolver link, observed 2026-08-09T15:04:40.114409Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T15:04:40.114409Z digest=sha256:0f67995ffc2c817bf839138d9381d0696d20a04774fcd9f6691a5af34e636205

Observation f1b100b5-75c3-4d63-89ee-b4a63864b153 · outbound

This paper cites Multi-Task Learning with LLMs for Implicit Sentiment Analysis: Data-level and Task-level Automatic Weight Learning.

Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective Multi-Task Learning with LLMs for Implicit Sentiment Analysis: Data-level and Task-level Automatic Weight Learning

Reference 82

Resolution
verified exact
local_arxiv, observed 2026-08-09T15:04:40.419710Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-09T15:04:40.117223Z digest=sha256:a583f504bc77b3943419eeb2e46d4269f7ec2f126b93656241501fc78c87b1ed

Observation 4f8032f2-8fd3-4bd0-bbef-a8eb6f4cb9b8 · outbound

This paper cites Dai, and Quoc V Le.

Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective Dai, and Quoc V Le

Reference 83

Resolution
unresolved
no resolver link, observed 2026-08-09T15:04:40.120222Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T15:04:40.120222Z digest=sha256:604a11440530aa6c9135ca41918d315bf2f150e1f218163ad5966723bf8746a6

Observation 8508d555-5ee9-4d9b-a066-21277a4d4e9e · outbound

This paper cites Training language models to follow instructions with human feedback.

Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective Training language models to follow instructions with human feedback

Reference 84

Resolution
unresolved
no resolver link, observed 2026-08-09T15:04:40.122588Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T15:04:40.122588Z digest=sha256:06071711d8492cee3d094c7269fcc1f3468e24851ebd747a5027cb098f2c5b6c

Observation 7df50e87-abea-417d-bff0-23feca8f92de · outbound

This paper cites Constitutional AI: Harmlessness from AI Feedback.

Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective Constitutional AI: Harmlessness from AI Feedback

Reference 85

Resolution
unresolved
no resolver link, observed 2026-08-09T15:04:40.124995Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T15:04:40.124995Z digest=sha256:db6094bffe24b2fdd9685a561625279172e3425d7a4dfcd9076bed4e57dfd761

Observation dcdfa431-b162-47d8-9177-e59c42c01592 · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 86

Resolution
unresolved
no resolver link, observed 2026-08-09T15:04:40.127769Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T15:04:40.127769Z digest=sha256:625065019f9425b2a17f8db6e01a7b14b650e18173e732ccec8fb7ee84420224

Observation cde0bf21-9b97-4abb-b73d-705f0490cd7e · outbound

This paper cites Proximal Policy Optimization Algorithms.

Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective Proximal Policy Optimization Algorithms

Reference 87

Resolution
unresolved
no resolver link, observed 2026-08-09T15:04:40.130188Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T15:04:40.130188Z digest=sha256:478cac100bbdf1bdeb08abbe6bfb0818fafcfe077b0231c0f5249eb1bd1e6049

Observation f5d59ee6-009d-4382-943c-f41311cb25d2 · outbound

This paper cites RLHF-V: Towards trustworthy MLLMs via behavior alignment from fine-grained correctional human feedback.

Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective RLHF-V: Towards trustworthy MLLMs via behavior alignment from fine-grained correctional human feedback

Reference 88

Resolution
unresolved
no resolver link, observed 2026-08-09T15:04:40.132714Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T15:04:40.132714Z digest=sha256:f090be6a4776e57b72966f6df7bd874b73420a4eef3599aee6c998af1ec87210

Observation 470ca58c-b3ba-44ca-9021-e1f81ed16205 · outbound

This paper cites Learning transferable visual models from natural language supervision.

Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective Learning transferable visual models from natural language supervision

Reference 89

Resolution
unresolved
no resolver link, observed 2026-08-09T15:04:40.136023Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T15:04:40.136023Z digest=sha256:2d82fccefc813c5ba80c3cd1641c79b445fd7b10633b56b8a8f9168f9190cf2e

Observation a5bf2872-84f5-4092-8062-cc6226d6a5a0 · outbound

This paper cites An image is worth 16x16 words: Transformers for image recognition at scale.

Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective An image is worth 16x16 words: Transformers for image recognition at scale

Reference 90

Resolution
unresolved
no resolver link, observed 2026-08-09T15:04:40.138949Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T15:04:40.138949Z digest=sha256:88355b3a47416e2dec32625f2c5338069b0ad182a35aff896418c81c42bd9b8b

Observation 61784e65-4a2a-4e55-bcb6-77e2f0f611f4 · outbound

This paper cites High-performance large-scale image recognition without normalization.

Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective High-performance large-scale image recognition without normalization

Reference 91

Resolution
unresolved
no resolver link, observed 2026-08-09T15:04:40.141909Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T15:04:40.141909Z digest=sha256:9cc4306543c09d0a6e74898be5cad1211b757b7bbd42d7b267ac4fc5b6e93915

Observation 6255f9a5-f207-44ff-be21-1b3092b36b96 · outbound

This paper cites Scaling vision transformers.

Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective Scaling vision transformers

Reference 92

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T15:04:41.088602Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-09T15:04:40.144780Z digest=sha256:1e313d9eb3220c6b8bd97e4b276491e7f868eaab1cf62c741174a26838b5698f

Observation afb0647e-2f7b-4235-8b34-c99094102e1c · outbound

This paper cites Reproducible scaling laws for contrastive language-image learning.

Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective Reproducible scaling laws for contrastive language-image learning

Reference 93

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T15:04:41.080405Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-09T15:04:40.147567Z digest=sha256:48e67d219f6c33919bbd5337421d416bce32bc8738bc6c5f9493db2b2091b9cd

Observation 5a6b4a6b-ebb5-4b10-bc51-6d3a821661ef · outbound

This paper cites EVA-CLIP: Improved Training Techniques for CLIP at Scale.

Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective EVA-CLIP: Improved Training Techniques for CLIP at Scale

Reference 94

Resolution
unresolved
no resolver link, observed 2026-08-09T15:04:40.150536Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T15:04:40.150536Z digest=sha256:aa20971b15908d897ffae065623bae57a4cb7979fb674f67c76cbb9afc36fcea

Observation 00784461-af2d-4d8b-9519-093e8373a2aa · outbound

This paper cites OpenCLIP [software], July 2021.

Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective OpenCLIP [software], July 2021

Reference 95

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T15:04:41.072389Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-09T15:04:40.153714Z digest=sha256:d400ff19fd83df255d83f1f7dcfe8016d45349a6cb9dbfd3967993411df5453a

Observation 003ac2b0-afb8-40a3-a46c-44fc642ec4c3 · outbound

This paper cites Deep residual learning for image recognition.

Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective Deep residual learning for image recognition

Reference 96

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T15:04:41.064314Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-09T15:04:40.156598Z digest=sha256:7dfc8592fe01e14855f7239c9018e5ce8f18d6f1a3104d3c28f9692cc835e7ff

Observation 5c142689-3d6e-4ab9-aa0a-f5ea26551c03 · outbound

This paper cites Linearly mapping from image to text space.

Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective Linearly mapping from image to text space

Reference 97

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T15:04:41.056430Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-09T15:04:40.159739Z digest=sha256:a924198e2224d7cac1683627cea7941f8770b6245898cd84ef54e50eb3e838ca

Observation db588090-a4db-44ec-9d9e-189bc0681193 · outbound

This paper cites Deformable DETR: Deformable transformers for end-to-end object detection.

Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective Deformable DETR: Deformable transformers for end-to-end object detection

Reference 98

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T15:04:41.048237Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-09T15:04:40.162661Z digest=sha256:e00462610d48f41fcc59204280b19c39a42e5c10df2c76fa5d6d8951e22dd881

Observation dcb2dde3-3c5f-4edb-b9d4-759bb782a0a6 · outbound

This paper cites Aggregated residual transformations for deep neural networks.

Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective Aggregated residual transformations for deep neural networks

Reference 99

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T15:04:41.039690Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-09T15:04:40.165626Z digest=sha256:cce3630ef471b3bd0f997ded7d1626178c441e84115e780e121273072763c570

Observation c7148fc6-e865-4067-9acf-6d075db9a4b0 · outbound

This paper cites Conditional positional encodings for vision transformers.

Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective Conditional positional encodings for vision transformers

Reference 100

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T15:04:41.031431Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-09T15:04:40.168560Z digest=sha256:6d1cd9c8527d46dfe815d0881689c8e85ce8db21b0f0257c2831fa3812ff62ea

Pith citing papers

No inbound Pith citation observations are available.