{"as_of":"2026-08-10T09:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9ce217f6ee7266b35281711d970e3013829f1f6ab92e4402dee6cf6569847f5d","coverage":[{"denominator":142,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T15:04:40.168560Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2502.01524/citation-record","integrity":"/paper/2502.01524/integrity","json":"/paper/2502.01524/citation-record.json","paper":"/paper/2502.01524"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:04:39.867620Z","title":"A survey of vision-language pre-trained models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.01524","last_updated":"2025-02-03T17:01:59Z","snapshot_observed_at":"2026-08-09T21:17:23.790261Z","submitted_at":"2025-02-03T17:01:59Z","title":"Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-09T15:04:39.867620Z"},"links":{"citing_paper":"/paper/2502.01524"},"observation_digest":"sha256:25ae6bd222255f510f32a14437e194354bc3f6b073afd0c98a54ef2a519a0c58","observation_id":"e6d437cd-146a-4b77-a2d4-69c028ed7f5a","resolution":{"observed_at":"2026-08-09T15:04:39.867620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:04:39.872201Z","title":"A survey on multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01524","last_updated":"2025-02-03T17:01:59Z","snapshot_observed_at":"2026-08-09T21:17:23.790261Z","submitted_at":"2025-02-03T17:01:59Z","title":"Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-09T15:04:39.872201Z"},"links":{"citing_paper":"/paper/2502.01524"},"observation_digest":"sha256:94d2c67569b7d3f8d06158986f235168b1da3c65f692922cfc7625a9fa0feb84","observation_id":"1e443c2d-445c-4abd-8f04-3800e1afa15d","resolution":{"observed_at":"2026-08-09T15:04:39.872201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01390","last_updated":"2023-08-07T17:53:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-02T19:10:23Z","title":"OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01390","snapshot_observed_at":"2026-08-09T15:04:39.875630Z","title":"Openflamingo: An open-source framework for training large autoregressive vision-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01524","last_updated":"2025-02-03T17:01:59Z","snapshot_observed_at":"2026-08-09T21:17:23.790261Z","submitted_at":"2025-02-03T17:01:59Z","title":"Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-09T15:04:39.875630Z"},"links":{"cited_paper":"/paper/2308.01390","citing_paper":"/paper/2502.01524"},"observation_digest":"sha256:ab7c6b86d1f9d74a8720a86b7038354295ba0f6bac49af73ba1a60ee240c73b5","observation_id":"6daf3c52-c715-42ee-8f23-7c07cdbd0bb7","resolution":{"observed_at":"2026-08-09T15:04:39.875630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:04:39.879606Z","title":"BLIP: Bootstrapping language-image pre-training for unified vision-language understanding and generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.01524","last_updated":"2025-02-03T17:01:59Z","snapshot_observed_at":"2026-08-09T21:17:23.790261Z","submitted_at":"2025-02-03T17:01:59Z","title":"Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-09T15:04:39.879606Z"},"links":{"citing_paper":"/paper/2502.01524"},"observation_digest":"sha256:85deb4ebce0f082df88041995f0c9893b6e7e14365855d5955c8d40de13b380e","observation_id":"164ad24e-cf08-4bff-b421-2bb11d9c1dca","resolution":{"observed_at":"2026-08-09T15:04:39.879606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:04:39.883096Z","title":"CoCa: Contrastive captioners are image-text foundation models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.01524","last_updated":"2025-02-03T17:01:59Z","snapshot_observed_at":"2026-08-09T21:17:23.790261Z","submitted_at":"2025-02-03T17:01:59Z","title":"Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-09T15:04:39.883096Z"},"links":{"citing_paper":"/paper/2502.01524"},"observation_digest":"sha256:26cf3c9bdb792dfb55f1d69f282f3c7e2dc2bef17c6397d42d810d691a0221c1","observation_id":"b5c87fe2-625d-4855-a27f-335b72e9376b","resolution":{"observed_at":"2026-08-09T15:04:39.883096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:04:39.886565Z","title":"Multimodal few-shot learning with frozen language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.01524","last_updated":"2025-02-03T17:01:59Z","snapshot_observed_at":"2026-08-09T21:17:23.790261Z","submitted_at":"2025-02-03T17:01:59Z","title":"Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-09T15:04:39.886565Z"},"links":{"citing_paper":"/paper/2502.01524"},"observation_digest":"sha256:c564f68e951603e94a22f43e440ffe40f85b60813cf9e58a7932b339cf2e4594","observation_id":"f426c724-45ed-4418-adba-dd5e62354e62","resolution":{"observed_at":"2026-08-09T15:04:39.886565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:04:39.889977Z","title":"BLIP-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01524","last_updated":"2025-02-03T17:01:59Z","snapshot_observed_at":"2026-08-09T21:17:23.790261Z","submitted_at":"2025-02-03T17:01:59Z","title":"Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-09T15:04:39.889977Z"},"links":{"citing_paper":"/paper/2502.01524"},"observation_digest":"sha256:0ab59f1fa2d6574d418013452f4d9e01b665407d7101e1bb7d907b01733be533","observation_id":"46a9367c-c561-4218-95e6-3298602c00f0","resolution":{"observed_at":"2026-08-09T15:04:39.889977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:04:39.893311Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01524","last_updated":"2025-02-03T17:01:59Z","snapshot_observed_at":"2026-08-09T21:17:23.790261Z","submitted_at":"2025-02-03T17:01:59Z","title":"Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-09T15:04:39.893311Z"},"links":{"citing_paper":"/paper/2502.01524"},"observation_digest":"sha256:be0ad92cefadc63b6ffd2e797fa7feb0abd2d6ea68102a3c5b74d0b2a4cd41d6","observation_id":"6ede9358-135c-49ac-a1b7-166d4138f130","resolution":{"observed_at":"2026-08-09T15:04:39.893311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.15010","last_updated":"2023-04-28T17:59:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-28T17:59:25Z","title":"LLaMA-Adapter V2: Parameter-Efficient Visual Instruction Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.15010","snapshot_observed_at":"2026-08-09T15:04:39.896772Z","title":"LLaMA-Adapter v2: Parameter-efficient visual instruction model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01524","last_updated":"2025-02-03T17:01:59Z","snapshot_observed_at":"2026-08-09T21:17:23.790261Z","submitted_at":"2025-02-03T17:01:59Z","title":"Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-09T15:04:39.896772Z"},"links":{"cited_paper":"/paper/2304.15010","citing_paper":"/paper/2502.01524"},"observation_digest":"sha256:41dd836ae71ff28ed8fd83d2d052ee54a20dec4020155912c05b7db1312571d7","observation_id":"22c3ea26-8cb7-4be9-93ee-c0317562134d","resolution":{"observed_at":"2026-08-09T15:04:39.896772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13267","last_updated":"2023-05-22T17:33:44Z","snapshot_observed_at":"2026-07-06T15:30:49.735343Z","submitted_at":"2023-05-22T17:33:44Z","title":"Enhance Reasoning Ability of Visual-Language Models via Large Language Models","version":1},"cited_work":{"arxiv_id":"2305.13267","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.13267","snapshot_observed_at":"2026-08-09T15:04:40.712129Z","title":"Enhance Reasoning Ability of Visual-Language Models via Large Language Models","venue":"cs.CL","work_id":"6d7dc57d-06ae-4309-9400-bc1276865a64","year":2023},"citing_paper":{"arxiv_id":"2502.01524","last_updated":"2025-02-03T17:01:59Z","snapshot_observed_at":"2026-08-09T21:17:23.790261Z","submitted_at":"2025-02-03T17:01:59Z","title":"Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-09T15:04:39.900226Z"},"links":{"cited_paper":"/paper/2305.13267","citing_paper":"/paper/2502.01524"},"observation_digest":"sha256:f47fab58af044a46fd374aa0a00e0738684d4b70c20537556ea704dc0b7666cc","observation_id":"ef4f0941-7721-4946-9159-2ba47d851006","resolution":{"observed_at":"2026-08-09T15:04:40.716519Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:04:39.903844Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.01524","last_updated":"2025-02-03T17:01:59Z","snapshot_observed_at":"2026-08-09T21:17:23.790261Z","submitted_at":"2025-02-03T17:01:59Z","title":"Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-09T15:04:39.903844Z"},"links":{"citing_paper":"/paper/2502.01524"},"observation_digest":"sha256:032a7acfb716ab7056ce607d2f36dc4916dd24abac09b4a4904dddd6ebe5c028","observation_id":"c987c973-45c6-4dc3-a7b1-1ae724bd7c58","resolution":{"observed_at":"2026-08-09T15:04:39.903844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06281","last_updated":"2024-08-20T03:56:03Z","snapshot_observed_at":"2026-07-06T15:53:19.485466Z","submitted_at":"2023-07-12T16:23:09Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06281","snapshot_observed_at":"2026-08-09T15:04:39.907109Z","title":"MMBench: Is your multi-modal model an all-around player? arXiv preprint arXiv:2307.06281, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01524","last_updated":"2025-02-03T17:01:59Z","snapshot_observed_at":"2026-08-09T21:17:23.790261Z","submitted_at":"2025-02-03T17:01:59Z","title":"Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-09T15:04:39.907109Z"},"links":{"cited_paper":"/paper/2307.06281","citing_paper":"/paper/2502.01524"},"observation_digest":"sha256:0968963e6ae2e2fe24a35dd632a5fe99afb66b183b5c34f98e19cf08c41e5b6c","observation_id":"6dedc236-47b4-4c04-85f6-228e1aee63f0","resolution":{"observed_at":"2026-08-09T15:04:39.907109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-09T15:04:39.910736Z","title":"MME: A comprehensive evaluation benchmark for multimodal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01524","last_updated":"2025-02-03T17:01:59Z","snapshot_observed_at":"2026-08-09T21:17:23.790261Z","submitted_at":"2025-02-03T17:01:59Z","title":"Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-09T15:04:39.910736Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2502.01524"},"observation_digest":"sha256:5703981ec7ac641555ec3ab24ec9ce6135bab1a163405d95ffad390085a10dbd","observation_id":"6dcf1de6-7740-40ac-864b-634065d7126e","resolution":{"observed_at":"2026-08-09T15:04:39.910736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:04:39.914137Z","title":"Efficient multimodal large language models: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01524","last_updated":"2025-02-03T17:01:59Z","snapshot_observed_at":"2026-08-09T21:17:23.790261Z","submitted_at":"2025-02-03T17:01:59Z","title":"Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-09T15:04:39.914137Z"},"links":{"citing_paper":"/paper/2502.01524"},"observation_digest":"sha256:ac89c2004f2e69378e8754aef33c7bd3b538966e9af6ef5d4a5c01bb0289776c","observation_id":"cd67d5d3-1d84-4aa8-acaf-d9ba6fbd9704","resolution":{"observed_at":"2026-08-09T15:04:39.914137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.12148","last_updated":"2023-12-19T13:31:24Z","snapshot_observed_at":"2026-07-06T17:05:19.007669Z","submitted_at":"2023-12-19T13:31:24Z","title":"Parameter-Efficient Fine-Tuning Methods for Pretrained Language Models: A Critical Review and Assessment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.12148","snapshot_observed_at":"2026-08-09T15:04:39.917367Z","title":"Parameter-efficient fine-tuning methods for pretrained language models: A critical review and assessment","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01524","last_updated":"2025-02-03T17:01:59Z","snapshot_observed_at":"2026-08-09T21:17:23.790261Z","submitted_at":"2025-02-03T17:01:59Z","title":"Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-09T15:04:39.917367Z"},"links":{"cited_paper":"/paper/2312.12148","citing_paper":"/paper/2502.01524"},"observation_digest":"sha256:2d15f74fe3374a0ac00ee61d3fbe39abf3bcb8ff82299f342e0b6dfeb53f404e","observation_id":"647b4678-9837-4bb3-947a-1a1e691f536e","resolution":{"observed_at":"2026-08-09T15:04:39.917367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:04:39.920901Z","title":"Flamingo: A visual language model for few-shot learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.01524","last_updated":"2025-02-03T17:01:59Z","snapshot_observed_at":"2026-08-09T21:17:23.790261Z","submitted_at":"2025-02-03T17:01:59Z","title":"Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-09T15:04:39.920901Z"},"links":{"citing_paper":"/paper/2502.01524"},"observation_digest":"sha256:f01e4e1b35f603b530514623ba8e672cbce72e729ff0be243425c4a7b07b10ce","observation_id":"a29d29bf-7d17-4e2f-ac16-41e4e9e7d1b1","resolution":{"observed_at":"2026-08-09T15:04:39.920901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09734","last_updated":"2021-11-18T14:49:15Z","snapshot_observed_at":"2026-07-06T12:09:52.161425Z","submitted_at":"2021-11-18T14:49:15Z","title":"ClipCap: CLIP Prefix for Image Captioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09734","snapshot_observed_at":"2026-08-09T15:04:39.924340Z","title":"Clipcap: Clip prefix for image captioning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.01524","last_updated":"2025-02-03T17:01:59Z","snapshot_observed_at":"2026-08-09T21:17:23.790261Z","submitted_at":"2025-02-03T17:01:59Z","title":"Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-09T15:04:39.924340Z"},"links":{"cited_paper":"/paper/2111.09734","citing_paper":"/paper/2502.01524"},"observation_digest":"sha256:57fe7b978c43688955de595b104804c5b15340336d34bb2a85cd878ecfefb99c","observation_id":"e0b950ca-9483-42a5-b8e3-d2a945e9fbc9","resolution":{"observed_at":"2026-08-09T15:04:39.924340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:04:39.927544Z","title":"MAPL: Parameter-efficient adaptation of unimodal pre-trained models for vision-language few-shot prompting","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01524","last_updated":"2025-02-03T17:01:59Z","snapshot_observed_at":"2026-08-09T21:17:23.790261Z","submitted_at":"2025-02-03T17:01:59Z","title":"Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-09T15:04:39.927544Z"},"links":{"citing_paper":"/paper/2502.01524"},"observation_digest":"sha256:562bbf3a3428708f70c68ddd87e8f0efc00f1c2a3d3ef6c2fcbd508d340fa45b","observation_id":"b564ca1b-22f3-463b-9742-65a1c236502c","resolution":{"observed_at":"2026-08-09T15:04:39.927544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:04:39.930180Z","title":"Meta learning to bridge vision and language models for multimodal few-shot learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01524","last_updated":"2025-02-03T17:01:59Z","snapshot_observed_at":"2026-08-09T21:17:23.790261Z","submitted_at":"2025-02-03T17:01:59Z","title":"Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-09T15:04:39.930180Z"},"links":{"citing_paper":"/paper/2502.01524"},"observation_digest":"sha256:909fb3ca80a2653eb34471084f9af16beb04c97f7c1707402be077bd37ef53b7","observation_id":"298d19fb-73cc-4deb-920e-49a02a55fae5","resolution":{"observed_at":"2026-08-09T15:04:39.930180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:04:39.932638Z","title":"Grounding language models to images for multimodal inputs and outputs","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01524","last_updated":"2025-02-03T17:01:59Z","snapshot_observed_at":"2026-08-09T21:17:23.790261Z","submitted_at":"2025-02-03T17:01:59Z","title":"Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-09T15:04:39.932638Z"},"links":{"citing_paper":"/paper/2502.01524"},"observation_digest":"sha256:0f4213a7115b2fd0fab7282e45343cab5b512d0f28de07ed81304210d3921e75","observation_id":"e2705466-79f1-4220-8889-99aff244a97a","resolution":{"observed_at":"2026-08-09T15:04:39.932638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:04:39.935038Z","title":"MiniGPT-4: Enhancing vision- language understanding with advanced large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01524","last_updated":"2025-02-03T17:01:59Z","snapshot_observed_at":"2026-08-09T21:17:23.790261Z","submitted_at":"2025-02-03T17:01:59Z","title":"Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-09T15:04:39.935038Z"},"links":{"citing_paper":"/paper/2502.01524"},"observation_digest":"sha256:eb928811e022c062db37f46f9748ff48f8d1f0db358e96e2e0706c87a6c7dae4","observation_id":"498abddf-ebeb-4656-8571-af2692ff48ad","resolution":{"observed_at":"2026-08-09T15:04:39.935038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-09T15:04:39.937725Z","title":"CogVLM: Visual expert for pretrained language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01524","last_updated":"2025-02-03T17:01:59Z","snapshot_observed_at":"2026-08-09T21:17:23.790261Z","submitted_at":"2025-02-03T17:01:59Z","title":"Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-09T15:04:39.937725Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2502.01524"},"observation_digest":"sha256:9f804921829898f72880b81aaa0a3bdae0e018660a2c40b93dbc4473120cf2dd","observation_id":"7f630ceb-7b5a-4204-923b-fb43ffb6d6e5","resolution":{"observed_at":"2026-08-09T15:04:39.937725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:04:39.940432Z","title":"Zero-shot video question answering via frozen bidirectional language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.01524","last_updated":"2025-02-03T17:01:59Z","snapshot_observed_at":"2026-08-09T21:17:23.790261Z","submitted_at":"2025-02-03T17:01:59Z","title":"Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-09T15:04:39.940432Z"},"links":{"citing_paper":"/paper/2502.01524"},"observation_digest":"sha256:dce79ec1f7bbeb07682c48285855bdd791c71f81f02c5812bb0625d0246b7dee","observation_id":"0269ea58-282b-475a-998b-a714a920f942","resolution":{"observed_at":"2026-08-09T15:04:39.940432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:04:39.943147Z","title":"Video-LLaMA: An instruction-tuned audio-visual language model for video understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01524","last_updated":"2025-02-03T17:01:59Z","snapshot_observed_at":"2026-08-09T21:17:23.790261Z","submitted_at":"2025-02-03T17:01:59Z","title":"Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-09T15:04:39.943147Z"},"links":{"citing_paper":"/paper/2502.01524"},"observation_digest":"sha256:611b2e5019de58559a503665b78a8c1381f66069aefc0b55afbd47febe6ef08e","observation_id":"60e8302d-1e73-4e18-bb87-d65cc6f04b2e","resolution":{"observed_at":"2026-08-09T15:04:39.943147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:04:39.946263Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01524","last_updated":"2025-02-03T17:01:59Z","snapshot_observed_at":"2026-08-09T21:17:23.790261Z","submitted_at":"2025-02-03T17:01:59Z","title":"Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-09T15:04:39.946263Z"},"links":{"citing_paper":"/paper/2502.01524"},"observation_digest":"sha256:494d6ce4c40f942fb54e7bcaec7d644e086691fa6f3932e44b1e6083d67e4f89","observation_id":"fb9d8667-ce3b-4569-8819-10fae47b825d","resolution":{"observed_at":"2026-08-09T15:04:39.946263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-09T15:04:39.948925Z","title":"Qwen technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01524","last_updated":"2025-02-03T17:01:59Z","snapshot_observed_at":"2026-08-09T21:17:23.790261Z","submitted_at":"2025-02-03T17:01:59Z","title":"Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-09T15:04:39.948925Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2502.01524"},"observation_digest":"sha256:2b69a723c1fc28d579e392b1f508bb36324e8b925c1f6240035775334a1ebd42","observation_id":"939da5a9-fefe-4e2e-8126-3e87f6f7a102","resolution":{"observed_at":"2026-08-09T15:04:39.948925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:04:39.952130Z","title":"mPLUG-Owl2: Revolutionizing multi-modal large language model with modality collaboration","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01524","last_updated":"2025-02-03T17:01:59Z","snapshot_observed_at":"2026-08-09T21:17:23.790261Z","submitted_at":"2025-02-03T17:01:59Z","title":"Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-09T15:04:39.952130Z"},"links":{"citing_paper":"/paper/2502.01524"},"observation_digest":"sha256:0e4f8390c210bfdab6007d1acac40717ac7398a600d27ab2d659d50961360635","observation_id":"9b7213fb-94c0-42ab-b8d1-8f55e76ea7f0","resolution":{"observed_at":"2026-08-09T15:04:39.952130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14178","last_updated":"2024-03-29T08:13:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-27T13:27:01Z","title":"mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14178","snapshot_observed_at":"2026-08-09T15:04:39.955349Z","title":"mPLUG-Owl: Modularization empowers large language models with multimodality","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01524","last_updated":"2025-02-03T17:01:59Z","snapshot_observed_at":"2026-08-09T21:17:23.790261Z","submitted_at":"2025-02-03T17:01:59Z","title":"Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-09T15:04:39.955349Z"},"links":{"cited_paper":"/paper/2304.14178","citing_paper":"/paper/2502.01524"},"observation_digest":"sha256:651fe700edc490b2d5923c7476f52b3ac6f14a67929feff33e6fd2764d86cea5","observation_id":"4b0aa42d-dad9-46f8-a9de-823a1f6ef859","resolution":{"observed_at":"2026-08-09T15:04:39.955349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:04:39.958683Z","title":"LoRA: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.01524","last_updated":"2025-02-03T17:01:59Z","snapshot_observed_at":"2026-08-09T21:17:23.790261Z","submitted_at":"2025-02-03T17:01:59Z","title":"Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-09T15:04:39.958683Z"},"links":{"citing_paper":"/paper/2502.01524"},"observation_digest":"sha256:c4ed4ee12387fcd7af9a7721734db9d277072c64183704bfa0c396ffa8a7468b","observation_id":"eb78acd7-16a6-4749-8518-77d4829a4d38","resolution":{"observed_at":"2026-08-09T15:04:39.958683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.16886","snapshot_observed_at":"2026-08-09T15:04:39.961643Z","title":"MobileVLM: A fast, strong and open vision language assistant for mobile devices","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01524","last_updated":"2025-02-03T17:01:59Z","snapshot_observed_at":"2026-08-09T21:17:23.790261Z","submitted_at":"2025-02-03T17:01:59Z","title":"Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-09T15:04:39.961643Z"},"links":{"cited_paper":"/paper/2312.16886","citing_paper":"/paper/2502.01524"},"observation_digest":"sha256:d652f4c6288af6f48c3f02bf086daf37b71a5b07429d112e320aecd4ba5fe30e","observation_id":"872f33cc-f8e6-4364-b6fe-8a3940391320","resolution":{"observed_at":"2026-08-09T15:04:39.961643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-08-09T19:28:34.281681Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03766","snapshot_observed_at":"2026-08-09T15:04:39.965044Z","title":"MobileVLM v2: Faster and stronger baseline for vision language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01524","last_updated":"2025-02-03T17:01:59Z","snapshot_observed_at":"2026-08-09T21:17:23.790261Z","submitted_at":"2025-02-03T17:01:59Z","title":"Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-09T15:04:39.965044Z"},"links":{"cited_paper":"/paper/2402.03766","citing_paper":"/paper/2502.01524"},"observation_digest":"sha256:22e8dc42801d65a88dbb013cd3ec2bc9fc2a4d8fc901a052509704664b948f3e","observation_id":"205ed56e-b783-45c7-be21-eeb7ba56ca4e","resolution":{"observed_at":"2026-08-09T15:04:39.965044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13600","last_updated":"2024-03-20T13:48:50Z","snapshot_observed_at":"2026-07-06T17:47:42.867147Z","submitted_at":"2024-03-20T13:48:50Z","title":"VL-Mamba: Exploring State Space Models for Multimodal Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13600","snapshot_observed_at":"2026-08-09T15:04:39.968203Z","title":"VL-Mamba: Exploring state space models for multimodal learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01524","last_updated":"2025-02-03T17:01:59Z","snapshot_observed_at":"2026-08-09T21:17:23.790261Z","submitted_at":"2025-02-03T17:01:59Z","title":"Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-09T15:04:39.968203Z"},"links":{"cited_paper":"/paper/2403.13600","citing_paper":"/paper/2502.01524"},"observation_digest":"sha256:9e5bd069ccd6e2394448ed1de8cd3530d910f93a3e38a0b90c96bef827fff91f","observation_id":"320076f9-1530-4cd8-8348-30a4b87f2868","resolution":{"observed_at":"2026-08-09T15:04:39.968203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:04:39.971642Z","title":"VL-Adapter: Parameter-efficient transfer learning for vision-and- language tasks","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.01524","last_updated":"2025-02-03T17:01:59Z","snapshot_observed_at":"2026-08-09T21:17:23.790261Z","submitted_at":"2025-02-03T17:01:59Z","title":"Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-09T15:04:39.971642Z"},"links":{"citing_paper":"/paper/2502.01524"},"observation_digest":"sha256:1500e17dab5cf8738c427cc4c88aec7e2c478e72121a1fcd4d5282aedf836167","observation_id":"5996fdf1-abec-4886-a158-75ea0c9a31fd","resolution":{"observed_at":"2026-08-09T15:04:39.971642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:04:39.974572Z","title":"eP-ALM: Efficient perceptual augmentation of language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01524","last_updated":"2025-02-03T17:01:59Z","snapshot_observed_at":"2026-08-09T21:17:23.790261Z","submitted_at":"2025-02-03T17:01:59Z","title":"Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-09T15:04:39.974572Z"},"links":{"citing_paper":"/paper/2502.01524"},"observation_digest":"sha256:9a5e8e60b7259ae51da77a95deade5fef58d065e1ba68f38039a64a8e63fe8b7","observation_id":"365c8f04-35c6-4d65-96fd-b0fec66bcd56","resolution":{"observed_at":"2026-08-09T15:04:39.974572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:04:39.977405Z","title":"Modular and parameter-efficient multimodal fusion with prompting","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.01524","last_updated":"2025-02-03T17:01:59Z","snapshot_observed_at":"2026-08-09T21:17:23.790261Z","submitted_at":"2025-02-03T17:01:59Z","title":"Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-09T15:04:39.977405Z"},"links":{"citing_paper":"/paper/2502.01524"},"observation_digest":"sha256:8c7a75f350308aff7a69abde599d59ea8460a1fadb5ef7735e294376d572ab4d","observation_id":"b2703f53-58c3-4817-884a-bc2848fea02d","resolution":{"observed_at":"2026-08-09T15:04:39.977405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:04:39.980372Z","title":"Memory-space visual prompting for efficient vision-language fine-tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01524","last_updated":"2025-02-03T17:01:59Z","snapshot_observed_at":"2026-08-09T21:17:23.790261Z","submitted_at":"2025-02-03T17:01:59Z","title":"Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-09T15:04:39.980372Z"},"links":{"citing_paper":"/paper/2502.01524"},"observation_digest":"sha256:3cf567f38840c64bcc2de631b6e7342f73ea5ecec52775d91ae12ee4da94e9c0","observation_id":"5b3af116-f719-4f8f-b741-c6ed778b100e","resolution":{"observed_at":"2026-08-09T15:04:39.980372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:04:39.983200Z","title":"LLaMA- Adapter: Efficient fine-tuning of large language models with zero-initialized attention","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01524","last_updated":"2025-02-03T17:01:59Z","snapshot_observed_at":"2026-08-09T21:17:23.790261Z","submitted_at":"2025-02-03T17:01:59Z","title":"Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-09T15:04:39.983200Z"},"links":{"citing_paper":"/paper/2502.01524"},"observation_digest":"sha256:80b31fb94ace16e1331ce157127c65f3d4d811e61ddf78b9ed1e6b62bd14411c","observation_id":"ce314d64-5d73-4e5c-ae4d-192615ba2de4","resolution":{"observed_at":"2026-08-09T15:04:39.983200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:04:39.986215Z","title":"LST: Ladder side-tuning for parameter and memory efficient transfer learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.01524","last_updated":"2025-02-03T17:01:59Z","snapshot_observed_at":"2026-08-09T21:17:23.790261Z","submitted_at":"2025-02-03T17:01:59Z","title":"Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-09T15:04:39.986215Z"},"links":{"citing_paper":"/paper/2502.01524"},"observation_digest":"sha256:9d643749746fc255526f757dfce38381cf423ddd0412f0d05893c167205bd893","observation_id":"d589512b-9208-4fc7-9e5d-dd8029137ec2","resolution":{"observed_at":"2026-08-09T15:04:39.986215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:04:39.989148Z","title":"Querying as Prompt: Parameter-efficient learning for multimodal language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01524","last_updated":"2025-02-03T17:01:59Z","snapshot_observed_at":"2026-08-09T21:17:23.790261Z","submitted_at":"2025-02-03T17:01:59Z","title":"Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-09T15:04:39.989148Z"},"links":{"citing_paper":"/paper/2502.01524"},"observation_digest":"sha256:91685e5544ad214db05d6cf23e3ba57c67696670da699abca909bf228eae19ff","observation_id":"cd8b9769-22f6-4504-bf24-bb786ac0c34b","resolution":{"observed_at":"2026-08-09T15:04:39.989148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:04:39.992123Z","title":"VL-PET: Vision-and-language parameter-efficient tuning via granularity control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01524","last_updated":"2025-02-03T17:01:59Z","snapshot_observed_at":"2026-08-09T21:17:23.790261Z","submitted_at":"2025-02-03T17:01:59Z","title":"Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-09T15:04:39.992123Z"},"links":{"citing_paper":"/paper/2502.01524"},"observation_digest":"sha256:b4943f51bde061f8befc5d645bac795bf8b3cf9d40280516174e3f8c7824f695","observation_id":"174c3a02-9cea-4510-a5ba-43ec66a4061a","resolution":{"observed_at":"2026-08-09T15:04:39.992123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:04:39.995219Z","title":"Cheap and Quick: Efficient vision-language instruction tuning for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01524","last_updated":"2025-02-03T17:01:59Z","snapshot_observed_at":"2026-08-09T21:17:23.790261Z","submitted_at":"2025-02-03T17:01:59Z","title":"Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-09T15:04:39.995219Z"},"links":{"citing_paper":"/paper/2502.01524"},"observation_digest":"sha256:a3edc1dfb6ae03cccec1ab59f4226fc25e427df40c40de9172b971bef93f8033","observation_id":"3531df63-6c86-4d50-9622-6f928072a227","resolution":{"observed_at":"2026-08-09T15:04:39.995219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:04:39.998099Z","title":"https://scholar.google.com/, accessed 3 February 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.01524","last_updated":"2025-02-03T17:01:59Z","snapshot_observed_at":"2026-08-09T21:17:23.790261Z","submitted_at":"2025-02-03T17:01:59Z","title":"Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-09T15:04:39.998099Z"},"links":{"citing_paper":"/paper/2502.01524"},"observation_digest":"sha256:b4657ee2be7110c207ae6749048b16c7989a5c66f92a69cedd643872971767cd","observation_id":"8a02be6a-ca0a-410d-805b-27517172b903","resolution":{"observed_at":"2026-08-09T15:04:39.998099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:04:40.001097Z","title":"https://ccf.atom.im/, accessed 3 February 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.01524","last_updated":"2025-02-03T17:01:59Z","snapshot_observed_at":"2026-08-09T21:17:23.790261Z","submitted_at":"2025-02-03T17:01:59Z","title":"Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-09T15:04:40.001097Z"},"links":{"citing_paper":"/paper/2502.01524"},"observation_digest":"sha256:a87ec41ce2ae39817c38be6ec23917d79d352a6a8e812de5b9fc22b894479fef","observation_id":"d57eb153-3b91-44a0-9dff-b049c42df845","resolution":{"observed_at":"2026-08-09T15:04:40.001097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:04:40.004049Z","title":"MAGMA – Multimodal augmentation of generative models through adapter-based finetuning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.01524","last_updated":"2025-02-03T17:01:59Z","snapshot_observed_at":"2026-08-09T21:17:23.790261Z","submitted_at":"2025-02-03T17:01:59Z","title":"Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-09T15:04:40.004049Z"},"links":{"citing_paper":"/paper/2502.01524"},"observation_digest":"sha256:8263a972320392e53ad9125e2e07d3ae2be1d2a30f6bf8bd11f84cab076dba8c","observation_id":"3238c389-7e2a-4016-92f6-276a361469c5","resolution":{"observed_at":"2026-08-09T15:04:40.004049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:04:40.006975Z","title":"Fusing pre-trained language models with multimodal prompts through reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01524","last_updated":"2025-02-03T17:01:59Z","snapshot_observed_at":"2026-08-09T21:17:23.790261Z","submitted_at":"2025-02-03T17:01:59Z","title":"Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-09T15:04:40.006975Z"},"links":{"citing_paper":"/paper/2502.01524"},"observation_digest":"sha256:9b53546c056fe56aecd676c97839029042cd029d5ce7270a7cd567ad9e5fa547","observation_id":"89db0d2b-9a55-4f5f-bbcb-e66c5c8cda71","resolution":{"observed_at":"2026-08-09T15:04:40.006975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:04:40.009864Z","title":"Aligning large multimodal models with factually augmented RLHF","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01524","last_updated":"2025-02-03T17:01:59Z","snapshot_observed_at":"2026-08-09T21:17:23.790261Z","submitted_at":"2025-02-03T17:01:59Z","title":"Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-09T15:04:40.009864Z"},"links":{"citing_paper":"/paper/2502.01524"},"observation_digest":"sha256:dca27c5c45aa5aa2a5bbf010c724a3c7a596cdde20443f6151e5dbdd41a520b3","observation_id":"98198cd3-20b6-4985-87af-7510cc8920bd","resolution":{"observed_at":"2026-08-09T15:04:40.009864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:04:40.012962Z","title":"Honeybee: Locality-enhanced projector for multimodal LLM","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01524","last_updated":"2025-02-03T17:01:59Z","snapshot_observed_at":"2026-08-09T21:17:23.790261Z","submitted_at":"2025-02-03T17:01:59Z","title":"Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-09T15:04:40.012962Z"},"links":{"citing_paper":"/paper/2502.01524"},"observation_digest":"sha256:e8044d0f1d005800f79faf2479f1bec769a7b62747daa28d081f970116e771a9","observation_id":"13933274-9c49-48b4-a150-00ad65d5e30c","resolution":{"observed_at":"2026-08-09T15:04:40.012962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:04:40.016197Z","title":"Tuning large multimodal models for videos using reinforcement learning from AI feedback","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01524","last_updated":"2025-02-03T17:01:59Z","snapshot_observed_at":"2026-08-09T21:17:23.790261Z","submitted_at":"2025-02-03T17:01:59Z","title":"Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-09T15:04:40.016197Z"},"links":{"citing_paper":"/paper/2502.01524"},"observation_digest":"sha256:8837d363cc85bef38fc0b501e8584a790f0f60cf60708ad7c69702a68cc7dac0","observation_id":"309f6c3a-8f81-4b20-ad4b-905e202c53b6","resolution":{"observed_at":"2026-08-09T15:04:40.016197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.04160","last_updated":"2023-05-22T02:37:02Z","snapshot_observed_at":"2026-08-03T10:34:58.776935Z","submitted_at":"2023-05-07T02:25:42Z","title":"X-LLM: Bootstrapping Advanced Large Language Models by Treating Multi-Modalities as Foreign Languages","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.04160","snapshot_observed_at":"2026-08-09T15:04:40.019790Z","title":"X-LLM: Bootstrapping advanced large language models by treating multi-modalities as foreign languages","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01524","last_updated":"2025-02-03T17:01:59Z","snapshot_observed_at":"2026-08-09T21:17:23.790261Z","submitted_at":"2025-02-03T17:01:59Z","title":"Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-09T15:04:40.019790Z"},"links":{"cited_paper":"/paper/2305.04160","citing_paper":"/paper/2502.01524"},"observation_digest":"sha256:82173df430d7842f002d3ed8b47a87fdeab97acc6337f964956c219b1fac6d08","observation_id":"ebffaf42-cce5-4b44-a99f-94a273ea8917","resolution":{"observed_at":"2026-08-09T15:04:40.019790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:04:40.023001Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.01524","last_updated":"2025-02-03T17:01:59Z","snapshot_observed_at":"2026-08-09T21:17:23.790261Z","submitted_at":"2025-02-03T17:01:59Z","title":"Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-09T15:04:40.023001Z"},"links":{"citing_paper":"/paper/2502.01524"},"observation_digest":"sha256:cb45ce39d4806b0b857a1c27fb38e260719d1fbd97a506fbe1ec5f2daa7423fe","observation_id":"c6e04b1b-5c38-4d0a-b2ac-7feecbfcff68","resolution":{"observed_at":"2026-08-09T15:04:40.023001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-07-31T22:31:37.910868Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-08-09T15:04:40.025902Z","title":"RoBERTa: A robustly optimized bert pretraining approach","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2502.01524","last_updated":"2025-02-03T17:01:59Z","snapshot_observed_at":"2026-08-09T21:17:23.790261Z","submitted_at":"2025-02-03T17:01:59Z","title":"Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-09T15:04:40.025902Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2502.01524"},"observation_digest":"sha256:40b0053555d7db2671ee6a22903f73081ddb9ec7a1d7a7cfb63bd2ee5d9c9830","observation_id":"7e9f69bd-b610-4224-abd1-26373140a28f","resolution":{"observed_at":"2026-08-09T15:04:40.025902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:04:40.029101Z","title":"DeBERTa: Decoding-enhanced BERT with disentangled attention","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.01524","last_updated":"2025-02-03T17:01:59Z","snapshot_observed_at":"2026-08-09T21:17:23.790261Z","submitted_at":"2025-02-03T17:01:59Z","title":"Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-09T15:04:40.029101Z"},"links":{"citing_paper":"/paper/2502.01524"},"observation_digest":"sha256:de07918d42c06112bbdd5059c6bef87590f9f1ef8f36e9805f0d047d3922e5e0","observation_id":"8daa8679-7691-43cf-8aa1-b3ce9a17c000","resolution":{"observed_at":"2026-08-09T15:04:40.029101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:04:40.031596Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.01524","last_updated":"2025-02-03T17:01:59Z","snapshot_observed_at":"2026-08-09T21:17:23.790261Z","submitted_at":"2025-02-03T17:01:59Z","title":"Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-09T15:04:40.031596Z"},"links":{"citing_paper":"/paper/2502.01524"},"observation_digest":"sha256:72c3e13248550ad525080fad2728983e89f3d4a10c2c282fdefb8a6fbc3f7764","observation_id":"9c3a6450-afbb-476d-b6be-8b73bff3c758","resolution":{"observed_at":"2026-08-09T15:04:40.031596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:04:40.034055Z","title":"BART: Denoising sequence-to-sequence pre-training for natural language generation, translation, and comprehension","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.01524","last_updated":"2025-02-03T17:01:59Z","snapshot_observed_at":"2026-08-09T21:17:23.790261Z","submitted_at":"2025-02-03T17:01:59Z","title":"Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-09T15:04:40.034055Z"},"links":{"citing_paper":"/paper/2502.01524"},"observation_digest":"sha256:80b50c2e09c9761ad4d39379f0f9371b8a559f681396f44fc11c8d1b055b1961","observation_id":"3409ea1b-91f4-4a2a-939c-bf0e6b79dd54","resolution":{"observed_at":"2026-08-09T15:04:40.034055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-09T15:04:40.036831Z","title":"LLaMA: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01524","last_updated":"2025-02-03T17:01:59Z","snapshot_observed_at":"2026-08-09T21:17:23.790261Z","submitted_at":"2025-02-03T17:01:59Z","title":"Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-09T15:04:40.036831Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2502.01524"},"observation_digest":"sha256:4cc99fa76999491a874968462f8961fcb4dfdf610be96fd3297f665c511b16e2","observation_id":"5dec0e91-c574-4940-aa2e-156a8acf3e2f","resolution":{"observed_at":"2026-08-09T15:04:40.036831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:04:40.039400Z","title":"VICUNA: An open-source chatbot impressing gpt-4 with 90% chatgpt quality","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01524","last_updated":"2025-02-03T17:01:59Z","snapshot_observed_at":"2026-08-09T21:17:23.790261Z","submitted_at":"2025-02-03T17:01:59Z","title":"Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-09T15:04:40.039400Z"},"links":{"citing_paper":"/paper/2502.01524"},"observation_digest":"sha256:f83a37d886e6f5bc82a22363311e3e7db0a2c10f812f3fa0ed1ca6657a98710c","observation_id":"1e1968f0-f36c-48d8-b779-7a1d39c5b6a9","resolution":{"observed_at":"2026-08-09T15:04:40.039400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-08-06T03:13:37.403059Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-08-09T15:04:40.042291Z","title":"OPT: Open pre-trained transformer language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.01524","last_updated":"2025-02-03T17:01:59Z","snapshot_observed_at":"2026-08-09T21:17:23.790261Z","submitted_at":"2025-02-03T17:01:59Z","title":"Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-09T15:04:40.042291Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2502.01524"},"observation_digest":"sha256:d1d3a91578f39ae5761166e80515d95801b4f8f97f81cac213660726ece29e8e","observation_id":"f2ec3af0-cfb1-4232-84d4-06ff68551f05","resolution":{"observed_at":"2026-08-09T15:04:40.042291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:04:40.044988Z","title":"GPT-3: Its nature, scope, limits, and consequences","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.01524","last_updated":"2025-02-03T17:01:59Z","snapshot_observed_at":"2026-08-09T21:17:23.790261Z","submitted_at":"2025-02-03T17:01:59Z","title":"Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-09T15:04:40.044988Z"},"links":{"citing_paper":"/paper/2502.01524"},"observation_digest":"sha256:9de80ff11c956d99d0aacfb4c9e051bf3442c832dbca3f226a7ac5711aaf7aa4","observation_id":"a7f6d2ac-d41b-4473-8924-c4bbb317bf08","resolution":{"observed_at":"2026-08-09T15:04:40.044988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-09T15:04:40.047541Z","title":"GPT-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01524","last_updated":"2025-02-03T17:01:59Z","snapshot_observed_at":"2026-08-09T21:17:23.790261Z","submitted_at":"2025-02-03T17:01:59Z","title":"Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-09T15:04:40.047541Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2502.01524"},"observation_digest":"sha256:fb00edf87c7dda3b904d44f8063c5c37feb3e65558827043311c34015642c325","observation_id":"36bb6093-3351-473d-84be-da66d9b7fe31","resolution":{"observed_at":"2026-08-09T15:04:40.047541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12793","last_updated":"2024-07-30T03:58:11Z","snapshot_observed_at":"2026-08-07T13:56:34.167869Z","submitted_at":"2024-06-18T16:58:21Z","title":"ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Tools","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12793","snapshot_observed_at":"2026-08-09T15:04:40.050595Z","title":"ChatGLM: A family of large language models from GLM-130B to GLM-4 all tools","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01524","last_updated":"2025-02-03T17:01:59Z","snapshot_observed_at":"2026-08-09T21:17:23.790261Z","submitted_at":"2025-02-03T17:01:59Z","title":"Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-09T15:04:40.050595Z"},"links":{"cited_paper":"/paper/2406.12793","citing_paper":"/paper/2502.01524"},"observation_digest":"sha256:a03fa11a71dcbabb24a46c569699536121b9b4f8a46e64a30c8b7a0de590ce94","observation_id":"78122603-8fd6-4c47-91e7-f392efa82edd","resolution":{"observed_at":"2026-08-09T15:04:40.050595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00752","last_updated":"2024-05-31T17:55:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-01T18:01:34Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00752","snapshot_observed_at":"2026-08-09T15:04:40.053774Z","title":"Mamba: Linear-time sequence modeling with selective state spaces","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01524","last_updated":"2025-02-03T17:01:59Z","snapshot_observed_at":"2026-08-09T21:17:23.790261Z","submitted_at":"2025-02-03T17:01:59Z","title":"Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-09T15:04:40.053774Z"},"links":{"cited_paper":"/paper/2312.00752","citing_paper":"/paper/2502.01524"},"observation_digest":"sha256:14320447b518d32245180855d58eb2c31ee2f45875b269054d5781f3e9b5a591","observation_id":"48c4d7dc-be62-45ef-827e-c53a22c52833","resolution":{"observed_at":"2026-08-09T15:04:40.053774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:04:40.057046Z","title":"Scaling instruction-finetuned language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01524","last_updated":"2025-02-03T17:01:59Z","snapshot_observed_at":"2026-08-09T21:17:23.790261Z","submitted_at":"2025-02-03T17:01:59Z","title":"Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-09T15:04:40.057046Z"},"links":{"citing_paper":"/paper/2502.01524"},"observation_digest":"sha256:6a01dc76b608cdfeda20b38e1b95c508eb1510679478306f7af62a14c334db9e","observation_id":"22dd2925-29ef-4c1e-9b24-b3a4edf80ffa","resolution":{"observed_at":"2026-08-09T15:04:40.057046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:04:40.059978Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2502.01524","last_updated":"2025-02-03T17:01:59Z","snapshot_observed_at":"2026-08-09T21:17:23.790261Z","submitted_at":"2025-02-03T17:01:59Z","title":"Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-09T15:04:40.059978Z"},"links":{"citing_paper":"/paper/2502.01524"},"observation_digest":"sha256:92cf3b27ab7de1ce7a728db79018f32131ba7905864257cac8937a0451c5da69","observation_id":"294a6f7b-3705-4a1e-b48b-650688d5e136","resolution":{"observed_at":"2026-08-09T15:04:40.059978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:04:40.062934Z","title":"GPT-J-6B: A 6 Billion Parameter Autoregressive Language Model [software]","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.01524","last_updated":"2025-02-03T17:01:59Z","snapshot_observed_at":"2026-08-09T21:17:23.790261Z","submitted_at":"2025-02-03T17:01:59Z","title":"Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-09T15:04:40.062934Z"},"links":{"citing_paper":"/paper/2502.01524"},"observation_digest":"sha256:f04db04f3ff1310bc06a0e8f88945f475fbb3afba583d934f99bf1f60626b3da","observation_id":"033162df-9bbd-4cce-8b43-068b24bc71b9","resolution":{"observed_at":"2026-08-09T15:04:40.062934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:04:40.066175Z","title":"An empirical analysis of compute-optimal large language model training","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.01524","last_updated":"2025-02-03T17:01:59Z","snapshot_observed_at":"2026-08-09T21:17:23.790261Z","submitted_at":"2025-02-03T17:01:59Z","title":"Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-09T15:04:40.066175Z"},"links":{"citing_paper":"/paper/2502.01524"},"observation_digest":"sha256:304c90cda51c12777f225da36299213b22d0774f8440d1c671d3963df98244c9","observation_id":"eb6aef89-43f0-47fd-8ff1-2ac67ddfd510","resolution":{"observed_at":"2026-08-09T15:04:40.066175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:04:40.069197Z","title":"Introducing MPT-7B: A New Standard for Open-Source, Commercially Usable LLMs [software]","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01524","last_updated":"2025-02-03T17:01:59Z","snapshot_observed_at":"2026-08-09T21:17:23.790261Z","submitted_at":"2025-02-03T17:01:59Z","title":"Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-09T15:04:40.069197Z"},"links":{"citing_paper":"/paper/2502.01524"},"observation_digest":"sha256:bf2bb582a5d5fd1ed2bc0def501829b4bad29d51242b75417294441a93a83e69","observation_id":"a961051f-5c53-4d48-9d8f-d55d5f0e04e9","resolution":{"observed_at":"2026-08-09T15:04:40.069197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:04:40.072233Z","title":"Releasing 3B and 7B RedPajama-INCITE family of models including base, instruction-tuned & chat models [software]","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01524","last_updated":"2025-02-03T17:01:59Z","snapshot_observed_at":"2026-08-09T21:17:23.790261Z","submitted_at":"2025-02-03T17:01:59Z","title":"Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-09T15:04:40.072233Z"},"links":{"citing_paper":"/paper/2502.01524"},"observation_digest":"sha256:792e464bc005f2dd2e6bc7869d18f785dc8aa8b0d9e91f5959b7baa393284b5c","observation_id":"3f2584fb-627e-4d84-a5d0-3f4f72252b71","resolution":{"observed_at":"2026-08-09T15:04:40.072233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-09T15:04:40.074970Z","title":"LLaMA 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01524","last_updated":"2025-02-03T17:01:59Z","snapshot_observed_at":"2026-08-09T21:17:23.790261Z","submitted_at":"2025-02-03T17:01:59Z","title":"Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-09T15:04:40.074970Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2502.01524"},"observation_digest":"sha256:7e1ed1ab30ca37fa719e23208f2088188c8083a3dbc2e6b0a07ee67c90399bd3","observation_id":"f252bce0-b004-404c-9a07-ae4224e21174","resolution":{"observed_at":"2026-08-09T15:04:40.074970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.05202","last_updated":"2020-02-12T19:57:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-02-12T19:57:13Z","title":"GLU Variants Improve Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.05202","snapshot_observed_at":"2026-08-09T15:04:40.078158Z","title":"Glu variants improve transformer","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2502.01524","last_updated":"2025-02-03T17:01:59Z","snapshot_observed_at":"2026-08-09T21:17:23.790261Z","submitted_at":"2025-02-03T17:01:59Z","title":"Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-09T15:04:40.078158Z"},"links":{"cited_paper":"/paper/2002.05202","citing_paper":"/paper/2502.01524"},"observation_digest":"sha256:d61fafb36a310f758291c4ababe76e8e7056cbca8537d2b07e78d2e9afff23e1","observation_id":"b3c53c0a-839b-4ab3-833d-851c92904839","resolution":{"observed_at":"2026-08-09T15:04:40.078158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:04:40.081565Z","title":"Prefix-Tuning: Optimizing continuous prompts for generation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.01524","last_updated":"2025-02-03T17:01:59Z","snapshot_observed_at":"2026-08-09T21:17:23.790261Z","submitted_at":"2025-02-03T17:01:59Z","title":"Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-09T15:04:40.081565Z"},"links":{"citing_paper":"/paper/2502.01524"},"observation_digest":"sha256:9ab4a0279d29d0b0cde25a4e7e6dc94f606a752f50a611d8dbde24a948fff2de","observation_id":"fb8b7ef8-928d-4190-8167-b2b3c3b0c29c","resolution":{"observed_at":"2026-08-09T15:04:40.081565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:04:40.084499Z","title":"The power of scale for parameter-efficient prompt tuning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.01524","last_updated":"2025-02-03T17:01:59Z","snapshot_observed_at":"2026-08-09T21:17:23.790261Z","submitted_at":"2025-02-03T17:01:59Z","title":"Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-09T15:04:40.084499Z"},"links":{"citing_paper":"/paper/2502.01524"},"observation_digest":"sha256:bbe358cc8b6abe82e7c256f844fbf4483d6b14aecd234ae87b610bcef0fabef2","observation_id":"87cccc94-30f8-40fd-9fff-9c2c956b221f","resolution":{"observed_at":"2026-08-09T15:04:40.084499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:04:40.087547Z","title":"Parameter-efficient transfer learning for NLP","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.01524","last_updated":"2025-02-03T17:01:59Z","snapshot_observed_at":"2026-08-09T21:17:23.790261Z","submitted_at":"2025-02-03T17:01:59Z","title":"Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-09T15:04:40.087547Z"},"links":{"citing_paper":"/paper/2502.01524"},"observation_digest":"sha256:21699f149a655c53a163260478bf4340430caa6113869c8d6edd20a0eae4950c","observation_id":"ecf87842-a444-41d5-8f8c-aa1d74bf042d","resolution":{"observed_at":"2026-08-09T15:04:40.087547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:04:40.090638Z","title":"QLoRA: Efficient finetuning of quantized llms","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01524","last_updated":"2025-02-03T17:01:59Z","snapshot_observed_at":"2026-08-09T21:17:23.790261Z","submitted_at":"2025-02-03T17:01:59Z","title":"Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-09T15:04:40.090638Z"},"links":{"citing_paper":"/paper/2502.01524"},"observation_digest":"sha256:a7f773e510f30e1e2bdd1e10418caf1461f25506fd81cfe53001ee381662f676","observation_id":"eb915d4a-a094-4644-acfc-726a530bac7a","resolution":{"observed_at":"2026-08-09T15:04:40.090638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09353","last_updated":"2024-07-09T05:59:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-14T17:59:34Z","title":"DoRA: Weight-Decomposed Low-Rank Adaptation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09353","snapshot_observed_at":"2026-08-09T15:04:40.093575Z","title":"DoRA: Weight-decomposed low-rank adaptation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01524","last_updated":"2025-02-03T17:01:59Z","snapshot_observed_at":"2026-08-09T21:17:23.790261Z","submitted_at":"2025-02-03T17:01:59Z","title":"Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-09T15:04:40.093575Z"},"links":{"cited_paper":"/paper/2402.09353","citing_paper":"/paper/2502.01524"},"observation_digest":"sha256:287d6608929b8745fcb8e1a335147636c58f7ca0913174e32b7e45f046e8ac4d","observation_id":"cdf36ff4-ae60-4626-bac8-637268b8744d","resolution":{"observed_at":"2026-08-09T15:04:40.093575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:04:40.096753Z","title":"Visual prompt tuning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.01524","last_updated":"2025-02-03T17:01:59Z","snapshot_observed_at":"2026-08-09T21:17:23.790261Z","submitted_at":"2025-02-03T17:01:59Z","title":"Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-09T15:04:40.096753Z"},"links":{"citing_paper":"/paper/2502.01524"},"observation_digest":"sha256:dcfd39a2a92a3756d73b101bdf238e9b9a5be63c882e89410781f3e113e8a6b1","observation_id":"2f36c6d8-c326-4c23-ac71-f4480cf7a73e","resolution":{"observed_at":"2026-08-09T15:04:40.096753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:04:40.099802Z","title":"Exploring versatile generative language model via parameter- efficient transfer learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.01524","last_updated":"2025-02-03T17:01:59Z","snapshot_observed_at":"2026-08-09T21:17:23.790261Z","submitted_at":"2025-02-03T17:01:59Z","title":"Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-09T15:04:40.099802Z"},"links":{"citing_paper":"/paper/2502.01524"},"observation_digest":"sha256:42b0486cc9dbdc67a69c590d26c1e75f5dc1d004eacc5b2f83d5761631f32b04","observation_id":"4455784a-1e4c-46c3-971c-1ae0d508118e","resolution":{"observed_at":"2026-08-09T15:04:40.099802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:04:40.102650Z","title":"Towards a unified view of parameter-efficient transfer learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.01524","last_updated":"2025-02-03T17:01:59Z","snapshot_observed_at":"2026-08-09T21:17:23.790261Z","submitted_at":"2025-02-03T17:01:59Z","title":"Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-09T15:04:40.102650Z"},"links":{"citing_paper":"/paper/2502.01524"},"observation_digest":"sha256:ac2af526c10b365b0a0147bfceabb3cc3fe0d235640edc0d8cace7d28dd3f660","observation_id":"22772174-463a-40ff-bfcf-78d869e83a38","resolution":{"observed_at":"2026-08-09T15:04:40.102650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:04:40.105545Z","title":"AdapterSoup: Weight averaging to improve generalization of pretrained language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01524","last_updated":"2025-02-03T17:01:59Z","snapshot_observed_at":"2026-08-09T21:17:23.790261Z","submitted_at":"2025-02-03T17:01:59Z","title":"Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-09T15:04:40.105545Z"},"links":{"citing_paper":"/paper/2502.01524"},"observation_digest":"sha256:03edc66430619a3bb1fe4aeb3bc04be2bfa9f7de8768663bf1cde2cc9ca7b75f","observation_id":"3caed64f-01e2-421f-84d0-f561d203eecd","resolution":{"observed_at":"2026-08-09T15:04:40.105545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1901.11504","last_updated":"2019-05-30T00:01:20Z","snapshot_observed_at":"2026-07-06T07:30:20.997518Z","submitted_at":"2019-01-31T18:07:25Z","title":"Multi-Task Deep Neural Networks for Natural Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.11504","snapshot_observed_at":"2026-08-09T15:04:40.108448Z","title":"Multi-task deep neural networks for natural language understanding","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2502.01524","last_updated":"2025-02-03T17:01:59Z","snapshot_observed_at":"2026-08-09T21:17:23.790261Z","submitted_at":"2025-02-03T17:01:59Z","title":"Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-09T15:04:40.108448Z"},"links":{"cited_paper":"/paper/1901.11504","citing_paper":"/paper/2502.01524"},"observation_digest":"sha256:bbdd934c3d911695fc78514525c4dd83e7e057fc23481bea5a94e353a63ba3e3","observation_id":"61074ac1-edc3-4e83-9567-321dfa50f885","resolution":{"observed_at":"2026-08-09T15:04:40.108448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:04:40.111423Z","title":"Multitask learning","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2502.01524","last_updated":"2025-02-03T17:01:59Z","snapshot_observed_at":"2026-08-09T21:17:23.790261Z","submitted_at":"2025-02-03T17:01:59Z","title":"Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-09T15:04:40.111423Z"},"links":{"citing_paper":"/paper/2502.01524"},"observation_digest":"sha256:37c4ebd44af1a0bc73a1811c5b4679d1619807c94d9bef3abb4bcdfb9ea065b7","observation_id":"145829e4-82f3-4838-b307-254595175fa7","resolution":{"observed_at":"2026-08-09T15:04:40.111423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:04:40.114409Z","title":"A survey of multi-task learning in natural language processing: Regarding task relatedness and training methods","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01524","last_updated":"2025-02-03T17:01:59Z","snapshot_observed_at":"2026-08-09T21:17:23.790261Z","submitted_at":"2025-02-03T17:01:59Z","title":"Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-09T15:04:40.114409Z"},"links":{"citing_paper":"/paper/2502.01524"},"observation_digest":"sha256:47a7d7c9a216ce3e3e52d268a7f75cce15170f9c0321c85b66eacfa75b688308","observation_id":"9c6b41fd-7495-4f55-b266-31b88dff6087","resolution":{"observed_at":"2026-08-09T15:04:40.114409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09046","last_updated":"2024-12-12T08:15:16Z","snapshot_observed_at":"2026-08-09T21:16:55.284530Z","submitted_at":"2024-12-12T08:15:16Z","title":"Multi-Task Learning with LLMs for Implicit Sentiment Analysis: Data-level and Task-level Automatic Weight Learning","version":1},"cited_work":{"arxiv_id":"2412.09046","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.09046","snapshot_observed_at":"2026-08-09T15:04:40.414544Z","title":"Multi-Task Learning with LLMs for Implicit Sentiment Analysis: Data-level and Task-level Automatic Weight Learning","venue":"cs.CL","work_id":"a25afcd7-90d5-425a-9e37-51342b95abb0","year":2024},"citing_paper":{"arxiv_id":"2502.01524","last_updated":"2025-02-03T17:01:59Z","snapshot_observed_at":"2026-08-09T21:17:23.790261Z","submitted_at":"2025-02-03T17:01:59Z","title":"Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-09T15:04:40.117223Z"},"links":{"cited_paper":"/paper/2412.09046","citing_paper":"/paper/2502.01524"},"observation_digest":"sha256:9203bbaadcb346e558d479c553d6c149e40c319d65dd05de21bc6bc89bb98691","observation_id":"f1b100b5-75c3-4d63-89ee-b4a63864b153","resolution":{"observed_at":"2026-08-09T15:04:40.419710Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:04:40.120222Z","title":"Dai, and Quoc V Le","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.01524","last_updated":"2025-02-03T17:01:59Z","snapshot_observed_at":"2026-08-09T21:17:23.790261Z","submitted_at":"2025-02-03T17:01:59Z","title":"Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-09T15:04:40.120222Z"},"links":{"citing_paper":"/paper/2502.01524"},"observation_digest":"sha256:04351f37a0d0c21185aa9e1ddfce4681213226e1e7fa0d5fc45503bc37f77ac0","observation_id":"4f8032f2-8fd3-4bd0-bbef-a8eb6f4cb9b8","resolution":{"observed_at":"2026-08-09T15:04:40.120222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:04:40.122588Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.01524","last_updated":"2025-02-03T17:01:59Z","snapshot_observed_at":"2026-08-09T21:17:23.790261Z","submitted_at":"2025-02-03T17:01:59Z","title":"Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-09T15:04:40.122588Z"},"links":{"citing_paper":"/paper/2502.01524"},"observation_digest":"sha256:606761e7358e0605d89bde52b69731dd0bd2c47625f19fde452f32a398f8c132","observation_id":"8508d555-5ee9-4d9b-a066-21277a4d4e9e","resolution":{"observed_at":"2026-08-09T15:04:40.122588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-02T04:53:58.766070Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-08-09T15:04:40.124995Z","title":"Constitutional AI: Harmlessness from ai feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.01524","last_updated":"2025-02-03T17:01:59Z","snapshot_observed_at":"2026-08-09T21:17:23.790261Z","submitted_at":"2025-02-03T17:01:59Z","title":"Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-09T15:04:40.124995Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2502.01524"},"observation_digest":"sha256:08a424f18254ffd7ddcca4ff8ef0709f52b7852931d278d2d67e2172c9e0713f","observation_id":"7df50e87-abea-417d-bff0-23feca8f92de","resolution":{"observed_at":"2026-08-09T15:04:40.124995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-09T15:04:40.127769Z","title":"DeepSeek-R1: Incentivizing reasoning capability in LLMs via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.01524","last_updated":"2025-02-03T17:01:59Z","snapshot_observed_at":"2026-08-09T21:17:23.790261Z","submitted_at":"2025-02-03T17:01:59Z","title":"Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-09T15:04:40.127769Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2502.01524"},"observation_digest":"sha256:f14390c92778107e790c0d310def937fa744558292273b5de6d01e21a1266bae","observation_id":"dcdfa431-b162-47d8-9177-e59c42c01592","resolution":{"observed_at":"2026-08-09T15:04:40.127769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-09T15:04:40.130188Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.01524","last_updated":"2025-02-03T17:01:59Z","snapshot_observed_at":"2026-08-09T21:17:23.790261Z","submitted_at":"2025-02-03T17:01:59Z","title":"Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-09T15:04:40.130188Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2502.01524"},"observation_digest":"sha256:6a88c92bca4fe80d79ceb698d4b3df5c7df05d00207a527082fd127c568eb23c","observation_id":"cde0bf21-9b97-4abb-b73d-705f0490cd7e","resolution":{"observed_at":"2026-08-09T15:04:40.130188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:04:40.132714Z","title":"RLHF-V: Towards trustworthy MLLMs via behavior alignment from fine-grained correctional human feedback","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01524","last_updated":"2025-02-03T17:01:59Z","snapshot_observed_at":"2026-08-09T21:17:23.790261Z","submitted_at":"2025-02-03T17:01:59Z","title":"Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-09T15:04:40.132714Z"},"links":{"citing_paper":"/paper/2502.01524"},"observation_digest":"sha256:4c74f197760c372aa9668169fff60c74034c2f0bfadeaa99507ceabe4f7f8ba9","observation_id":"f5d59ee6-009d-4382-943c-f41311cb25d2","resolution":{"observed_at":"2026-08-09T15:04:40.132714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:04:40.136023Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.01524","last_updated":"2025-02-03T17:01:59Z","snapshot_observed_at":"2026-08-09T21:17:23.790261Z","submitted_at":"2025-02-03T17:01:59Z","title":"Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-09T15:04:40.136023Z"},"links":{"citing_paper":"/paper/2502.01524"},"observation_digest":"sha256:3e89f75b9666b118ba1c4a75761046a78802b3f674603dc496f9d350d2633e37","observation_id":"470ca58c-b3ba-44ca-9021-e1f81ed16205","resolution":{"observed_at":"2026-08-09T15:04:40.136023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:04:40.138949Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.01524","last_updated":"2025-02-03T17:01:59Z","snapshot_observed_at":"2026-08-09T21:17:23.790261Z","submitted_at":"2025-02-03T17:01:59Z","title":"Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-09T15:04:40.138949Z"},"links":{"citing_paper":"/paper/2502.01524"},"observation_digest":"sha256:475350b4795c2bc6d80d44780f9111fe4e3a7213cad4e984526851e7ed0655db","observation_id":"a5bf2872-84f5-4092-8062-cc6226d6a5a0","resolution":{"observed_at":"2026-08-09T15:04:40.138949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:04:40.141909Z","title":"High-performance large-scale image recognition without normalization","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.01524","last_updated":"2025-02-03T17:01:59Z","snapshot_observed_at":"2026-08-09T21:17:23.790261Z","submitted_at":"2025-02-03T17:01:59Z","title":"Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-09T15:04:40.141909Z"},"links":{"citing_paper":"/paper/2502.01524"},"observation_digest":"sha256:e8d89b59b6987cce6257731f57fc2180674e6a71df4d7e45e974c26418ce8fd6","observation_id":"61784e65-4a2a-4e55-bcb6-77e2f0f611f4","resolution":{"observed_at":"2026-08-09T15:04:40.141909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:04:41.085470Z","title":"Scaling vision transformers","venue":null,"work_id":"dbed1bc7-d50c-4bc8-9cc9-39c727482b6b","year":2022},"citing_paper":{"arxiv_id":"2502.01524","last_updated":"2025-02-03T17:01:59Z","snapshot_observed_at":"2026-08-09T21:17:23.790261Z","submitted_at":"2025-02-03T17:01:59Z","title":"Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-09T15:04:40.144780Z"},"links":{"citing_paper":"/paper/2502.01524"},"observation_digest":"sha256:34aa24123bc0cbe8e4f3b92b9e4e9989682b5a227d62155768b5ef10c7631742","observation_id":"6255f9a5-f207-44ff-be21-1b3092b36b96","resolution":{"observed_at":"2026-08-09T15:04:41.088602Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:04:41.077515Z","title":"Reproducible scaling laws for contrastive language-image learning","venue":null,"work_id":"9fbf1af1-23b2-483e-bac1-2fdec8e877f2","year":2023},"citing_paper":{"arxiv_id":"2502.01524","last_updated":"2025-02-03T17:01:59Z","snapshot_observed_at":"2026-08-09T21:17:23.790261Z","submitted_at":"2025-02-03T17:01:59Z","title":"Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-09T15:04:40.147567Z"},"links":{"citing_paper":"/paper/2502.01524"},"observation_digest":"sha256:725337ecc7938269cd4f2ed380372d34f592c698a77c2dc8c0a5c84a69645d27","observation_id":"afb0647e-2f7b-4235-8b34-c99094102e1c","resolution":{"observed_at":"2026-08-09T15:04:41.080405Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-09T15:04:40.150536Z","title":"EV A-CLIP: Improved training techniques for clip at scale","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01524","last_updated":"2025-02-03T17:01:59Z","snapshot_observed_at":"2026-08-09T21:17:23.790261Z","submitted_at":"2025-02-03T17:01:59Z","title":"Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-09T15:04:40.150536Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2502.01524"},"observation_digest":"sha256:bedf1535c34e6137dd3fe46f471f3b5bf5838fa513603d81dad6a55cf0fa8e90","observation_id":"5a6b4a6b-ebb5-4b10-bc51-6d3a821661ef","resolution":{"observed_at":"2026-08-09T15:04:40.150536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:04:41.069467Z","title":"OpenCLIP [software], July 2021","venue":null,"work_id":"536979fe-969e-4da2-96fa-1ae85cef2133","year":2021},"citing_paper":{"arxiv_id":"2502.01524","last_updated":"2025-02-03T17:01:59Z","snapshot_observed_at":"2026-08-09T21:17:23.790261Z","submitted_at":"2025-02-03T17:01:59Z","title":"Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-09T15:04:40.153714Z"},"links":{"citing_paper":"/paper/2502.01524"},"observation_digest":"sha256:e4cf771ab60fa40b2faa9b43e49e5aa00a0e0c6b76ded36924cc59ff2c8449db","observation_id":"00784461-af2d-4d8b-9519-093e8373a2aa","resolution":{"observed_at":"2026-08-09T15:04:41.072389Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:04:41.061451Z","title":"Deep residual learning for image recognition","venue":null,"work_id":"c8e8e660-e18a-40a7-82c8-67f294783946","year":2016},"citing_paper":{"arxiv_id":"2502.01524","last_updated":"2025-02-03T17:01:59Z","snapshot_observed_at":"2026-08-09T21:17:23.790261Z","submitted_at":"2025-02-03T17:01:59Z","title":"Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-09T15:04:40.156598Z"},"links":{"citing_paper":"/paper/2502.01524"},"observation_digest":"sha256:d4d7eb6159b66e25a622f9654f9745882d216c1a6edbdc08f2637286be5b32d6","observation_id":"003ac2b0-afb8-40a3-a46c-44fc642ec4c3","resolution":{"observed_at":"2026-08-09T15:04:41.064314Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:04:41.053415Z","title":"Linearly mapping from image to text space","venue":null,"work_id":"8bfda18f-557a-4d10-92e0-a6f39f8c7e5a","year":2023},"citing_paper":{"arxiv_id":"2502.01524","last_updated":"2025-02-03T17:01:59Z","snapshot_observed_at":"2026-08-09T21:17:23.790261Z","submitted_at":"2025-02-03T17:01:59Z","title":"Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-09T15:04:40.159739Z"},"links":{"citing_paper":"/paper/2502.01524"},"observation_digest":"sha256:c17a87d143b9b59acc3b5e217b863b24eb180ec9c5d274637687e8a2b66a4a15","observation_id":"5c142689-3d6e-4ab9-aa0a-f5ea26551c03","resolution":{"observed_at":"2026-08-09T15:04:41.056430Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:04:41.044997Z","title":"Deformable DETR: Deformable transformers for end-to-end object detection","venue":null,"work_id":"8925676d-1ccc-4dc5-b95d-2a478a03cbdd","year":2021},"citing_paper":{"arxiv_id":"2502.01524","last_updated":"2025-02-03T17:01:59Z","snapshot_observed_at":"2026-08-09T21:17:23.790261Z","submitted_at":"2025-02-03T17:01:59Z","title":"Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-09T15:04:40.162661Z"},"links":{"citing_paper":"/paper/2502.01524"},"observation_digest":"sha256:a27dd4eac2adec7d04db8f30b27994d31631ded406db5d5d07ef73e8ef577178","observation_id":"db588090-a4db-44ec-9d9e-189bc0681193","resolution":{"observed_at":"2026-08-09T15:04:41.048237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:04:41.036417Z","title":"Aggregated residual transformations for deep neural networks","venue":null,"work_id":"113e6952-3f76-4e02-8a7c-dc58437eab2b","year":2017},"citing_paper":{"arxiv_id":"2502.01524","last_updated":"2025-02-03T17:01:59Z","snapshot_observed_at":"2026-08-09T21:17:23.790261Z","submitted_at":"2025-02-03T17:01:59Z","title":"Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-09T15:04:40.165626Z"},"links":{"citing_paper":"/paper/2502.01524"},"observation_digest":"sha256:7ae1756dc7c2f9227b1210afb2b4593e9e8ea11a2b567287c43a84f91faf059b","observation_id":"dcb2dde3-3c5f-4edb-b9d4-759bb782a0a6","resolution":{"observed_at":"2026-08-09T15:04:41.039690Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:04:41.028451Z","title":"Conditional positional encodings for vision transformers","venue":null,"work_id":"091e811f-bd63-4ec5-af64-ee04aeb19cc8","year":2023},"citing_paper":{"arxiv_id":"2502.01524","last_updated":"2025-02-03T17:01:59Z","snapshot_observed_at":"2026-08-09T21:17:23.790261Z","submitted_at":"2025-02-03T17:01:59Z","title":"Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-09T15:04:40.168560Z"},"links":{"citing_paper":"/paper/2502.01524"},"observation_digest":"sha256:94933b6988eb50e981bf272ee3b836b4234e9f8fa26cc551dff6d26b37d30caa","observation_id":"c7148fc6-e865-4067-9acf-6d075db9a4b0","resolution":{"observed_at":"2026-08-09T15:04:41.031431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.01524","last_updated":"2025-02-03T17:01:59Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T21:17:23.790261Z","submitted_at":"2025-02-03T17:01:59Z","title":"Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":90,"verified_exact":2,"verified_fuzzy":8},"total_outbound_references":142},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 100 of 142 outbound references and 0 inbound Pith citation observations for arXiv:2502.01524."}