{"as_of":"2026-08-12T08:21:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f0570412496e1e511b582563a93d05e1678fa417f88bc218f2dd0915e00737ec","coverage":[{"denominator":229,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T18:11:54.632569Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.08158/citation-record","integrity":"/paper/2412.08158/integrity","json":"/paper/2412.08158/citation-record.json","paper":"/paper/2412.08158"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:11:54.151310Z","title":"Multimodal research in vision and language: A review of current and emerging trends,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.08158","last_updated":"2024-12-11T07:29:04Z","snapshot_observed_at":"2026-08-12T07:36:23.412895Z","submitted_at":"2024-12-11T07:29:04Z","title":"How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T18:11:54.151310Z"},"links":{"citing_paper":"/paper/2412.08158"},"observation_digest":"sha256:1b5ba3e871c63eb65f6a79f39118f1568a2cf3d56d1147c441bfa5a590d125c5","observation_id":"465a3771-17b5-4231-846f-1cc1323618ff","resolution":{"observed_at":"2026-08-11T18:11:54.151310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:11:54.156570Z","title":"Vision+ language applications: A survey,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08158","last_updated":"2024-12-11T07:29:04Z","snapshot_observed_at":"2026-08-12T07:36:23.412895Z","submitted_at":"2024-12-11T07:29:04Z","title":"How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T18:11:54.156570Z"},"links":{"citing_paper":"/paper/2412.08158"},"observation_digest":"sha256:ec2e7db22a01e370ab2b7d7b8da40444cf3e1944e8de1e2637399b7969428517","observation_id":"e66d460d-6aa1-481a-a634-6b91c7030011","resolution":{"observed_at":"2026-08-11T18:11:54.156570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:11:54.161338Z","title":"Bottom-up and top-down attention for image captioning and visual question answering,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.08158","last_updated":"2024-12-11T07:29:04Z","snapshot_observed_at":"2026-08-12T07:36:23.412895Z","submitted_at":"2024-12-11T07:29:04Z","title":"How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T18:11:54.161338Z"},"links":{"citing_paper":"/paper/2412.08158"},"observation_digest":"sha256:a1ef2748a971023c0dcf57f40aa90966995908423a96fe2eac920fe86aa8d8ef","observation_id":"6b767473-ee29-4f33-b9f8-cbfc86dd314d","resolution":{"observed_at":"2026-08-11T18:11:54.161338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:11:54.166132Z","title":"Swinbert: End-to-end transformers with sparse attention for video captioning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.08158","last_updated":"2024-12-11T07:29:04Z","snapshot_observed_at":"2026-08-12T07:36:23.412895Z","submitted_at":"2024-12-11T07:29:04Z","title":"How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T18:11:54.166132Z"},"links":{"citing_paper":"/paper/2412.08158"},"observation_digest":"sha256:fd54e486479f4ae51755aef242a9c320450bc9f218d17711281ef227000bd4bc","observation_id":"7b637dd1-c0a8-4628-b170-8131f064ef99","resolution":{"observed_at":"2026-08-11T18:11:54.166132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:11:54.170653Z","title":"Vqa: Visual question answering,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.08158","last_updated":"2024-12-11T07:29:04Z","snapshot_observed_at":"2026-08-12T07:36:23.412895Z","submitted_at":"2024-12-11T07:29:04Z","title":"How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T18:11:54.170653Z"},"links":{"citing_paper":"/paper/2412.08158"},"observation_digest":"sha256:72f409a0b7d221612eece20e0bf1c8a59bbf1f3c97354cc27c4f1ac161435241","observation_id":"0d68d81b-31f0-4f7b-8883-95817f80ffb7","resolution":{"observed_at":"2026-08-11T18:11:54.170653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:11:54.175805Z","title":"Movieqa: Understanding stories in movies through question- answering,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.08158","last_updated":"2024-12-11T07:29:04Z","snapshot_observed_at":"2026-08-12T07:36:23.412895Z","submitted_at":"2024-12-11T07:29:04Z","title":"How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T18:11:54.175805Z"},"links":{"citing_paper":"/paper/2412.08158"},"observation_digest":"sha256:a34b78107a57eb14cee40d93330a085e64560762b09a519380380c9c7c9d153e","observation_id":"80602856-cd1a-40fa-baf5-3d5d9bb7d2c7","resolution":{"observed_at":"2026-08-11T18:11:54.175805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:11:54.181811Z","title":"Context-aware attention network for image-text retrieval,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.08158","last_updated":"2024-12-11T07:29:04Z","snapshot_observed_at":"2026-08-12T07:36:23.412895Z","submitted_at":"2024-12-11T07:29:04Z","title":"How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T18:11:54.181811Z"},"links":{"citing_paper":"/paper/2412.08158"},"observation_digest":"sha256:9af4e8e42d0c7c26119a88e81dd03a03c6b3b92a1865d49f0a2d62f6d170fcbd","observation_id":"4d63aff3-6753-4266-84fc-e51fd504f63c","resolution":{"observed_at":"2026-08-11T18:11:54.181811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:11:54.186677Z","title":"Fine-grained video-text retrieval with hierarchical graph reasoning,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.08158","last_updated":"2024-12-11T07:29:04Z","snapshot_observed_at":"2026-08-12T07:36:23.412895Z","submitted_at":"2024-12-11T07:29:04Z","title":"How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T18:11:54.186677Z"},"links":{"citing_paper":"/paper/2412.08158"},"observation_digest":"sha256:c5909a953b9ef0ee70a65b0836f58c4c40d768327582c30a7a644f0da38a0b9b","observation_id":"a0348ba6-a5ba-4010-9c44-d6577e71f2fe","resolution":{"observed_at":"2026-08-11T18:11:54.186677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:11:54.191266Z","title":"Visual classification via description from large language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.08158","last_updated":"2024-12-11T07:29:04Z","snapshot_observed_at":"2026-08-12T07:36:23.412895Z","submitted_at":"2024-12-11T07:29:04Z","title":"How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T18:11:54.191266Z"},"links":{"citing_paper":"/paper/2412.08158"},"observation_digest":"sha256:17b7c1db90ae12ee8fd329b4ffde0a8e3743013aa9064680c777b7f0a56a8593","observation_id":"62a87f97-baf3-4fd0-af55-356f5642acd2","resolution":{"observed_at":"2026-08-11T18:11:54.191266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:11:54.195864Z","title":"Learning concise and descriptive attributes for visual recognition,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08158","last_updated":"2024-12-11T07:29:04Z","snapshot_observed_at":"2026-08-12T07:36:23.412895Z","submitted_at":"2024-12-11T07:29:04Z","title":"How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T18:11:54.195864Z"},"links":{"citing_paper":"/paper/2412.08158"},"observation_digest":"sha256:d67351f1e84fbdc388f0c1d0215a817fe993c2fdcccdad1447157557f71f5681","observation_id":"8d00e512-bfd5-431c-b450-887cb665d8c2","resolution":{"observed_at":"2026-08-11T18:11:54.195864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:11:54.201342Z","title":"Exploring large language models for multi-modal out-of-distribution detection,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08158","last_updated":"2024-12-11T07:29:04Z","snapshot_observed_at":"2026-08-12T07:36:23.412895Z","submitted_at":"2024-12-11T07:29:04Z","title":"How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T18:11:54.201342Z"},"links":{"citing_paper":"/paper/2412.08158"},"observation_digest":"sha256:9f1ed020f59cafa1bd43610335ffe688fa9ace588c6f5c47e08e232f26c684e0","observation_id":"7384dc51-6dad-4064-8d14-69096b248792","resolution":{"observed_at":"2026-08-11T18:11:54.201342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:11:54.206793Z","title":"Chatgpt-powered hierarchical comparisons for image classification,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08158","last_updated":"2024-12-11T07:29:04Z","snapshot_observed_at":"2026-08-12T07:36:23.412895Z","submitted_at":"2024-12-11T07:29:04Z","title":"How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T18:11:54.206793Z"},"links":{"citing_paper":"/paper/2412.08158"},"observation_digest":"sha256:3af8ee0100754f6aef5ea337fc39322d440eaaeab41fdea3d9659c0cfd954576","observation_id":"37c035fb-ab3d-44eb-9a01-a2425d584e56","resolution":{"observed_at":"2026-08-11T18:11:54.206793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:11:54.211313Z","title":"Vision-language pre-training: Basics, recent advances, and future trends,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.08158","last_updated":"2024-12-11T07:29:04Z","snapshot_observed_at":"2026-08-12T07:36:23.412895Z","submitted_at":"2024-12-11T07:29:04Z","title":"How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T18:11:54.211313Z"},"links":{"citing_paper":"/paper/2412.08158"},"observation_digest":"sha256:1bcbadeb3d3e81ead70040a55bbc4db7b9cd5fef0224a6bfba62def28ea6682d","observation_id":"113f8511-064d-4e5d-9e0d-58c165307694","resolution":{"observed_at":"2026-08-11T18:11:54.211313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:11:54.216289Z","title":"Show and tell: A neural image caption generator,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.08158","last_updated":"2024-12-11T07:29:04Z","snapshot_observed_at":"2026-08-12T07:36:23.412895Z","submitted_at":"2024-12-11T07:29:04Z","title":"How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T18:11:54.216289Z"},"links":{"citing_paper":"/paper/2412.08158"},"observation_digest":"sha256:9d70423a0d0bf158fb9b16aa5f19cbe7961ea5690d49ee3ab7b96437a76b2038","observation_id":"c6d701e4-6fe3-4ef0-ae53-625cbee3e4e7","resolution":{"observed_at":"2026-08-11T18:11:54.216289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:11:54.220881Z","title":"Deep correlation for matching images and text,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.08158","last_updated":"2024-12-11T07:29:04Z","snapshot_observed_at":"2026-08-12T07:36:23.412895Z","submitted_at":"2024-12-11T07:29:04Z","title":"How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T18:11:54.220881Z"},"links":{"citing_paper":"/paper/2412.08158"},"observation_digest":"sha256:f7f0312f6b8087dd7e1f453a8ca6f31e9bba51fba8204891c30cd0ed7bc315c4","observation_id":"ccd0f2f0-41e3-4719-a7ab-d991b54b9756","resolution":{"observed_at":"2026-08-11T18:11:54.220881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:11:54.226747Z","title":"Draw: A recurrent neural network for image generation,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.08158","last_updated":"2024-12-11T07:29:04Z","snapshot_observed_at":"2026-08-12T07:36:23.412895Z","submitted_at":"2024-12-11T07:29:04Z","title":"How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T18:11:54.226747Z"},"links":{"citing_paper":"/paper/2412.08158"},"observation_digest":"sha256:dd08ef704fddca5ff75578ea017fa95344d686c92d661b60e36f09756a3243ce","observation_id":"049e467a-40f8-4420-902e-054327aa82c9","resolution":{"observed_at":"2026-08-11T18:11:54.226747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:11:54.231254Z","title":"Memory- attended recurrent network for video captioning,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.08158","last_updated":"2024-12-11T07:29:04Z","snapshot_observed_at":"2026-08-12T07:36:23.412895Z","submitted_at":"2024-12-11T07:29:04Z","title":"How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T18:11:54.231254Z"},"links":{"citing_paper":"/paper/2412.08158"},"observation_digest":"sha256:45b7a165fe7d065c78ccf6d1a16d08312a7123a1cfa882808b99e5aab3f6db08","observation_id":"02f00c2e-05b1-4615-bec1-e2e2787eb9e1","resolution":{"observed_at":"2026-08-11T18:11:54.231254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:11:54.235684Z","title":"Heterogeneous memory enhanced multimodal attention model for video question answering,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.08158","last_updated":"2024-12-11T07:29:04Z","snapshot_observed_at":"2026-08-12T07:36:23.412895Z","submitted_at":"2024-12-11T07:29:04Z","title":"How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T18:11:54.235684Z"},"links":{"citing_paper":"/paper/2412.08158"},"observation_digest":"sha256:5cb9c275a0151a9f34e522aeba31b752976f7b33001a16d365f5d676e8e8dc54","observation_id":"25b134f8-93c0-45cd-b0eb-da13c31ee43a","resolution":{"observed_at":"2026-08-11T18:11:54.235684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:11:54.240343Z","title":"Mocogan: Decompos- ing motion and content for video generation,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.08158","last_updated":"2024-12-11T07:29:04Z","snapshot_observed_at":"2026-08-12T07:36:23.412895Z","submitted_at":"2024-12-11T07:29:04Z","title":"How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T18:11:54.240343Z"},"links":{"citing_paper":"/paper/2412.08158"},"observation_digest":"sha256:3b2e0a788a178fe485dc8a1273458ad7b927e22741ff2f4f5c34594a7ae7d4bf","observation_id":"441a07d7-01f5-4ab6-ba82-411924c14c60","resolution":{"observed_at":"2026-08-11T18:11:54.240343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:11:54.246246Z","title":"Rethinking the bottom-up framework for query-based video localiza- tion,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.08158","last_updated":"2024-12-11T07:29:04Z","snapshot_observed_at":"2026-08-12T07:36:23.412895Z","submitted_at":"2024-12-11T07:29:04Z","title":"How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T18:11:54.246246Z"},"links":{"citing_paper":"/paper/2412.08158"},"observation_digest":"sha256:aa55def5bda0f996f2f0da6caa1e5f7cdbf6c99b58abe1b84eb2c3e577726c78","observation_id":"b03707cf-9f9d-4114-b41e-61f5a28a89bb","resolution":{"observed_at":"2026-08-11T18:11:54.246246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:11:54.250908Z","title":"Object detection in 20 years: A survey,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08158","last_updated":"2024-12-11T07:29:04Z","snapshot_observed_at":"2026-08-12T07:36:23.412895Z","submitted_at":"2024-12-11T07:29:04Z","title":"How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T18:11:54.250908Z"},"links":{"citing_paper":"/paper/2412.08158"},"observation_digest":"sha256:ad23a49df6ae1d4468032dc7a652911a2a4c827702ffc46c7368461836a3c611","observation_id":"6572cfa6-72b4-4359-8923-c15656023beb","resolution":{"observed_at":"2026-08-11T18:11:54.250908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:11:54.255555Z","title":"Neural motifs: Scene graph parsing with global context,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.08158","last_updated":"2024-12-11T07:29:04Z","snapshot_observed_at":"2026-08-12T07:36:23.412895Z","submitted_at":"2024-12-11T07:29:04Z","title":"How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T18:11:54.255555Z"},"links":{"citing_paper":"/paper/2412.08158"},"observation_digest":"sha256:0b84b390f5e3b2442d98f2d4c235c2c885d8ada4a1fba808a145c72f91fc9be7","observation_id":"ca14498b-3398-4a7a-a899-c85219ef154f","resolution":{"observed_at":"2026-08-11T18:11:54.255555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:11:54.260138Z","title":"From recognition to cognition: Visual commonsense reasoning,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.08158","last_updated":"2024-12-11T07:29:04Z","snapshot_observed_at":"2026-08-12T07:36:23.412895Z","submitted_at":"2024-12-11T07:29:04Z","title":"How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T18:11:54.260138Z"},"links":{"citing_paper":"/paper/2412.08158"},"observation_digest":"sha256:6def46ed5cd2b3dbb69d33f6580eedb3e56f8998b038481cbb7e824cac4e5bab","observation_id":"f7a5829d-9b4f-4852-9d32-3b905c77a6dd","resolution":{"observed_at":"2026-08-11T18:11:54.260138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1901.06706","last_updated":"2019-01-20T17:55:05Z","snapshot_observed_at":"2026-08-08T23:17:13.003005Z","submitted_at":"2019-01-20T17:55:05Z","title":"Visual Entailment: A Novel Task for Fine-Grained Image Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.06706","snapshot_observed_at":"2026-08-11T18:11:54.264684Z","title":"Visual entailment: A novel task for fine-grained image understanding,","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2412.08158","last_updated":"2024-12-11T07:29:04Z","snapshot_observed_at":"2026-08-12T07:36:23.412895Z","submitted_at":"2024-12-11T07:29:04Z","title":"How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T18:11:54.264684Z"},"links":{"cited_paper":"/paper/1901.06706","citing_paper":"/paper/2412.08158"},"observation_digest":"sha256:e6a792b1c5e587007b852c6ed8b0b61909001a17f998abf6446ac5c07f0148d5","observation_id":"a9cf5749-a14b-49cf-a287-d85fbfe0464a","resolution":{"observed_at":"2026-08-11T18:11:54.264684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:11:54.269433Z","title":"The abduction of sherlock holmes: A dataset for visual abductive reasoning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.08158","last_updated":"2024-12-11T07:29:04Z","snapshot_observed_at":"2026-08-12T07:36:23.412895Z","submitted_at":"2024-12-11T07:29:04Z","title":"How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T18:11:54.269433Z"},"links":{"citing_paper":"/paper/2412.08158"},"observation_digest":"sha256:e5088d6ce899ab0f1614b0ee20b93f4826209f9bcfadf37acaa63e35544ac011","observation_id":"8bf45281-434a-4669-bd68-c9686711b375","resolution":{"observed_at":"2026-08-11T18:11:54.269433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:11:54.273497Z","title":"Breaking common sense: Whoops! a vision-and-language benchmark of synthetic and compositional im- ages,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08158","last_updated":"2024-12-11T07:29:04Z","snapshot_observed_at":"2026-08-12T07:36:23.412895Z","submitted_at":"2024-12-11T07:29:04Z","title":"How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T18:11:54.273497Z"},"links":{"citing_paper":"/paper/2412.08158"},"observation_digest":"sha256:4f7df1fbbca3c6f035caf89624ffc252ba94cdf1093c557b8cf22844ca0e849d","observation_id":"7ae55b5e-b01a-4e42-a129-6e59542c8514","resolution":{"observed_at":"2026-08-11T18:11:54.273497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:11:54.277674Z","title":"Let’s think outside the box: Exploring leap-of-thought in large language models with creative humor generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08158","last_updated":"2024-12-11T07:29:04Z","snapshot_observed_at":"2026-08-12T07:36:23.412895Z","submitted_at":"2024-12-11T07:29:04Z","title":"How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T18:11:54.277674Z"},"links":{"citing_paper":"/paper/2412.08158"},"observation_digest":"sha256:de48d0b1eec9b698dfc34c15d7ebd78957f912ce3291a16a9a784cc4c5873cd6","observation_id":"1044258a-ee6d-4523-9597-e09e7efe5f26","resolution":{"observed_at":"2026-08-11T18:11:54.277674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:11:54.281912Z","title":"Pre-train, prompt, and predict: A systematic survey of prompting methods in natural language processing,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08158","last_updated":"2024-12-11T07:29:04Z","snapshot_observed_at":"2026-08-12T07:36:23.412895Z","submitted_at":"2024-12-11T07:29:04Z","title":"How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T18:11:54.281912Z"},"links":{"citing_paper":"/paper/2412.08158"},"observation_digest":"sha256:e67bd6324c2dc3f2280e9c9a2dd726e7d56f5a693ed91aa21fa0c9cba95566ed","observation_id":"f2c03e37-b057-4178-9e91-6bc2f01d31d9","resolution":{"observed_at":"2026-08-11T18:11:54.281912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-11T18:11:54.285863Z","title":"Llama: Open and efficient foundation language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08158","last_updated":"2024-12-11T07:29:04Z","snapshot_observed_at":"2026-08-12T07:36:23.412895Z","submitted_at":"2024-12-11T07:29:04Z","title":"How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T18:11:54.285863Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2412.08158"},"observation_digest":"sha256:c60ae6bf249ef8a17473641b396ae4b9a7f92af258e4c4d2ab95fca319ae91fd","observation_id":"6b439e0a-614b-4537-9e9c-7ea086b7be0d","resolution":{"observed_at":"2026-08-11T18:11:54.285863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:11:54.290558Z","title":"Vicuna: An open-source chatbot impressing gpt-4 with 90%* chatgpt quality,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08158","last_updated":"2024-12-11T07:29:04Z","snapshot_observed_at":"2026-08-12T07:36:23.412895Z","submitted_at":"2024-12-11T07:29:04Z","title":"How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T18:11:54.290558Z"},"links":{"citing_paper":"/paper/2412.08158"},"observation_digest":"sha256:f560935f9e17b1446ae6dbf2de31b3d4aacad40f3708a41bdd0873f6058a09d9","observation_id":"8d8fe502-67f9-4e77-95f4-8d041814d40e","resolution":{"observed_at":"2026-08-11T18:11:54.290558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-11T18:11:54.295187Z","title":"Qwen technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08158","last_updated":"2024-12-11T07:29:04Z","snapshot_observed_at":"2026-08-12T07:36:23.412895Z","submitted_at":"2024-12-11T07:29:04Z","title":"How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T18:11:54.295187Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2412.08158"},"observation_digest":"sha256:f0a3b1b21502f4b6239be536f3e7270f069d661d196dc55eda3944f38e27ca61","observation_id":"57c302c3-26c4-4bfa-bfea-458cca150c6f","resolution":{"observed_at":"2026-08-11T18:11:54.295187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:11:54.300089Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.08158","last_updated":"2024-12-11T07:29:04Z","snapshot_observed_at":"2026-08-12T07:36:23.412895Z","submitted_at":"2024-12-11T07:29:04Z","title":"How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T18:11:54.300089Z"},"links":{"citing_paper":"/paper/2412.08158"},"observation_digest":"sha256:2a69cb613040061b6b3f4bc92b7b6e51d34b1b06cbdc36f43af935f28b80ba11","observation_id":"3bbaebfa-4c5a-4149-805d-5941bcb5e467","resolution":{"observed_at":"2026-08-11T18:11:54.300089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:11:54.305441Z","title":"Scaling up visual and vision-language representation learning with noisy text supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.08158","last_updated":"2024-12-11T07:29:04Z","snapshot_observed_at":"2026-08-12T07:36:23.412895Z","submitted_at":"2024-12-11T07:29:04Z","title":"How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T18:11:54.305441Z"},"links":{"citing_paper":"/paper/2412.08158"},"observation_digest":"sha256:d821a62d6505f30605984b7904b6ea00ddfc03b5f922d1522c54e1696e97a540","observation_id":"209d48e2-4ca2-4878-a91a-59c43472ebf0","resolution":{"observed_at":"2026-08-11T18:11:54.305441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:11:54.310428Z","title":"Vlmo: Unified vision-language pre- training with mixture-of-modality-experts,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.08158","last_updated":"2024-12-11T07:29:04Z","snapshot_observed_at":"2026-08-12T07:36:23.412895Z","submitted_at":"2024-12-11T07:29:04Z","title":"How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T18:11:54.310428Z"},"links":{"citing_paper":"/paper/2412.08158"},"observation_digest":"sha256:a3b3611bd4a998ffa575e8bb49c27aabfbdddac644a8ca68fb91dab2dfb32d6b","observation_id":"019bd6a3-336d-4a83-aef0-8412d20200a9","resolution":{"observed_at":"2026-08-11T18:11:54.310428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.07783","last_updated":"2021-11-09T17:15:38Z","snapshot_observed_at":"2026-07-06T12:08:35.761426Z","submitted_at":"2021-11-09T17:15:38Z","title":"FILIP: Fine-grained Interactive Language-Image Pre-Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.07783","snapshot_observed_at":"2026-08-11T18:11:54.315913Z","title":"Filip: Fine-grained interactive language-image pre-training,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.08158","last_updated":"2024-12-11T07:29:04Z","snapshot_observed_at":"2026-08-12T07:36:23.412895Z","submitted_at":"2024-12-11T07:29:04Z","title":"How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T18:11:54.315913Z"},"links":{"cited_paper":"/paper/2111.07783","citing_paper":"/paper/2412.08158"},"observation_digest":"sha256:d3d03a43b2e7e45889083800a58425c63637b0ea8a0591d2881928e02dfdd19d","observation_id":"7dc86bcb-35af-4f97-9c0a-d329449e0029","resolution":{"observed_at":"2026-08-11T18:11:54.315913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:11:54.321522Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.08158","last_updated":"2024-12-11T07:29:04Z","snapshot_observed_at":"2026-08-12T07:36:23.412895Z","submitted_at":"2024-12-11T07:29:04Z","title":"How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T18:11:54.321522Z"},"links":{"citing_paper":"/paper/2412.08158"},"observation_digest":"sha256:c96cbfd57a887e319b0e24db6215980bd723d56ff24fd00e43e7f047864ae23d","observation_id":"094d7387-96b0-4ee9-9e74-8735de932580","resolution":{"observed_at":"2026-08-11T18:11:54.321522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-11T18:11:54.326673Z","title":"Minigpt-4: En- hancing vision-language understanding with advanced large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08158","last_updated":"2024-12-11T07:29:04Z","snapshot_observed_at":"2026-08-12T07:36:23.412895Z","submitted_at":"2024-12-11T07:29:04Z","title":"How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T18:11:54.326673Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2412.08158"},"observation_digest":"sha256:c3feaad1c132e54d98385ddc409e85fbdfafbf626cf83b1c8980a84515a5a02e","observation_id":"3a3b5abe-6d1b-4b02-8605-626e79e5c783","resolution":{"observed_at":"2026-08-11T18:11:54.326673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:11:54.331796Z","title":"Visual instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08158","last_updated":"2024-12-11T07:29:04Z","snapshot_observed_at":"2026-08-12T07:36:23.412895Z","submitted_at":"2024-12-11T07:29:04Z","title":"How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T18:11:54.331796Z"},"links":{"citing_paper":"/paper/2412.08158"},"observation_digest":"sha256:893e022f630bf52e704598c6e9f9d6212016fb005fbad5f7167da9f1b086823a","observation_id":"d57faeb6-6edd-4ab4-8c11-7641c2b71ad5","resolution":{"observed_at":"2026-08-11T18:11:54.331796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-07-06T15:38:39.712379Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-11T18:11:54.336578Z","title":"Video-llama: An instruction-tuned audio-visual language model for video understanding,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08158","last_updated":"2024-12-11T07:29:04Z","snapshot_observed_at":"2026-08-12T07:36:23.412895Z","submitted_at":"2024-12-11T07:29:04Z","title":"How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T18:11:54.336578Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2412.08158"},"observation_digest":"sha256:67b8f674b5ca749bc8b9fff19c3ceceb280071a9d28dcf562372ac570f3dab6a","observation_id":"5af0e801-e2e4-4aa7-91c6-e70814e66f80","resolution":{"observed_at":"2026-08-11T18:11:54.336578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.18223","last_updated":"2026-03-18T05:34:39Z","snapshot_observed_at":"2026-08-06T23:27:24.356320Z","submitted_at":"2023-03-31T17:28:46Z","title":"A Survey of Large Language Models","version":19},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.18223","snapshot_observed_at":"2026-08-11T18:11:54.342321Z","title":"A survey of large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08158","last_updated":"2024-12-11T07:29:04Z","snapshot_observed_at":"2026-08-12T07:36:23.412895Z","submitted_at":"2024-12-11T07:29:04Z","title":"How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T18:11:54.342321Z"},"links":{"cited_paper":"/paper/2303.18223","citing_paper":"/paper/2412.08158"},"observation_digest":"sha256:61a6fb53cc942543a123122225534054bd44932e13b9f0a595f6e2f77f8a8c4d","observation_id":"d99eec56-064d-4396-975f-4191cec24c0a","resolution":{"observed_at":"2026-08-11T18:11:54.342321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06435","last_updated":"2024-10-17T01:10:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-12T20:01:52Z","title":"A Comprehensive Overview of Large Language Models","version":10},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06435","snapshot_observed_at":"2026-08-11T18:11:54.347750Z","title":"A comprehensive overview of large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08158","last_updated":"2024-12-11T07:29:04Z","snapshot_observed_at":"2026-08-12T07:36:23.412895Z","submitted_at":"2024-12-11T07:29:04Z","title":"How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T18:11:54.347750Z"},"links":{"cited_paper":"/paper/2307.06435","citing_paper":"/paper/2412.08158"},"observation_digest":"sha256:e67ac8d907229b28219027bdbc5dacc62e2bb038a18d9fbefcd14aab5a5f0eab","observation_id":"1c683867-9394-43cb-9f99-3e4b42a8682e","resolution":{"observed_at":"2026-08-11T18:11:54.347750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:11:54.352851Z","title":"A survey on evaluation of large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08158","last_updated":"2024-12-11T07:29:04Z","snapshot_observed_at":"2026-08-12T07:36:23.412895Z","submitted_at":"2024-12-11T07:29:04Z","title":"How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T18:11:54.352851Z"},"links":{"citing_paper":"/paper/2412.08158"},"observation_digest":"sha256:c4a5e0cbcb98a9dd810f8c3b225a30cd7edc3084af8f15b2030ffce48a57b8c4","observation_id":"f4e04d6d-f6ac-4623-9bd1-af9457097593","resolution":{"observed_at":"2026-08-11T18:11:54.352851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:11:54.357550Z","title":"Large-scale multi-modal pre-trained models: A com- prehensive survey,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08158","last_updated":"2024-12-11T07:29:04Z","snapshot_observed_at":"2026-08-12T07:36:23.412895Z","submitted_at":"2024-12-11T07:29:04Z","title":"How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T18:11:54.357550Z"},"links":{"citing_paper":"/paper/2412.08158"},"observation_digest":"sha256:fcaabce7a421015075f1f9d392ed1858188ed97ca8bcd979366f4ba2ee21b3c7","observation_id":"c9093796-6795-45a6-aea2-2e049f1d89bc","resolution":{"observed_at":"2026-08-11T18:11:54.357550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.13721","last_updated":"2023-07-25T17:59:18Z","snapshot_observed_at":"2026-08-07T23:40:08.386706Z","submitted_at":"2023-07-25T17:59:18Z","title":"Foundational Models Defining a New Era in Vision: A Survey and Outlook","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.13721","snapshot_observed_at":"2026-08-11T18:11:54.362248Z","title":"Foundational models defining a new era in vision: A survey and outlook,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08158","last_updated":"2024-12-11T07:29:04Z","snapshot_observed_at":"2026-08-12T07:36:23.412895Z","submitted_at":"2024-12-11T07:29:04Z","title":"How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T18:11:54.362248Z"},"links":{"cited_paper":"/paper/2307.13721","citing_paper":"/paper/2412.08158"},"observation_digest":"sha256:7a8378c2fc65cbeaa49e72535dda0543c23c48e04ccfd975ba42e1b1a73c2985","observation_id":"2f77d8d7-9b74-4845-a7fb-b5b0cd345367","resolution":{"observed_at":"2026-08-11T18:11:54.362248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13549","last_updated":"2024-11-29T15:51:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T15:21:52Z","title":"A Survey on Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13549","snapshot_observed_at":"2026-08-11T18:11:54.367070Z","title":"A survey on multimodal large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08158","last_updated":"2024-12-11T07:29:04Z","snapshot_observed_at":"2026-08-12T07:36:23.412895Z","submitted_at":"2024-12-11T07:29:04Z","title":"How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T18:11:54.367070Z"},"links":{"cited_paper":"/paper/2306.13549","citing_paper":"/paper/2412.08158"},"observation_digest":"sha256:e9cdd8a7cdafc2d485757bc2d4d801b4454500f91b4d1a725c575f8e46c5a270","observation_id":"937aaa72-68e8-4300-bb23-e48d3e8bfdf0","resolution":{"observed_at":"2026-08-11T18:11:54.367070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.13601","last_updated":"2024-05-28T05:36:23Z","snapshot_observed_at":"2026-08-10T21:32:36.140961Z","submitted_at":"2024-01-24T17:10:45Z","title":"MM-LLMs: Recent Advances in MultiModal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.13601","snapshot_observed_at":"2026-08-11T18:11:54.372006Z","title":"Mm-llms: Recent advances in multimodal large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08158","last_updated":"2024-12-11T07:29:04Z","snapshot_observed_at":"2026-08-12T07:36:23.412895Z","submitted_at":"2024-12-11T07:29:04Z","title":"How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T18:11:54.372006Z"},"links":{"cited_paper":"/paper/2401.13601","citing_paper":"/paper/2412.08158"},"observation_digest":"sha256:b14a9aa8fbdf2fc7eb4dd2ccb8e834215828ff1c9a0f931fc958fbb27639ebc1","observation_id":"f53a411d-e9ab-4795-97cd-e5dd1d4dd464","resolution":{"observed_at":"2026-08-11T18:11:54.372006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06805","last_updated":"2024-01-18T07:31:47Z","snapshot_observed_at":"2026-07-06T17:14:57.853205Z","submitted_at":"2024-01-10T15:29:21Z","title":"Exploring the Reasoning Abilities of Multimodal Large Language Models (MLLMs): A Comprehensive Survey on Emerging Trends in Multimodal Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06805","snapshot_observed_at":"2026-08-11T18:11:54.376675Z","title":"Exploring the reasoning abilities of multimodal large language models (mllms): A comprehensive survey on emerging trends in multimodal reasoning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08158","last_updated":"2024-12-11T07:29:04Z","snapshot_observed_at":"2026-08-12T07:36:23.412895Z","submitted_at":"2024-12-11T07:29:04Z","title":"How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T18:11:54.376675Z"},"links":{"cited_paper":"/paper/2401.06805","citing_paper":"/paper/2412.08158"},"observation_digest":"sha256:75d273678208ca99b508638a333305bdfc2d5fe11773e9a7387004fef90d9a38","observation_id":"cf56b006-35a9-45ed-8df3-63d30f45dcc5","resolution":{"observed_at":"2026-08-11T18:11:54.376675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:11:54.381148Z","title":"Video understanding with large language models: A survey,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08158","last_updated":"2024-12-11T07:29:04Z","snapshot_observed_at":"2026-08-12T07:36:23.412895Z","submitted_at":"2024-12-11T07:29:04Z","title":"How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T18:11:54.381148Z"},"links":{"citing_paper":"/paper/2412.08158"},"observation_digest":"sha256:28aeb045c7bbbe36f16320382cbf6ea7a806ba3fa2c31a856aaef7c82856f71c","observation_id":"f911f90b-f4e9-483d-856f-4c2bc6699771","resolution":{"observed_at":"2026-08-11T18:11:54.381148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:11:54.385442Z","title":"Vision-language models for vision tasks: A survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08158","last_updated":"2024-12-11T07:29:04Z","snapshot_observed_at":"2026-08-12T07:36:23.412895Z","submitted_at":"2024-12-11T07:29:04Z","title":"How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T18:11:54.385442Z"},"links":{"citing_paper":"/paper/2412.08158"},"observation_digest":"sha256:73a11f0b796edeb7c3d1ec324b2b09c1df37cc36eea32cc1f30676e2c15b6a27","observation_id":"f2612d6b-e681-4543-8935-783877968ab5","resolution":{"observed_at":"2026-08-11T18:11:54.385442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19334","last_updated":"2024-06-09T11:34:12Z","snapshot_observed_at":"2026-08-10T12:28:17.826279Z","submitted_at":"2024-05-29T17:59:20Z","title":"LLMs Meet Multimodal Generation and Editing: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19334","snapshot_observed_at":"2026-08-11T18:11:54.389662Z","title":"Llms meet multimodal generation and editing: A survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08158","last_updated":"2024-12-11T07:29:04Z","snapshot_observed_at":"2026-08-12T07:36:23.412895Z","submitted_at":"2024-12-11T07:29:04Z","title":"How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T18:11:54.389662Z"},"links":{"cited_paper":"/paper/2405.19334","citing_paper":"/paper/2412.08158"},"observation_digest":"sha256:8ce4deddcdcab0b1988339cfdef98600d1eaec623d31f9b65d189742bb2db0c9","observation_id":"0a3844b0-08ef-4666-96a1-3a72e29532e6","resolution":{"observed_at":"2026-08-11T18:11:54.389662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21794","last_updated":"2025-06-18T17:03:35Z","snapshot_observed_at":"2026-08-10T08:43:59.815571Z","submitted_at":"2024-07-31T17:59:58Z","title":"Generalized Out-of-Distribution Detection and Beyond in Vision Language Model Era: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21794","snapshot_observed_at":"2026-08-11T18:11:54.394298Z","title":"Generalized out-of-distribution detection and beyond in vision language model era: A survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08158","last_updated":"2024-12-11T07:29:04Z","snapshot_observed_at":"2026-08-12T07:36:23.412895Z","submitted_at":"2024-12-11T07:29:04Z","title":"How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T18:11:54.394298Z"},"links":{"cited_paper":"/paper/2407.21794","citing_paper":"/paper/2412.08158"},"observation_digest":"sha256:093ec416cd86d67e90d0a72d4638358bb669b41a0e3f674e65ee8ca1b67eb923","observation_id":"e47f553e-4c25-427d-ba29-e9b5d4b483a4","resolution":{"observed_at":"2026-08-11T18:11:54.394298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-11T18:11:54.400421Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.08158","last_updated":"2024-12-11T07:29:04Z","snapshot_observed_at":"2026-08-12T07:36:23.412895Z","submitted_at":"2024-12-11T07:29:04Z","title":"How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T18:11:54.400421Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2412.08158"},"observation_digest":"sha256:20779e231a1645a83c26d7b547df50b4df0cc06cbb6778375a30e3a3189cd5a3","observation_id":"7f8641d0-b904-46d4-9278-50960230ec98","resolution":{"observed_at":"2026-08-11T18:11:54.400421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09223","last_updated":"2019-04-19T15:10:56Z","snapshot_observed_at":"2026-07-06T07:47:14.837747Z","submitted_at":"2019-04-19T15:10:56Z","title":"ERNIE: Enhanced Representation through Knowledge Integration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09223","snapshot_observed_at":"2026-08-11T18:11:54.405469Z","title":"Ernie: Enhanced representation through knowledge integration,","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2412.08158","last_updated":"2024-12-11T07:29:04Z","snapshot_observed_at":"2026-08-12T07:36:23.412895Z","submitted_at":"2024-12-11T07:29:04Z","title":"How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T18:11:54.405469Z"},"links":{"cited_paper":"/paper/1904.09223","citing_paper":"/paper/2412.08158"},"observation_digest":"sha256:72fa9863efa0850a731ca8cb81742cb0a3adf573d29e3e3ef571fb19143646ca","observation_id":"375c1fd8-4966-42f4-baab-4334bda14734","resolution":{"observed_at":"2026-08-11T18:11:54.405469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:11:54.410963Z","title":"Language mod- els are few-shot learners,","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2412.08158","last_updated":"2024-12-11T07:29:04Z","snapshot_observed_at":"2026-08-12T07:36:23.412895Z","submitted_at":"2024-12-11T07:29:04Z","title":"How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T18:11:54.410963Z"},"links":{"citing_paper":"/paper/2412.08158"},"observation_digest":"sha256:c25df9738911ba96ac5cf91a503adc98bb467e31c835424d3f9cfd611978e5cb","observation_id":"c67356c9-fef1-474b-b6cd-a9eee42e6c1a","resolution":{"observed_at":"2026-08-11T18:11:54.410963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.02201","last_updated":"2019-11-21T07:01:02Z","snapshot_observed_at":"2026-07-06T08:19:18.253814Z","submitted_at":"2019-09-05T04:16:48Z","title":"Image Captioning with Very Scarce Supervised Data: Adversarial Semi-Supervised Learning Approach","version":2},"cited_work":{"arxiv_id":"1909.02201","doi":null,"metadata_source":"pith","pith_arxiv_id":"1909.02201","snapshot_observed_at":"2026-08-11T18:11:56.652822Z","title":"Image Captioning with Very Scarce Supervised Data: Adversarial Semi-Supervised Learning Approach","venue":"cs.CV","work_id":"276a9171-40ff-4e12-9842-9d4934ad07de","year":2019},"citing_paper":{"arxiv_id":"2412.08158","last_updated":"2024-12-11T07:29:04Z","snapshot_observed_at":"2026-08-12T07:36:23.412895Z","submitted_at":"2024-12-11T07:29:04Z","title":"How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T18:11:54.416016Z"},"links":{"cited_paper":"/paper/1909.02201","citing_paper":"/paper/2412.08158"},"observation_digest":"sha256:f9eb59c7dfb981ede21701a5483988514c0b95ce1ac20b43da6b4581eb1fcb53","observation_id":"621ba948-3326-426d-b485-20f283a3945a","resolution":{"observed_at":"2026-08-11T18:11:56.657530Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:11:54.421123Z","title":"Semi-supervised cross-modal retrieval with label prediction,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.08158","last_updated":"2024-12-11T07:29:04Z","snapshot_observed_at":"2026-08-12T07:36:23.412895Z","submitted_at":"2024-12-11T07:29:04Z","title":"How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T18:11:54.421123Z"},"links":{"citing_paper":"/paper/2412.08158"},"observation_digest":"sha256:384bb99dd737bd7c7de85ff73f60db1c6232f7cffe39d805dc91d2e115397ec7","observation_id":"3c8eb5e4-e7d0-4d0a-b407-e960894fd2f2","resolution":{"observed_at":"2026-08-11T18:11:54.421123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:11:54.425724Z","title":"Weakly supervised dense event captioning in videos,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.08158","last_updated":"2024-12-11T07:29:04Z","snapshot_observed_at":"2026-08-12T07:36:23.412895Z","submitted_at":"2024-12-11T07:29:04Z","title":"How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T18:11:54.425724Z"},"links":{"citing_paper":"/paper/2412.08158"},"observation_digest":"sha256:21b1aa0c47c235008de26bc011ca9235c6bb866266ac382e00ec657b771ba7fe","observation_id":"b693d6ff-cbd0-4b9c-9a8e-d07f25b26752","resolution":{"observed_at":"2026-08-11T18:11:54.425724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.04014","last_updated":"2021-09-09T03:21:32Z","snapshot_observed_at":"2026-08-11T06:40:01.779774Z","submitted_at":"2021-09-09T03:21:32Z","title":"Weakly-Supervised Visual-Retriever-Reader for Knowledge-based Question Answering","version":1},"cited_work":{"arxiv_id":"2109.04014","doi":null,"metadata_source":"pith","pith_arxiv_id":"2109.04014","snapshot_observed_at":"2026-08-11T18:11:56.630129Z","title":"Weakly-Supervised Visual-Retriever-Reader for Knowledge-based Question Answering","venue":"cs.CL","work_id":"b7310b3d-386f-43b2-bbcd-da4144e86f64","year":2021},"citing_paper":{"arxiv_id":"2412.08158","last_updated":"2024-12-11T07:29:04Z","snapshot_observed_at":"2026-08-12T07:36:23.412895Z","submitted_at":"2024-12-11T07:29:04Z","title":"How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T18:11:54.430275Z"},"links":{"cited_paper":"/paper/2109.04014","citing_paper":"/paper/2412.08158"},"observation_digest":"sha256:ccf3de7548daa562eb81111985e00a00c48115892fde9cddf3e72a4da0895f4a","observation_id":"827313f4-0b87-447e-ab64-b9be562b090f","resolution":{"observed_at":"2026-08-11T18:11:56.635511Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:11:54.435131Z","title":"Unsupervised image captioning,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.08158","last_updated":"2024-12-11T07:29:04Z","snapshot_observed_at":"2026-08-12T07:36:23.412895Z","submitted_at":"2024-12-11T07:29:04Z","title":"How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-11T18:11:54.435131Z"},"links":{"citing_paper":"/paper/2412.08158"},"observation_digest":"sha256:fc37fe1ab97e51bf791ef327ea9b5f1c1b6dd9735c35d2785cb84ffbd7fb0a85","observation_id":"76650929-8efa-47c4-bfce-76f3bac47aa4","resolution":{"observed_at":"2026-08-11T18:11:54.435131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:11:54.439820Z","title":"Towards unsupervised image captioning with shared multimodal embeddings,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.08158","last_updated":"2024-12-11T07:29:04Z","snapshot_observed_at":"2026-08-12T07:36:23.412895Z","submitted_at":"2024-12-11T07:29:04Z","title":"How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-11T18:11:54.439820Z"},"links":{"citing_paper":"/paper/2412.08158"},"observation_digest":"sha256:0e5b4bea61b026c4314a0de1dcfd428b31ab0c241f64304bd6eb4ee343d212f4","observation_id":"d0adeb38-a699-458e-9157-311fff23ffc9","resolution":{"observed_at":"2026-08-11T18:11:54.439820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:11:54.444320Z","title":"Zerocap: Zero-shot image-to-text generation for visual-semantic arithmetic,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.08158","last_updated":"2024-12-11T07:29:04Z","snapshot_observed_at":"2026-08-12T07:36:23.412895Z","submitted_at":"2024-12-11T07:29:04Z","title":"How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-11T18:11:54.444320Z"},"links":{"citing_paper":"/paper/2412.08158"},"observation_digest":"sha256:acdae6ed6ac42ef5cb98ff8c4ea0f6704c4d864116e9ad6a95a7455b8e2cfd51","observation_id":"1bc79c32-a43a-4665-926d-0ea5ddf24a4a","resolution":{"observed_at":"2026-08-11T18:11:54.444320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.02655","last_updated":"2022-05-30T19:45:05Z","snapshot_observed_at":"2026-08-11T01:58:52.550156Z","submitted_at":"2022-05-05T13:56:18Z","title":"Language Models Can See: Plugging Visual Controls in Text Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.02655","snapshot_observed_at":"2026-08-11T18:11:54.449739Z","title":"Language models can see: Plugging visual controls in text generation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.08158","last_updated":"2024-12-11T07:29:04Z","snapshot_observed_at":"2026-08-12T07:36:23.412895Z","submitted_at":"2024-12-11T07:29:04Z","title":"How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-11T18:11:54.449739Z"},"links":{"cited_paper":"/paper/2205.02655","citing_paper":"/paper/2412.08158"},"observation_digest":"sha256:6756156929f6131ddd9c094f445156306e9650218cd3d9dbb89c48c791e5fb98","observation_id":"1de9018c-e31b-4f18-9c49-fa2fd8f7f403","resolution":{"observed_at":"2026-08-11T18:11:54.449739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:11:54.454925Z","title":"Conzic: Controllable zero-shot image captioning by sampling-based polishing,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08158","last_updated":"2024-12-11T07:29:04Z","snapshot_observed_at":"2026-08-12T07:36:23.412895Z","submitted_at":"2024-12-11T07:29:04Z","title":"How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-11T18:11:54.454925Z"},"links":{"citing_paper":"/paper/2412.08158"},"observation_digest":"sha256:1241e2129a2021ffd7af2bdc2430890a7cddcf838c00c1a05492a1ec55842bf1","observation_id":"06928aad-7ea1-4ccd-9ff3-24df7dbc80c4","resolution":{"observed_at":"2026-08-11T18:11:54.454925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03715","last_updated":"2024-03-06T14:00:31Z","snapshot_observed_at":"2026-08-10T12:25:54.607997Z","submitted_at":"2024-03-06T14:00:31Z","title":"MeaCap: Memory-Augmented Zero-shot Image Captioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03715","snapshot_observed_at":"2026-08-11T18:11:54.459435Z","title":"Mea- cap: Memory-augmented zero-shot image captioning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08158","last_updated":"2024-12-11T07:29:04Z","snapshot_observed_at":"2026-08-12T07:36:23.412895Z","submitted_at":"2024-12-11T07:29:04Z","title":"How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-11T18:11:54.459435Z"},"links":{"cited_paper":"/paper/2403.03715","citing_paper":"/paper/2412.08158"},"observation_digest":"sha256:f75ac4fbb71f463f4447dcddb46f5f34f9a5341c60a1c8b217357964c36b6f28","observation_id":"c4fa8a1e-202f-488d-9e21-1d809851ea6d","resolution":{"observed_at":"2026-08-11T18:11:54.459435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:11:54.464285Z","title":"Text-only training for visual storytelling,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08158","last_updated":"2024-12-11T07:29:04Z","snapshot_observed_at":"2026-08-12T07:36:23.412895Z","submitted_at":"2024-12-11T07:29:04Z","title":"How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-11T18:11:54.464285Z"},"links":{"citing_paper":"/paper/2412.08158"},"observation_digest":"sha256:d01b27474e312ec453aef59a1bfb87a64494c6ec27d81533889efec2da87d170","observation_id":"f79e658c-c6a3-4275-b3c7-d2721a6cc561","resolution":{"observed_at":"2026-08-11T18:11:54.464285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.11100","last_updated":"2022-07-27T21:52:21Z","snapshot_observed_at":"2026-07-06T13:34:13.533549Z","submitted_at":"2022-07-22T14:19:31Z","title":"Zero-Shot Video Captioning with Evolving Pseudo-Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.11100","snapshot_observed_at":"2026-08-11T18:11:54.468557Z","title":"Zero- shot video captioning with evolving pseudo-tokens,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.08158","last_updated":"2024-12-11T07:29:04Z","snapshot_observed_at":"2026-08-12T07:36:23.412895Z","submitted_at":"2024-12-11T07:29:04Z","title":"How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-11T18:11:54.468557Z"},"links":{"cited_paper":"/paper/2207.11100","citing_paper":"/paper/2412.08158"},"observation_digest":"sha256:ebfcb56cb6b87ac7fb4f7fbd56bdeee5b5801fa0f98a54e5105a7821e7232d56","observation_id":"50cf5717-8a82-4a0f-a8c2-d066e766c04d","resolution":{"observed_at":"2026-08-11T18:11:54.468557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02682","last_updated":"2023-07-11T04:10:49Z","snapshot_observed_at":"2026-07-06T15:50:49.116859Z","submitted_at":"2023-07-05T23:01:26Z","title":"Zero-Shot Dense Video Captioning by Jointly Optimizing Text and Moment","version":2},"cited_work":{"arxiv_id":"2307.02682","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.02682","snapshot_observed_at":"2026-08-11T18:11:56.559095Z","title":"Zero-Shot Dense Video Captioning by Jointly Optimizing Text and Moment","venue":"cs.CV","work_id":"fa31f003-5a03-4df7-9046-d8aeb7127c93","year":2023},"citing_paper":{"arxiv_id":"2412.08158","last_updated":"2024-12-11T07:29:04Z","snapshot_observed_at":"2026-08-12T07:36:23.412895Z","submitted_at":"2024-12-11T07:29:04Z","title":"How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-11T18:11:54.473486Z"},"links":{"cited_paper":"/paper/2307.02682","citing_paper":"/paper/2412.08158"},"observation_digest":"sha256:559dc3fc6fa5107bcd20950f7eb10056f8217314d8096fa317d957dab76fc186","observation_id":"ade0ec7a-597a-4360-b8f9-d52de4825d53","resolution":{"observed_at":"2026-08-11T18:11:56.564086Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.07190","last_updated":"2022-03-14T15:29:27Z","snapshot_observed_at":"2026-08-11T23:32:35.888993Z","submitted_at":"2022-03-14T15:29:27Z","title":"CLIP Models are Few-shot Learners: Empirical Studies on VQA and Visual Entailment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.07190","snapshot_observed_at":"2026-08-11T18:11:54.478596Z","title":"Clip models are few-shot learners: Empirical studies on vqa and visual entailment,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.08158","last_updated":"2024-12-11T07:29:04Z","snapshot_observed_at":"2026-08-12T07:36:23.412895Z","submitted_at":"2024-12-11T07:29:04Z","title":"How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-11T18:11:54.478596Z"},"links":{"cited_paper":"/paper/2203.07190","citing_paper":"/paper/2412.08158"},"observation_digest":"sha256:16c3a5c01bfaff716b3ae7d156e04d6981671a8904ede1d6a1e482f4f1ad71f3","observation_id":"33f3847e-a73c-4d95-b38b-ffb1e24975a7","resolution":{"observed_at":"2026-08-11T18:11:54.478596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:11:54.482923Z","title":"Towards counterfactual image manipulation via clip,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.08158","last_updated":"2024-12-11T07:29:04Z","snapshot_observed_at":"2026-08-12T07:36:23.412895Z","submitted_at":"2024-12-11T07:29:04Z","title":"How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-11T18:11:54.482923Z"},"links":{"citing_paper":"/paper/2412.08158"},"observation_digest":"sha256:ea9c64fcd3962bdfc3c97c18a8c1f598860f047ab90e63ecb1eb3ce9f7c10f0a","observation_id":"91445399-f281-4bb0-aaa1-2d80af804f73","resolution":{"observed_at":"2026-08-11T18:11:54.482923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:11:54.487500Z","title":"An empirical study of gpt-3 for few-shot knowledge-based vqa,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.08158","last_updated":"2024-12-11T07:29:04Z","snapshot_observed_at":"2026-08-12T07:36:23.412895Z","submitted_at":"2024-12-11T07:29:04Z","title":"How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-11T18:11:54.487500Z"},"links":{"citing_paper":"/paper/2412.08158"},"observation_digest":"sha256:6a3ec4ec552bd3fe58bf56e58d5d55f656cb7ba5392a2426ba338fc8a91e9742","observation_id":"465e523a-e738-4514-8366-aefe48971188","resolution":{"observed_at":"2026-08-11T18:11:54.487500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.08773","last_updated":"2023-03-20T02:55:26Z","snapshot_observed_at":"2026-08-11T18:04:18.073470Z","submitted_at":"2022-10-17T06:29:54Z","title":"Plug-and-Play VQA: Zero-shot VQA by Conjoining Large Pretrained Models with Zero Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.08773","snapshot_observed_at":"2026-08-11T18:11:54.491641Z","title":"Plug-and- play vqa: Zero-shot vqa by conjoining large pretrained models with zero training,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.08158","last_updated":"2024-12-11T07:29:04Z","snapshot_observed_at":"2026-08-12T07:36:23.412895Z","submitted_at":"2024-12-11T07:29:04Z","title":"How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-11T18:11:54.491641Z"},"links":{"cited_paper":"/paper/2210.08773","citing_paper":"/paper/2412.08158"},"observation_digest":"sha256:8be4d9d761c5c94b5767b31b68be28b9195f10afd68357120c73bbb62a0e1702","observation_id":"525e4b92-0071-41d0-89d7-dcc4583a17f6","resolution":{"observed_at":"2026-08-11T18:11:54.491641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:11:54.496115Z","title":"Language models with image descriptors are strong few-shot video-language learners,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.08158","last_updated":"2024-12-11T07:29:04Z","snapshot_observed_at":"2026-08-12T07:36:23.412895Z","submitted_at":"2024-12-11T07:29:04Z","title":"How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-11T18:11:54.496115Z"},"links":{"citing_paper":"/paper/2412.08158"},"observation_digest":"sha256:67cacdcacf2faa3d710b33665bf5a8a0825d23ca73889cfb0682af24e5434ec2","observation_id":"60c89bcf-60fc-4346-b080-90997eed73af","resolution":{"observed_at":"2026-08-11T18:11:54.496115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10783","last_updated":"2023-09-19T17:32:21Z","snapshot_observed_at":"2026-07-06T16:20:40.674175Z","submitted_at":"2023-09-19T17:32:21Z","title":"Language as the Medium: Multimodal Video Classification through text only","version":1},"cited_work":{"arxiv_id":"2309.10783","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.10783","snapshot_observed_at":"2026-08-11T18:11:56.502674Z","title":"Language as the Medium: Multimodal Video Classification through text only","venue":"cs.CV","work_id":"4ea45c71-608d-4efb-8b48-0b9b2ab5929f","year":2023},"citing_paper":{"arxiv_id":"2412.08158","last_updated":"2024-12-11T07:29:04Z","snapshot_observed_at":"2026-08-12T07:36:23.412895Z","submitted_at":"2024-12-11T07:29:04Z","title":"How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-11T18:11:54.500386Z"},"links":{"cited_paper":"/paper/2309.10783","citing_paper":"/paper/2412.08158"},"observation_digest":"sha256:f277e000a110430fa4b6e69c49564ae89d57be8ecdfded9dc3cb4b2024f07f76","observation_id":"db0487ce-303f-4a8d-b77b-6d2977114b46","resolution":{"observed_at":"2026-08-11T18:11:56.508315Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.09758","last_updated":"2023-10-26T10:08:31Z","snapshot_observed_at":"2026-07-06T15:28:20.821441Z","submitted_at":"2023-05-16T19:13:11Z","title":"A Video Is Worth 4096 Tokens: Verbalize Videos To Understand Them In Zero Shot","version":3},"cited_work":{"arxiv_id":"2305.09758","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.09758","snapshot_observed_at":"2026-08-11T18:11:56.481653Z","title":"A Video Is Worth 4096 Tokens: Verbalize Videos To Understand Them In Zero Shot","venue":"cs.CV","work_id":"a4d0539b-a1f3-4721-b59d-737d1e7980dc","year":2023},"citing_paper":{"arxiv_id":"2412.08158","last_updated":"2024-12-11T07:29:04Z","snapshot_observed_at":"2026-08-12T07:36:23.412895Z","submitted_at":"2024-12-11T07:29:04Z","title":"How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-11T18:11:54.506310Z"},"links":{"cited_paper":"/paper/2305.09758","citing_paper":"/paper/2412.08158"},"observation_digest":"sha256:2b9cce4c6a3b9f7963019b0a740ff755ef4f6940b639d4aecce7afbb1ac1f058","observation_id":"01040397-161d-470d-b440-3202c125e6b5","resolution":{"observed_at":"2026-08-11T18:11:56.486309Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11732","last_updated":"2023-06-15T20:56:20Z","snapshot_observed_at":"2026-08-09T18:50:50.538190Z","submitted_at":"2023-06-15T20:56:20Z","title":"Retrieving-to-Answer: Zero-Shot Video Question Answering with Frozen Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.11732","snapshot_observed_at":"2026-08-11T18:11:54.511203Z","title":"Retrieving-to-answer: Zero-shot video question answering with frozen large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08158","last_updated":"2024-12-11T07:29:04Z","snapshot_observed_at":"2026-08-12T07:36:23.412895Z","submitted_at":"2024-12-11T07:29:04Z","title":"How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-11T18:11:54.511203Z"},"links":{"cited_paper":"/paper/2306.11732","citing_paper":"/paper/2412.08158"},"observation_digest":"sha256:2fdd688f68cd1a6562bdd347f722019f09ac6a146d4ea09f2110400c0429d170","observation_id":"a32b45dd-6a49-4ecb-8d6a-4a7ac9906df4","resolution":{"observed_at":"2026-08-11T18:11:54.511203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00575","last_updated":"2022-11-01T16:36:01Z","snapshot_observed_at":"2026-07-06T14:13:07.158001Z","submitted_at":"2022-11-01T16:36:01Z","title":"Text-Only Training for Image Captioning using Noise-Injected CLIP","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.00575","snapshot_observed_at":"2026-08-11T18:11:54.516711Z","title":"Text-only training for image captioning using noise-injected clip,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.08158","last_updated":"2024-12-11T07:29:04Z","snapshot_observed_at":"2026-08-12T07:36:23.412895Z","submitted_at":"2024-12-11T07:29:04Z","title":"How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-11T18:11:54.516711Z"},"links":{"cited_paper":"/paper/2211.00575","citing_paper":"/paper/2412.08158"},"observation_digest":"sha256:a489245b3e97076a705f22299b3faea4b503aa8a12fe0214397922153ae45e0b","observation_id":"295e36b9-0db3-4fc6-8ef7-a83019bf49f5","resolution":{"observed_at":"2026-08-11T18:11:54.516711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09778","last_updated":"2023-08-18T23:43:42Z","snapshot_observed_at":"2026-08-10T02:43:42.250376Z","submitted_at":"2022-11-17T18:52:19Z","title":"I Can't Believe There's No Images! Learning Visual Tasks Using only Language Supervision","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09778","snapshot_observed_at":"2026-08-11T18:11:54.521893Z","title":"I can’t believe there’s no images! learning visual tasks using only language data,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.08158","last_updated":"2024-12-11T07:29:04Z","snapshot_observed_at":"2026-08-12T07:36:23.412895Z","submitted_at":"2024-12-11T07:29:04Z","title":"How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-11T18:11:54.521893Z"},"links":{"cited_paper":"/paper/2211.09778","citing_paper":"/paper/2412.08158"},"observation_digest":"sha256:c162a431cf84d5e8c481d929273318238628147f43a61ce4fdb74dcdca1db0cc","observation_id":"a7fc2b48-b02b-4eb6-aade-2f88c4a4e2cc","resolution":{"observed_at":"2026-08-11T18:11:54.521893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03032","last_updated":"2023-03-06T11:02:47Z","snapshot_observed_at":"2026-08-05T10:22:16.844750Z","submitted_at":"2023-03-06T11:02:47Z","title":"DeCap: Decoding CLIP Latents for Zero-Shot Captioning via Text-Only Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03032","snapshot_observed_at":"2026-08-11T18:11:54.526672Z","title":"Decap: Decoding clip la- tents for zero-shot captioning via text-only training,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08158","last_updated":"2024-12-11T07:29:04Z","snapshot_observed_at":"2026-08-12T07:36:23.412895Z","submitted_at":"2024-12-11T07:29:04Z","title":"How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-11T18:11:54.526672Z"},"links":{"cited_paper":"/paper/2303.03032","citing_paper":"/paper/2412.08158"},"observation_digest":"sha256:96f22b62a37d1c09724f19720dec8b8388301ba65939e7cbfc42ad7294b718b1","observation_id":"a6ef1573-ff90-4843-9aa7-833e60eea867","resolution":{"observed_at":"2026-08-11T18:11:54.526672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13273","last_updated":"2023-05-08T02:29:28Z","snapshot_observed_at":"2026-07-06T15:20:05.729156Z","submitted_at":"2023-04-26T04:06:20Z","title":"From Association to Generation: Text-only Captioning by Unsupervised Cross-modal Mapping","version":3},"cited_work":{"arxiv_id":"2304.13273","doi":null,"metadata_source":"pith","pith_arxiv_id":"2304.13273","snapshot_observed_at":"2026-08-11T18:11:56.394541Z","title":"From Association to Generation: Text-only Captioning by Unsupervised Cross-modal Mapping","venue":"cs.CV","work_id":"8d47cfb4-7bf4-444c-8dec-8da8bd684a91","year":2023},"citing_paper":{"arxiv_id":"2412.08158","last_updated":"2024-12-11T07:29:04Z","snapshot_observed_at":"2026-08-12T07:36:23.412895Z","submitted_at":"2024-12-11T07:29:04Z","title":"How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-11T18:11:54.531612Z"},"links":{"cited_paper":"/paper/2304.13273","citing_paper":"/paper/2412.08158"},"observation_digest":"sha256:c720a1b33603fd18feae8aeee6b1df022248ad6b5f0a04e5bf6e34dd88e5714a","observation_id":"5564bba4-21b8-4a19-9800-9fd834cb580c","resolution":{"observed_at":"2026-08-11T18:11:56.400451Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.07275","last_updated":"2022-11-14T11:12:19Z","snapshot_observed_at":"2026-08-11T23:30:15.564314Z","submitted_at":"2022-11-14T11:12:19Z","title":"Zero-shot Image Captioning by Anchor-augmented Vision-Language Space Alignment","version":1},"cited_work":{"arxiv_id":"2211.07275","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.07275","snapshot_observed_at":"2026-08-11T18:11:56.372278Z","title":"Zero-shot Image Captioning by Anchor-augmented Vision-Language Space Alignment","venue":"cs.CV","work_id":"59f0d15b-91fe-4ff5-a314-bec180d0e5b8","year":2022},"citing_paper":{"arxiv_id":"2412.08158","last_updated":"2024-12-11T07:29:04Z","snapshot_observed_at":"2026-08-12T07:36:23.412895Z","submitted_at":"2024-12-11T07:29:04Z","title":"How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-11T18:11:54.536179Z"},"links":{"cited_paper":"/paper/2211.07275","citing_paper":"/paper/2412.08158"},"observation_digest":"sha256:8d8c3c15247a103335c6956bce0c8f4d012d46cb8491f91a5b5523f4fe9625b3","observation_id":"e8d35d51-2e52-48f2-9935-f296ab10917f","resolution":{"observed_at":"2026-08-11T18:11:56.377916Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:11:54.540954Z","title":"Transferable decoding with visual entities for zero-shot image captioning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08158","last_updated":"2024-12-11T07:29:04Z","snapshot_observed_at":"2026-08-12T07:36:23.412895Z","submitted_at":"2024-12-11T07:29:04Z","title":"How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-11T18:11:54.540954Z"},"links":{"citing_paper":"/paper/2412.08158"},"observation_digest":"sha256:ba5ee523ee6825eddd0b1545856eb3495180c2acfd4cbc6b0c36d5e6aa59b1c9","observation_id":"21e5e519-d460-4f18-83e6-26aa7154c4f2","resolution":{"observed_at":"2026-08-11T18:11:54.540954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:11:54.545994Z","title":"Language-free training for zero-shot video grounding,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08158","last_updated":"2024-12-11T07:29:04Z","snapshot_observed_at":"2026-08-12T07:36:23.412895Z","submitted_at":"2024-12-11T07:29:04Z","title":"How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-11T18:11:54.545994Z"},"links":{"citing_paper":"/paper/2412.08158"},"observation_digest":"sha256:fb1af51b45ab8d20db54f2ea676f07c374c7bbe51c92be5434a0b75edcf82b39","observation_id":"1dde8750-f1fc-4f1c-b7dc-89205ee3b4f7","resolution":{"observed_at":"2026-08-11T18:11:54.545994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.00386","last_updated":"2022-03-01T12:11:32Z","snapshot_observed_at":"2026-07-06T12:42:48.355901Z","submitted_at":"2022-03-01T12:11:32Z","title":"CLIP-GEN: Language-Free Training of a Text-to-Image Generator with CLIP","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.00386","snapshot_observed_at":"2026-08-11T18:11:54.551267Z","title":"Clip-gen: Language- free training of a text-to-image generator with clip,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.08158","last_updated":"2024-12-11T07:29:04Z","snapshot_observed_at":"2026-08-12T07:36:23.412895Z","submitted_at":"2024-12-11T07:29:04Z","title":"How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-11T18:11:54.551267Z"},"links":{"cited_paper":"/paper/2203.00386","citing_paper":"/paper/2412.08158"},"observation_digest":"sha256:e4987fd0c8fc23e8a070ac2626386154559be7d223509b04d13088b58b72eb8f","observation_id":"7b895ac4-d2b2-4224-9f9e-fff8f3f4666c","resolution":{"observed_at":"2026-08-11T18:11:54.551267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:11:54.556270Z","title":"Image captioning with multi-context synthetic data,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08158","last_updated":"2024-12-11T07:29:04Z","snapshot_observed_at":"2026-08-12T07:36:23.412895Z","submitted_at":"2024-12-11T07:29:04Z","title":"How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-11T18:11:54.556270Z"},"links":{"citing_paper":"/paper/2412.08158"},"observation_digest":"sha256:fd789d48aa3973d25fd3581cf55443e50b0422c7b95c89ea543e18d673b1c958","observation_id":"14f7226d-3ea3-4178-97d3-a69d0bcd57cb","resolution":{"observed_at":"2026-08-11T18:11:54.556270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:11:54.560774Z","title":"Improving cross-modal alignment with synthetic pairs for text-only image captioning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08158","last_updated":"2024-12-11T07:29:04Z","snapshot_observed_at":"2026-08-12T07:36:23.412895Z","submitted_at":"2024-12-11T07:29:04Z","title":"How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-11T18:11:54.560774Z"},"links":{"citing_paper":"/paper/2412.08158"},"observation_digest":"sha256:331ddf90c57079d244249bcdf8e70cfb7b7a4433de8ce693110d7ae361bc069a","observation_id":"551c90a3-e164-4757-bce3-a4d6b755947b","resolution":{"observed_at":"2026-08-11T18:11:54.560774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.15160","last_updated":"2023-10-23T17:57:27Z","snapshot_observed_at":"2026-08-11T20:29:10.627051Z","submitted_at":"2023-10-23T17:57:27Z","title":"FreeMask: Synthetic Images with Dense Annotations Make Stronger Segmentation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.15160","snapshot_observed_at":"2026-08-11T18:11:54.565504Z","title":"Freemask: Synthetic images with dense annotations make stronger segmentation models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08158","last_updated":"2024-12-11T07:29:04Z","snapshot_observed_at":"2026-08-12T07:36:23.412895Z","submitted_at":"2024-12-11T07:29:04Z","title":"How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-11T18:11:54.565504Z"},"links":{"cited_paper":"/paper/2310.15160","citing_paper":"/paper/2412.08158"},"observation_digest":"sha256:2c309ab1458adcb30e207dafe05989477cb437f5207ffe66890f10ce62dee7cc","observation_id":"cb24d4eb-5337-48b7-97d5-be80ac94b343","resolution":{"observed_at":"2026-08-11T18:11:54.565504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:11:54.570501Z","title":"Towards language-free training for text-to-image generation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.08158","last_updated":"2024-12-11T07:29:04Z","snapshot_observed_at":"2026-08-12T07:36:23.412895Z","submitted_at":"2024-12-11T07:29:04Z","title":"How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-11T18:11:54.570501Z"},"links":{"citing_paper":"/paper/2412.08158"},"observation_digest":"sha256:ca54a5b0f5c9aea701695cffef3b65f48870e88fd03345ae1e696f54ad704325","observation_id":"72c2b9e4-9c40-43c3-b8f6-f4e782951e39","resolution":{"observed_at":"2026-08-11T18:11:54.570501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.05226","last_updated":"2023-01-12T18:59:50Z","snapshot_observed_at":"2026-08-10T21:35:59.413244Z","submitted_at":"2023-01-12T18:59:50Z","title":"See, Think, Confirm: Interactive Prompting Between Vision and Language Models for Knowledge-based Visual Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.05226","snapshot_observed_at":"2026-08-11T18:11:54.574723Z","title":"See, think, confirm: Interactive prompting between vision and language models for knowledge-based visual reasoning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08158","last_updated":"2024-12-11T07:29:04Z","snapshot_observed_at":"2026-08-12T07:36:23.412895Z","submitted_at":"2024-12-11T07:29:04Z","title":"How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-11T18:11:54.574723Z"},"links":{"cited_paper":"/paper/2301.05226","citing_paper":"/paper/2412.08158"},"observation_digest":"sha256:98a5b0437df73c1c2cbd92eb84e17c4347e3db1adcc1ef275fe51f71a154a252","observation_id":"1e7d941f-6c12-4b9e-90a4-30d6526632be","resolution":{"observed_at":"2026-08-11T18:11:54.574723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05872","last_updated":"2024-05-17T17:24:35Z","snapshot_observed_at":"2026-08-10T07:14:05.908769Z","submitted_at":"2023-10-09T17:10:35Z","title":"ViCor: Bridging Visual Understanding and Commonsense Reasoning with Large Language Models","version":2},"cited_work":{"arxiv_id":"2310.05872","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.05872","snapshot_observed_at":"2026-08-11T18:11:56.296124Z","title":"ViCor: Bridging Visual Understanding and Commonsense Reasoning with Large Language Models","venue":"cs.CV","work_id":"3412a73d-a177-4564-a28b-6ff8f31197b6","year":2023},"citing_paper":{"arxiv_id":"2412.08158","last_updated":"2024-12-11T07:29:04Z","snapshot_observed_at":"2026-08-12T07:36:23.412895Z","submitted_at":"2024-12-11T07:29:04Z","title":"How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-11T18:11:54.578985Z"},"links":{"cited_paper":"/paper/2310.05872","citing_paper":"/paper/2412.08158"},"observation_digest":"sha256:f62f7e019cf9ea4a6f4c6626c0585866cab9c7132394b2c146f3120b4513a77c","observation_id":"a2289860-351f-43ba-aac1-583212c2a10b","resolution":{"observed_at":"2026-08-11T18:11:56.301186Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02804","last_updated":"2023-10-04T13:29:47Z","snapshot_observed_at":"2026-08-12T07:34:20.228852Z","submitted_at":"2023-10-04T13:29:47Z","title":"DOMINO: A Dual-System for Multi-step Visual Language Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02804","snapshot_observed_at":"2026-08-11T18:11:54.583677Z","title":"Domino: A dual-system for multi-step visual language reasoning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08158","last_updated":"2024-12-11T07:29:04Z","snapshot_observed_at":"2026-08-12T07:36:23.412895Z","submitted_at":"2024-12-11T07:29:04Z","title":"How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-11T18:11:54.583677Z"},"links":{"cited_paper":"/paper/2310.02804","citing_paper":"/paper/2412.08158"},"observation_digest":"sha256:b7854cef219c14f24b19efcf9c40cb20e6b4c4ecf293577fd34a42e534857a0e","observation_id":"098f0d44-7b83-40e2-8474-5d52c8782d03","resolution":{"observed_at":"2026-08-11T18:11:54.583677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:11:54.588732Z","title":"IdealGPT: Iteratively decomposing vision and language reasoning via large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08158","last_updated":"2024-12-11T07:29:04Z","snapshot_observed_at":"2026-08-12T07:36:23.412895Z","submitted_at":"2024-12-11T07:29:04Z","title":"How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-11T18:11:54.588732Z"},"links":{"citing_paper":"/paper/2412.08158"},"observation_digest":"sha256:e451c2640e3128cbdec317d31fc8b1dc93ead077ecbc8c7a0de57957882180bb","observation_id":"37d12aea-6eab-41bc-8174-cfae4e241446","resolution":{"observed_at":"2026-08-11T18:11:54.588732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.01598","last_updated":"2023-12-09T00:08:46Z","snapshot_observed_at":"2026-08-09T12:34:19.035691Z","submitted_at":"2023-12-04T03:18:51Z","title":"Good Questions Help Zero-Shot Image Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.01598","snapshot_observed_at":"2026-08-11T18:11:54.593526Z","title":"Good questions help zero-shot image reasoning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08158","last_updated":"2024-12-11T07:29:04Z","snapshot_observed_at":"2026-08-12T07:36:23.412895Z","submitted_at":"2024-12-11T07:29:04Z","title":"How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-11T18:11:54.593526Z"},"links":{"cited_paper":"/paper/2312.01598","citing_paper":"/paper/2412.08158"},"observation_digest":"sha256:3f1724ffde9d259e606855cd1f9af2b8b08f40ec1aa572a3cb8c8031a7574e5a","observation_id":"9670f636-c851-4df2-a8c3-24a601df6408","resolution":{"observed_at":"2026-08-11T18:11:54.593526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:11:54.598411Z","title":"The art of SOCRATIC QUESTIONING: Recursive thinking with large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08158","last_updated":"2024-12-11T07:29:04Z","snapshot_observed_at":"2026-08-12T07:36:23.412895Z","submitted_at":"2024-12-11T07:29:04Z","title":"How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-11T18:11:54.598411Z"},"links":{"citing_paper":"/paper/2412.08158"},"observation_digest":"sha256:76df1879acadc4ef7cf30d4ef4edd67c55ee046224a1df1b54cfea8f6dacb962","observation_id":"4e8bd70e-00ea-4de7-b212-7bafd3efbe37","resolution":{"observed_at":"2026-08-11T18:11:54.598411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:11:54.602828Z","title":"Filling the image information gap for VQA: Prompting large language models to proactively ask questions,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08158","last_updated":"2024-12-11T07:29:04Z","snapshot_observed_at":"2026-08-12T07:36:23.412895Z","submitted_at":"2024-12-11T07:29:04Z","title":"How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-11T18:11:54.602828Z"},"links":{"citing_paper":"/paper/2412.08158"},"observation_digest":"sha256:1b1626eedc3ee214f8d31d8f675cc90daa5739317e1576914f0a8babcb99e161","observation_id":"2b38e2a4-fbac-4dca-9f5e-b4890fd7db45","resolution":{"observed_at":"2026-08-11T18:11:54.602828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.08922","last_updated":"2023-09-16T08:22:22Z","snapshot_observed_at":"2026-08-09T10:14:00.875468Z","submitted_at":"2023-09-16T08:22:22Z","title":"Multimodal Multi-Hop Question Answering Through a Conversation Between Tools and Efficiently Finetuned Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.08922","snapshot_observed_at":"2026-08-11T18:11:54.607488Z","title":"Multimodal multi-hop question answering through a conversation between tools and efficiently finetuned large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08158","last_updated":"2024-12-11T07:29:04Z","snapshot_observed_at":"2026-08-12T07:36:23.412895Z","submitted_at":"2024-12-11T07:29:04Z","title":"How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-11T18:11:54.607488Z"},"links":{"cited_paper":"/paper/2309.08922","citing_paper":"/paper/2412.08158"},"observation_digest":"sha256:fb710a4bd2f6deed7398ed61aff142588a9ea543fe6fd789a9d19762d817141c","observation_id":"8fb3cfa1-2d26-4465-b9ad-035fa9fb644c","resolution":{"observed_at":"2026-08-11T18:11:54.607488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:11:54.612605Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.08158","last_updated":"2024-12-11T07:29:04Z","snapshot_observed_at":"2026-08-12T07:36:23.412895Z","submitted_at":"2024-12-11T07:29:04Z","title":"How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-11T18:11:54.612605Z"},"links":{"citing_paper":"/paper/2412.08158"},"observation_digest":"sha256:fc1acff41a90381eb3aa8763aed7c53d63b984ca0049e9d3d86d929becebed47","observation_id":"f6e5080b-05b7-40a7-9c26-0962906a8d4a","resolution":{"observed_at":"2026-08-11T18:11:54.612605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-08-11T00:52:12.225793Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-11T18:11:54.616979Z","title":"Multimodal chain-of-thought reasoning in language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08158","last_updated":"2024-12-11T07:29:04Z","snapshot_observed_at":"2026-08-12T07:36:23.412895Z","submitted_at":"2024-12-11T07:29:04Z","title":"How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-11T18:11:54.616979Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2412.08158"},"observation_digest":"sha256:aa88ddf179b9648c01f19d467b63766d2203bc062cb50d8e157d86fc207edbe6","observation_id":"8dd6dd2c-66ee-4dad-b0b4-aad6157d1847","resolution":{"observed_at":"2026-08-11T18:11:54.616979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:11:54.622299Z","title":"T-sciq: Teaching multimodal chain-of-thought reasoning via large language model signals for science question answering,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08158","last_updated":"2024-12-11T07:29:04Z","snapshot_observed_at":"2026-08-12T07:36:23.412895Z","submitted_at":"2024-12-11T07:29:04Z","title":"How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-11T18:11:54.622299Z"},"links":{"citing_paper":"/paper/2412.08158"},"observation_digest":"sha256:1ce93cfee134c2c2e218a7c67ecce8790735c9f28da99bebf7280c0de22d13ec","observation_id":"bd57b404-b707-4b78-8729-20a2c0ed20ea","resolution":{"observed_at":"2026-08-11T18:11:54.622299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12863","last_updated":"2024-01-23T15:56:11Z","snapshot_observed_at":"2026-08-12T06:41:06.301896Z","submitted_at":"2024-01-23T15:56:11Z","title":"KAM-CoT: Knowledge Augmented Multimodal Chain-of-Thoughts Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12863","snapshot_observed_at":"2026-08-11T18:11:54.627119Z","title":"Kam-cot: Knowledge augmented multimodal chain-of-thoughts reasoning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08158","last_updated":"2024-12-11T07:29:04Z","snapshot_observed_at":"2026-08-12T07:36:23.412895Z","submitted_at":"2024-12-11T07:29:04Z","title":"How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-11T18:11:54.627119Z"},"links":{"cited_paper":"/paper/2401.12863","citing_paper":"/paper/2412.08158"},"observation_digest":"sha256:1e2d18ba1e1d3c028f7aaaf8f3a9e558d0c0d9b0afce4a1018f3c9b3676c2c04","observation_id":"170d0af2-a920-4136-be48-68ded2fa38b2","resolution":{"observed_at":"2026-08-11T18:11:54.627119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.04461","last_updated":"2024-03-19T21:48:59Z","snapshot_observed_at":"2026-08-11T16:31:16.206115Z","submitted_at":"2023-09-08T17:49:44Z","title":"Measuring and Improving Chain-of-Thought Reasoning in Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.04461","snapshot_observed_at":"2026-08-11T18:11:54.632569Z","title":"Measuring and improving chain-of-thought reasoning in vision-language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08158","last_updated":"2024-12-11T07:29:04Z","snapshot_observed_at":"2026-08-12T07:36:23.412895Z","submitted_at":"2024-12-11T07:29:04Z","title":"How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-11T18:11:54.632569Z"},"links":{"cited_paper":"/paper/2309.04461","citing_paper":"/paper/2412.08158"},"observation_digest":"sha256:3ffd12634083e6882f710ee4fab542266f1bde75c58b45df04fcddc6ec814933","observation_id":"c4cdba88-c0cf-4eb1-a42a-def771209950","resolution":{"observed_at":"2026-08-11T18:11:54.632569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.08158","last_updated":"2024-12-11T07:29:04Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T07:36:23.412895Z","submitted_at":"2024-12-11T07:29:04Z","title":"How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":92,"verified_exact":8,"verified_fuzzy":0},"total_outbound_references":229},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 100 of 229 outbound references and 0 inbound Pith citation observations for arXiv:2412.08158."}