Typed states for the displayed outbound observations.
Source: paper_references, paper_reference_links, observed 2026-08-11T00:47:12.490079Z
Paper Citation Record · LEDGER
As of 11 August 2026, this Paper Citation Record lists 100 of 145 outbound references and 4 inbound Pith citation observations for arXiv:2412.19326.
A citation records a reference. It does not transfer a finding from one paper to another.
Typed states for the displayed outbound observations.
Source: paper_references, paper_reference_links, observed 2026-08-11T00:47:12.490079Z
One-hop event checks from named stored sources.
Source: scholarly_work_events, retraction_status_cache, observed 2026-08-11T06:34:44.6726+00:00
Pith citing papers itemized under the disclosed page cap.
Source: paper_references, paper_reference_links, observed 2026-08-06T23:29:27.161964Z
A source-named dated measurement, never combined with another source.
Source: arxiv_reference, observed 2026-05-17T02:52:20.802634Z
100 of 145 outbound references displayed
External citation measurements
No source-named external measurement is stored.
Observation 9dcb825f-4a07-478f-a8e6-852011335249 · outbound
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment GPT-4 Technical Report
Reference 1
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 762f1c23-3290-47f3-8dc5-755aefd961c1 · outbound
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models
Reference 2
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation efa4fd45-a338-41c0-b712-a49a9d2a9a93 · outbound
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Qwen Technical Report
Reference 3
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 67b764e6-ebbf-45d8-b686-1d2f6f81c332 · outbound
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment One Token to Seg Them All: Language Instructed Reasoning Segmentation in Videos
Reference 4
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation f21a84f0-3855-42c1-9209-28ef34555fb3 · outbound
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Fully-convolutional siamese networks for object tracking
Reference 5
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 4a7d8b0f-fdfc-451a-88c0-57cdf44b2830 · outbound
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Activitynet: A large-scale video benchmark for human activity understanding
Reference 6
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation cb805870-40c4-4245-a772-0fb8138759ad · outbound
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Fengwu: Pushing the skillful global medium- range weather forecast beyond 10 days lead
Reference 7
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation bd164ced-73d1-4608-84b4-3ec7f999f3a2 · outbound
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic
Reference 8
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation b6c2acca-666b-4c43-a27b-fc5c8a996300 · outbound
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment ShareGPT4V: Improving Large Multi-Modal Models with Better Captions
Reference 9
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 052ffdf0-131c-43b2-873f-1e6212d75485 · outbound
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Sharegpt4v: Improving large multi-modal models with better captions
Reference 10
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 6c4c4aab-e7c2-4666-a51d-e9e39f8c8b7a · outbound
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment ShareGPT4Video: Improving Video Understanding and Generation with Better Captions
Reference 11
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 2d1d871c-f622-416a-a8cb-99956a10c789 · outbound
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment A simple framework for contrastive learn- ing of visual representations
Reference 12
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 725111f0-c607-4934-aabc-5aae54cb1bef · outbound
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks
Reference 13
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 96e0e322-71e4-4521-9393-77405d9a80ae · outbound
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Efficient and Effective Text Encoding for Chinese LLaMA and Alpaca
Reference 14
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 87b74af6-5723-46e1-863c-b056a89acf75 · outbound
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Atom: Accurate tracking by overlap maximization
Reference 15
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 56b2fe7b-5ba8-42ed-a39b-18312df4226e · outbound
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment A thousand frames in just a few words: Lingual description of videos through latent topics and sparse object stitching
Reference 16
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 00310f74-8531-48f9-9c63-14b0144895d4 · outbound
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment MeViS: A large-scale benchmark for video segmentation with motion expressions
Reference 17
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 1840cf52-86e3-452e-8ca4-4fdc90c06e0f · outbound
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment InternLM-XComposer2: Mastering Free-form Text-Image Composition and Comprehension in Vision-Language Large Model
Reference 18
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation da3f08b3-c0d2-4455-a27d-9daa61268863 · outbound
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Palm-e: An embodied multimodal language model
Reference 19
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation c1215d70-ce8b-46aa-b293-e19a678c0ff2 · outbound
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Lasot: A high-quality benchmark for large-scale sin- gle object tracking
Reference 20
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 527dba99-44c9-4d31-a891-4e245b4bf354 · outbound
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis
Reference 21
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation e6eb339c-e42c-414f-af2a-c9450e2702c8 · outbound
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment An empirical study of end-to-end video-language transformers with masked vi- sual modeling
Reference 22
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 3374056e-b088-4018-b786-f7c624f794a8 · outbound
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Tall: Temporal activity localization via language query
Reference 23
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation a8c44783-2dfe-4ecd-b387-d1d18ecdbc36 · outbound
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Ego4d: Around the world in 3,000 hours of egocentric video
Reference 24
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation fa62e8f4-d0c9-4074-af60-e8cad2739f49 · outbound
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Momentum contrast for unsupervised visual rep- resentation learning
Reference 25
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation b2db24cf-c442-4e89-aca1-d867c3a2d165 · outbound
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Localizing mo- ments in video with natural language
Reference 26
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 4df2d7f4-754d-4078-a66e-3755084cec88 · outbound
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Lora: Low- rank adaptation of large language models
Reference 27
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 1d862bc8-9fcb-48d3-90be-7c045f2f791c · outbound
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Vtimellm: Empower llm to grasp video mo- ments
Reference 28
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 174cdd31-72e7-49ff-ba71-2709e7ff8943 · outbound
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Got-10k: A large high-diversity benchmark for generic object tracking in the wild
Reference 29
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 91aadbb5-b327-43ee-9673-e360eb89370d · outbound
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Mistral 7B
Reference 30
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 4588e631-24e4-463b-abcb-8cbbfa43e80f · outbound
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Sparse sharing relation network for panoptic driving perception
Reference 31
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation ac1519dd-4912-4649-9aad-a73762a0f331 · outbound
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Chat-univi: Unified visual representation em- powers large language models with image and video under- standing
Reference 32
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 6a1416b0-dba8-4eb8-a22a-a93777d61210 · outbound
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Language Repository for Long Video Understanding
Reference 33
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation d4a16e49-f30d-4f47-a61e-da87de2b95c4 · outbound
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Bert: Pre-training of deep bidirectional trans- formers for language understanding
Reference 34
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation dc741ad8-f90d-4201-a667-e11909356d96 · outbound
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Segment anything
Reference 35
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 4d1eee41-3aba-419b-84d6-b2f9c1ed9a02 · outbound
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Visual genome: Connecting language and vision using crowdsourced dense image annotations
Reference 36
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 483cf381-cdaa-4c04-a336-644dc5bcace0 · outbound
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Lisa: Reasoning segmenta- tion via large language model
Reference 37
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 9d4f8ff6-b2c6-4b46-b65d-83a55ae01d0b · outbound
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Detecting mo- ments and highlights in videos via natural language queries
Reference 38
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 3e441280-5a69-4a81-9093-da47acfcb776 · outbound
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment SiamRPN++: Evolution of siamese visual tracking with very deep networks
Reference 39
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation aa491ba9-b8ea-41c7-ab2e-59cbc3a38dcf · outbound
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Seed-bench: Bench- marking multimodal large language models
Reference 40
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation f8bebfc0-b866-4763-aef4-58a647a6b53c · outbound
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment LLaVA-OneVision: Easy Visual Task Transfer
Reference 42
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation e0323e11-6fcc-49e0-be01-07331a41f31d · outbound
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models
Reference 43
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation b2b8dbfe-24e3-49e3-b60b-099c9887404e · outbound
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Uni-perceiver v2: A generalist model for large-scale vision and vision-language tasks
Reference 44
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation a1dfefc3-b266-4371-bdd5-809b4224b1cc · outbound
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models
Reference 45
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation bc44888b-8097-4936-ade0-db1a18d98b24 · outbound
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment VideoChat: Chat-Centric Video Understanding
Reference 46
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation fad59bd5-0922-4de9-a41e-8df0a5f489eb · outbound
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Unmasked teacher: Towards training-efficient video foundation models
Reference 47
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation bdc73eca-2634-4f3e-aa64-e621c3e803e8 · outbound
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Mvbench: A comprehensive multi-modal video under- standing benchmark
Reference 48
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation c13ec71b-bf5f-49dd-9338-dff9dac4361f · outbound
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Video-LLaVA: Learning United Visual Representation by Alignment Before Projection
Reference 49
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 9fcd10b2-ebe7-4196-aa91-09b95183cdb2 · outbound
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Univtg: Towards unified video- language temporal grounding
Reference 50
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation c7984272-a9f4-4441-b274-3554065941cf · outbound
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Visual instruction tuning
Reference 51
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 09c50c66-4d0c-4c60-b7f3-235b2c9d26a9 · outbound
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment St-llm: Large language models are effective temporal learners
Reference 52
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 34c63680-e0c1-4889-8d82-48ce724812de · outbound
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Grounding dino: Marrying dino with grounded pre-training for open-set object detection
Reference 53
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation d809c351-6fd8-452c-a66d-568c620d301d · outbound
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Decoupled Weight Decay Regularization
Reference 54
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 3defb2b0-6e33-438f-9072-c5d2d5a88ec6 · outbound
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Unified-io: A uni- fied model for vision, language, and multi-modal tasks
Reference 55
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation c1b178b1-1e35-4331-b275-62fea2903a2d · outbound
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment VideoGPT+: Integrating Image and Video Encoders for Enhanced Video Understanding
Reference 56
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 8c743a22-0b1a-42a3-9780-6b6493ba03e4 · outbound
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Video-chatgpt: Towards detailed video understanding via large vision and language models
Reference 57
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 4a7162bd-a6bb-495a-b577-6d8d03ffcced · outbound
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Generation and comprehension of unambiguous object descriptions
Reference 58
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 1a20f7b7-3880-4f7d-9299-d3d699dc12bf · outbound
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment MMIU: Multimodal Multi-image Understanding for Evaluating Large Vision-Language Models
Reference 59
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 40e62f33-85da-4f3a-bd82-dc428f754b52 · outbound
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Correlation-Guided Query-Dependency Calibration for Video Temporal Grounding
Reference 60
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 5b331ab6-7166-4a09-9665-0190eca0c328 · outbound
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Query-dependent video representa- tion for moment retrieval and highlight detection
Reference 61
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 9968bae1-ca09-491b-952f-6d6f168c4089 · outbound
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Queryd: A video dataset with high-quality text and audio narrations
Reference 62
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 8d9cff8a-e079-4b2f-93f3-ed73883400ba · outbound
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Perception test: A diagnostic benchmark for multimodal video models
Reference 63
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 39a8fa6e-9ea8-497c-b21c-8e2b8f6bf09d · outbound
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Streaming Long Video Understanding with Large Language Models
Reference 64
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation e2d36a86-b50a-4fac-938f-4371443238f7 · outbound
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Chatvtg: Video temporal grounding via chat with video dialogue large language models
Reference 65
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation c1701f76-a5c1-4331-9487-caf296513d44 · outbound
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Direct preference optimization: Your language model is secretly a reward model
Reference 66
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 59c7af4f-bccb-4e68-978c-8817061a0711 · outbound
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Deepspeed: System optimizations enable training deep learning models with over 100 billion param- eters
Reference 67
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 6ac49e2a-8bd7-413c-bd64-1c43dcf8b128 · outbound
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment SAM 2: Segment Anything in Images and Videos
Reference 68
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation b08a3b39-9ca2-4c34-80ee-5658aa397b2a · outbound
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Ground- ing action descriptions in videos
Reference 69
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation a3e98c36-3502-47d6-b542-48226d44bbbe · outbound
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment TimeChat: A Time-sensitive Multimodal Large Language Model for Long Video Understanding
Reference 70
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 17dbad4b-7936-4613-9729-c3849276a502 · outbound
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Proximal Policy Optimization Algorithms
Reference 71
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 51259c39-5220-4606-bc20-07784baa90fb · outbound
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Urvos: Unified referring video object segmentation network with a large-scale benchmark
Reference 72
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation f9bbda58-9867-4d77-ad12-18f39f3505bf · outbound
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment INTERN: A New Learning Paradigm Towards General Vision
Reference 73
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 1644b85d-d3fe-450f-84e7-f25adc439ad4 · outbound
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Aligning Large Multimodal Models with Factually Augmented RLHF
Reference 74
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 34da1976-ea7c-4349-b3f2-78c89cec254b · outbound
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context
Reference 75
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 2fbe6ac4-4c09-4a10-a61d-1f7bc63deb60 · outbound
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Videomae: Masked autoencoders are data-efficient learners for self-supervised video pre-training
Reference 76
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation d3958667-486e-4e66-b164-d7e9e50dd5bd · outbound
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Grounded-VideoLLM: Sharpening Fine-grained Temporal Grounding in Video Large Language Models
Reference 77
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 2112d1ed-6146-47f7-92ea-6bdcb1547a2c · outbound
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Temporal segment networks: Towards good practices for deep action recogni- tion
Reference 78
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation ec9bd1bd-44ba-4c59-a207-49c8d7f51987 · outbound
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Videomae v2: Scaling video masked autoencoders with dual masking
Reference 79
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 950ebfcc-fe51-4d1e-b994-3a6ba25d58ec · outbound
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Ofa: Unifying architectures, tasks, and modalities through a simple sequence-to-sequence learning framework
Reference 80
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 74d4d335-58f0-4119-9d72-0528800240be · outbound
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Masked video distillation: Rethinking masked feature mod- eling for self-supervised video representation learning
Reference 81
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation e144cf75-68db-4d8c-8b1f-f2b7b0840a06 · outbound
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Visionllm: Large language model is also an open-ended decoder for vision-centric tasks
Reference 82
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 5a475ba5-0bba-44a8-8f13-ad99d42f6da7 · outbound
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment The All-Seeing Project V2: Towards General Relation Comprehension of the Open World
Reference 83
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 7183b465-9ded-40cb-ac24-a0a124b62acc · outbound
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Seggpt: Towards seg- menting everything in context
Reference 84
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation b9879015-eb3b-4f0e-92e7-a6d1a3500f8e · outbound
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Internvideo2: Scaling video foundation models for multimodal video understanding
Reference 85
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation d1d2b970-e28e-4342-86a8-428ab4a2ecd2 · outbound
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment HawkEye: Training Video-Text LLMs for Grounding Text in Videos
Reference 86
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation f5828baf-26d0-4374-96a8-f28430e0b0e0 · outbound
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Onlinerefer: A simple online baseline for referring video object segmentation
Reference 87
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 0fa3f08d-b539-4dd9-bfe4-2fd269787767 · outbound
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Language as queries for referring video object seg- mentation
Reference 88
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 88ea1575-cc00-4422-b235-a431703f2c99 · outbound
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment VisionLLM v2: An End-to-End Generalist Multimodal Large Language Model for Hundreds of Vision-Language Tasks
Reference 89
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 4ad712a8-de74-4069-91b1-a9578a193cfe · outbound
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Can i trust your answer? visually grounded video question answering
Reference 90
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 3ddf5ce7-84dc-42d3-8609-cc57bdfe64fc · outbound
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Videoclip: Contrastive pre- training for zero-shot video-text understanding
Reference 91
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation b0326a83-5692-4b07-a186-e7fe06aba81e · outbound
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning
Reference 92
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 642dc38d-2816-4dc2-b509-2e43aa7a8eca · outbound
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Siamfc++: Towards robust and accurate visual tracking with target estimation guidelines
Reference 93
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 33e06ae5-572b-4d9c-9a21-50afbc3fc684 · outbound
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment VideoCoCa: Video-Text Modeling with Zero-Shot Transfer from Contrastive Captioners
Reference 94
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 52dcc8d0-e514-4265-abb9-3f22a5911a0d · outbound
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Zero-shot video question answering via frozen bidirectional language models
Reference 95
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation bb85984f-c062-49d6-aaa2-f2dfe3d3d98d · outbound
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment mplug-owl: Modularization empowers large lan- guage models with multimodality, 2023
Reference 96
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 13197f99-7de3-49ea-8b23-66128b57d23b · outbound
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Merlin: Empowering multimodal llms with foresight minds
Reference 97
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation c9399eb5-9bae-4a8a-b799-c04f20dd3c4f · outbound
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Modeling context in referring expres- sions
Reference 98
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 8789c826-b9f5-461e-b2cf-73d5383661ee · outbound
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Mattnet: Modular at- tention network for referring expression comprehension
Reference 99
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation bf830b6e-aec6-42a2-af31-67bb9de7d17f · outbound
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Self-chained image-language model for video localization and question answering
Reference 100
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation f6f89742-adc7-4844-b86d-f59213dfa980 · outbound
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Rlhf-v: Towards trustworthy mllms via behavior alignment from fine-grained correctional human feedback
Reference 101
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.
Observation d9d4332a-5f1e-483f-a493-4b5634d2952e · inbound
InternVideo2.5: Empowering Video MLLMs with Long and Rich Context Modeling Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment
Reference 32
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.
Observation 38640935-a25c-466a-b623-b70ebbdb310d · inbound
VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment
Reference 33
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.
Observation 14bcbbf9-5db4-4c97-b06d-1947d947e93e · inbound
MUPA: Towards Multi-Path Agentic Reasoning for Grounded Video Question Answering Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment
Reference 38
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation a6be8cda-4407-4ef7-acbc-29899c8ec6c1 · inbound
A Survey on Video Temporal Grounding with Multimodal Large Language Model Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment
Reference 122
Source-reported events for the cited work
Unavailable: canonical work link unavailable.