Pith. sign in

Paper Citation Record · LEDGER

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment

As of 11 August 2026, this Paper Citation Record lists 100 of 145 outbound references and 4 inbound Pith citation observations for arXiv:2412.19326.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2412.19326 v2

Coverage vector

measured 100 of 145 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-11T00:47:12.490079Z

measured 104 of 104 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-11T06:34:44.6726+00:00

measured 4 of 4 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-06T23:29:27.161964Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-05-17T02:52:20.802634Z

Reference resolution

100 of 145 outbound references displayed

  • verified exact0
  • verified fuzzy1
  • unresolved99
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 9dcb825f-4a07-478f-a8e6-852011335249 · outbound

This paper cites GPT-4 Technical Report.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment GPT-4 Technical Report

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.038424Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.038424Z digest=sha256:519e4be0aa091f17221579f995e01739b36fed4d3c2885fd098e51914ac145db

Observation 762f1c23-3290-47f3-8dc5-755aefd961c1 · outbound

This paper cites OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.043981Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.043981Z digest=sha256:e55061416af51b681d95003a892ab23b21e06ec3ab48dac710d71e0216e42b72

Observation efa4fd45-a338-41c0-b712-a49a9d2a9a93 · outbound

This paper cites Qwen Technical Report.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Qwen Technical Report

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.049215Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.049215Z digest=sha256:04f136302cd91890768b4335a4a4b4db437e4f7d0a0ed2cd170c9d97d539cec1

Observation 67b764e6-ebbf-45d8-b686-1d2f6f81c332 · outbound

This paper cites One Token to Seg Them All: Language Instructed Reasoning Segmentation in Videos.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment One Token to Seg Them All: Language Instructed Reasoning Segmentation in Videos

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.054302Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.054302Z digest=sha256:1f85ea7bea0387e49cbffa83aa4cd20d58069ff0982860b3e10bd297a5c39eff

Observation f21a84f0-3855-42c1-9209-28ef34555fb3 · outbound

This paper cites Fully-convolutional siamese networks for object tracking.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Fully-convolutional siamese networks for object tracking

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.059072Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.059072Z digest=sha256:1fcc77424abf24b1657005dc3f64d7e234dd63169c20ced20f9e7be393c33711

Observation 4a7d8b0f-fdfc-451a-88c0-57cdf44b2830 · outbound

This paper cites Activitynet: A large-scale video benchmark for human activity understanding.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Activitynet: A large-scale video benchmark for human activity understanding

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.063969Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.063969Z digest=sha256:2919f1b0d6a70d15a5da4c1b331950d416a5a433aa1ffc04658f131330c1866d

Observation cb805870-40c4-4245-a772-0fb8138759ad · outbound

This paper cites Fengwu: Pushing the skillful global medium- range weather forecast beyond 10 days lead.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Fengwu: Pushing the skillful global medium- range weather forecast beyond 10 days lead

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.068513Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.068513Z digest=sha256:bb21894d0cee29f5357c8487ca02ddc0c07e5275cbf41042c39da2ab68185b64

Observation bd164ced-73d1-4608-84b4-3ec7f999f3a2 · outbound

This paper cites Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.073445Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.073445Z digest=sha256:62fbe2d038a8be5246b4a7817bf1f09075cd3104624a952cb697670ab12c5a70

Observation b6c2acca-666b-4c43-a27b-fc5c8a996300 · outbound

This paper cites ShareGPT4V: Improving Large Multi-Modal Models with Better Captions.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment ShareGPT4V: Improving Large Multi-Modal Models with Better Captions

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.078413Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.078413Z digest=sha256:dbe7156f6a223fd41d264017bfe686a59660768eda1f2f5586c9321b147b4eba

Observation 052ffdf0-131c-43b2-873f-1e6212d75485 · outbound

This paper cites Sharegpt4v: Improving large multi-modal models with better captions.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Sharegpt4v: Improving large multi-modal models with better captions

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.083108Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.083108Z digest=sha256:09d77b80ec5a757ad50affa25ed5e9bc74530b10a1aaa81d0c64d62dba6b3774

Observation 6c4c4aab-e7c2-4666-a51d-e9e39f8c8b7a · outbound

This paper cites ShareGPT4Video: Improving Video Understanding and Generation with Better Captions.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment ShareGPT4Video: Improving Video Understanding and Generation with Better Captions

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.087492Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.087492Z digest=sha256:35d500f4ed62b1191623b2689c2dbfc3d980a9f39e9957dbd7933eaa4be12b87

Observation 2d1d871c-f622-416a-a8cb-99956a10c789 · outbound

This paper cites A simple framework for contrastive learn- ing of visual representations.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment A simple framework for contrastive learn- ing of visual representations

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.092084Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.092084Z digest=sha256:2f40aafa2267934a18607968af2d114f3a77ade415d3ab31d5596c3a065bae4f

Observation 725111f0-c607-4934-aabc-5aae54cb1bef · outbound

This paper cites Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.096385Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.096385Z digest=sha256:44589fcde18a9372054dc4e3736338a7a961eeb7f72191943b922e38620d1163

Observation 96e0e322-71e4-4521-9393-77405d9a80ae · outbound

This paper cites Efficient and Effective Text Encoding for Chinese LLaMA and Alpaca.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Efficient and Effective Text Encoding for Chinese LLaMA and Alpaca

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.100651Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.100651Z digest=sha256:9a8b488c6cd6a4b7449e92a0ebee761f76873a180ca8ab09b509c7efd6374139

Observation 87b74af6-5723-46e1-863c-b056a89acf75 · outbound

This paper cites Atom: Accurate tracking by overlap maximization.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Atom: Accurate tracking by overlap maximization

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.104936Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.104936Z digest=sha256:3b952071bf43744935f9e8b8d65af835a825fe96129fee0f7b7f46681e73eb76

Observation 56b2fe7b-5ba8-42ed-a39b-18312df4226e · outbound

This paper cites A thousand frames in just a few words: Lingual description of videos through latent topics and sparse object stitching.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment A thousand frames in just a few words: Lingual description of videos through latent topics and sparse object stitching

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.108967Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.108967Z digest=sha256:dafda4c2e2da11a817f118b341cfc1455cc879fff150de7ffecf398f86e9c76d

Observation 00310f74-8531-48f9-9c63-14b0144895d4 · outbound

This paper cites MeViS: A large-scale benchmark for video segmentation with motion expressions.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment MeViS: A large-scale benchmark for video segmentation with motion expressions

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.113554Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.113554Z digest=sha256:1299325ecd76de1894bc605042790a7ec7645208482e0857036979aff7bac913

Observation 1840cf52-86e3-452e-8ca4-4fdc90c06e0f · outbound

This paper cites InternLM-XComposer2: Mastering Free-form Text-Image Composition and Comprehension in Vision-Language Large Model.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment InternLM-XComposer2: Mastering Free-form Text-Image Composition and Comprehension in Vision-Language Large Model

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.117807Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.117807Z digest=sha256:94489d83e80096c4cf4c25d6ad7770cd7db24e3860af520eefa94f5076ac7f49

Observation da3f08b3-c0d2-4455-a27d-9daa61268863 · outbound

This paper cites Palm-e: An embodied multimodal language model.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Palm-e: An embodied multimodal language model

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.122233Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.122233Z digest=sha256:a91172b7238890e7cefa45a2cdbad4151472f056a5bd3450711ecd6d9f3495fd

Observation c1215d70-ce8b-46aa-b293-e19a678c0ff2 · outbound

This paper cites Lasot: A high-quality benchmark for large-scale sin- gle object tracking.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Lasot: A high-quality benchmark for large-scale sin- gle object tracking

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.126482Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.126482Z digest=sha256:fa3bf7e3ba4b532a930ad6783ffe839e2729a17f6a24f36696a020b321379ac1

Observation 527dba99-44c9-4d31-a891-4e245b4bf354 · outbound

This paper cites Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.130622Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.130622Z digest=sha256:326430353ecbf75b4b3fa1cc39aee0a60f3a1bf9be689bca2a44bd2f0450671b

Observation e6eb339c-e42c-414f-af2a-c9450e2702c8 · outbound

This paper cites An empirical study of end-to-end video-language transformers with masked vi- sual modeling.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment An empirical study of end-to-end video-language transformers with masked vi- sual modeling

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.134927Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.134927Z digest=sha256:71fec5bb5ab9c91e8143e73f32ddfdfcddaf6f15a32447e5a5d5aa1d71993568

Observation 3374056e-b088-4018-b786-f7c624f794a8 · outbound

This paper cites Tall: Temporal activity localization via language query.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Tall: Temporal activity localization via language query

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.139026Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.139026Z digest=sha256:83bf527c65e5d2d7df25e5454709d4afe0775bd75b1ca1e243b080d098b2a162

Observation a8c44783-2dfe-4ecd-b387-d1d18ecdbc36 · outbound

This paper cites Ego4d: Around the world in 3,000 hours of egocentric video.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Ego4d: Around the world in 3,000 hours of egocentric video

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.143090Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.143090Z digest=sha256:5b89ac142f924d90eb41908ea13fbcab9dd53f8b31505dbc46f9a6db0241c19d

Observation fa62e8f4-d0c9-4074-af60-e8cad2739f49 · outbound

This paper cites Momentum contrast for unsupervised visual rep- resentation learning.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Momentum contrast for unsupervised visual rep- resentation learning

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.147570Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.147570Z digest=sha256:2136473a95f81bea9e40c35050084bf085486d92c7f18759b87374270b9a3a68

Observation b2db24cf-c442-4e89-aca1-d867c3a2d165 · outbound

This paper cites Localizing mo- ments in video with natural language.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Localizing mo- ments in video with natural language

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.151828Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.151828Z digest=sha256:dd9d15f813f32821c67b1c4d2f2550f5ed1e8127f05f6307191880bcab9b5a8a

Observation 4df2d7f4-754d-4078-a66e-3755084cec88 · outbound

This paper cites Lora: Low- rank adaptation of large language models.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Lora: Low- rank adaptation of large language models

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.155987Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.155987Z digest=sha256:e9269679cd711638d162defd65b82a533accd9ba6a932757c9949fdfa5164424

Observation 1d862bc8-9fcb-48d3-90be-7c045f2f791c · outbound

This paper cites Vtimellm: Empower llm to grasp video mo- ments.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Vtimellm: Empower llm to grasp video mo- ments

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.160300Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.160300Z digest=sha256:f45cdfd25393985cb87b4274311797c7192ec934708639312f87e87301c416b4

Observation 174cdd31-72e7-49ff-ba71-2709e7ff8943 · outbound

This paper cites Got-10k: A large high-diversity benchmark for generic object tracking in the wild.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Got-10k: A large high-diversity benchmark for generic object tracking in the wild

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.164547Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.164547Z digest=sha256:c6b5e1b0386b0e6fd8da9f95853ff0d4e6a130e38b4c403b0ba6e6040e4dc8b8

Observation 91aadbb5-b327-43ee-9673-e360eb89370d · outbound

This paper cites Mistral 7B.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Mistral 7B

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.168965Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.168965Z digest=sha256:87538896ba95b27bbbc32575218b51ab9fcfc85501f24e1c00cdfacedd815663

Observation 4588e631-24e4-463b-abcb-8cbbfa43e80f · outbound

This paper cites Sparse sharing relation network for panoptic driving perception.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Sparse sharing relation network for panoptic driving perception

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.173790Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.173790Z digest=sha256:a04a16f117d46e1aef9631e92c99fd580755bbe5e6d1b81b4b81bd7782c34196

Observation ac1519dd-4912-4649-9aad-a73762a0f331 · outbound

This paper cites Chat-univi: Unified visual representation em- powers large language models with image and video under- standing.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Chat-univi: Unified visual representation em- powers large language models with image and video under- standing

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.178188Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.178188Z digest=sha256:59113bd16c326f18cf7c83c9b5cf985eab65ad40a0ca851f12f9bdc5889095d0

Observation 6a1416b0-dba8-4eb8-a22a-a93777d61210 · outbound

This paper cites Language Repository for Long Video Understanding.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Language Repository for Long Video Understanding

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.182626Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.182626Z digest=sha256:d4a3571d50a6c54bddce41635216b816b2c718e1342501c745c7e76e8e9c197e

Observation d4a16e49-f30d-4f47-a61e-da87de2b95c4 · outbound

This paper cites Bert: Pre-training of deep bidirectional trans- formers for language understanding.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Bert: Pre-training of deep bidirectional trans- formers for language understanding

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.188728Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.188728Z digest=sha256:7061e4acd2be6c131de744bdc68b924743bad2986b6ac9c4dc8650d937dcc639

Observation dc741ad8-f90d-4201-a667-e11909356d96 · outbound

This paper cites Segment anything.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Segment anything

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.193172Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.193172Z digest=sha256:ceb632a85a91460b313c147027e762d25323e757e55ccb7d5adebd508edfe60c

Observation 4d1eee41-3aba-419b-84d6-b2f9c1ed9a02 · outbound

This paper cites Visual genome: Connecting language and vision using crowdsourced dense image annotations.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Visual genome: Connecting language and vision using crowdsourced dense image annotations

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.197698Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.197698Z digest=sha256:0c648be6cecce927eb9b1b805f8845dd7438daaad11068fca0c9f599050610ff

Observation 483cf381-cdaa-4c04-a336-644dc5bcace0 · outbound

This paper cites Lisa: Reasoning segmenta- tion via large language model.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Lisa: Reasoning segmenta- tion via large language model

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.202060Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.202060Z digest=sha256:49dfbf0e138bc51e2895281a4c18ae78d8d9b1080092bb191e8e8c1a16812940

Observation 9d4f8ff6-b2c6-4b46-b65d-83a55ae01d0b · outbound

This paper cites Detecting mo- ments and highlights in videos via natural language queries.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Detecting mo- ments and highlights in videos via natural language queries

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.206802Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.206802Z digest=sha256:290e46b8b21b90aa6d56fa39b84c33c5e7e44e404df10d58878252ee101abc87

Observation 3e441280-5a69-4a81-9093-da47acfcb776 · outbound

This paper cites SiamRPN++: Evolution of siamese visual tracking with very deep networks.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment SiamRPN++: Evolution of siamese visual tracking with very deep networks

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.210658Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.210658Z digest=sha256:83306fa1495e4de406bce2c88cd8be0ead974fd7286413d96b44f42cdaa67cdb

Observation aa491ba9-b8ea-41c7-ab2e-59cbc3a38dcf · outbound

This paper cites Seed-bench: Bench- marking multimodal large language models.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Seed-bench: Bench- marking multimodal large language models

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.214870Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.214870Z digest=sha256:a1fdd9d3ff7b3e7ac69bf074a870c8041adb71ed1fba5f2d5240c585d362ff29

Observation f8bebfc0-b866-4763-aef4-58a647a6b53c · outbound

This paper cites LLaVA-OneVision: Easy Visual Task Transfer.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment LLaVA-OneVision: Easy Visual Task Transfer

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.224469Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.224469Z digest=sha256:6c064e8172bde056fd1caa529e3a1bd489807d66e68b8c8d429526eea86b55c2

Observation e0323e11-6fcc-49e0-be01-07331a41f31d · outbound

This paper cites LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.229444Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.229444Z digest=sha256:ddeb2fa76fe8531c3784c061422e11f91403a677ef81e12e6608ccd925198048

Observation b2b8dbfe-24e3-49e3-b60b-099c9887404e · outbound

This paper cites Uni-perceiver v2: A generalist model for large-scale vision and vision-language tasks.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Uni-perceiver v2: A generalist model for large-scale vision and vision-language tasks

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.234149Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.234149Z digest=sha256:c03fcafdf437ec2e0cf5185fb3d7c8d540d780ba5987ecc719fee707c838310a

Observation a1dfefc3-b266-4371-bdd5-809b4224b1cc · outbound

This paper cites Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.238446Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.238446Z digest=sha256:4e7074bbe9e109ee2643bc37496e628cca32dee4a08cfdcf616e0f1e78e99483

Observation bc44888b-8097-4936-ade0-db1a18d98b24 · outbound

This paper cites VideoChat: Chat-Centric Video Understanding.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment VideoChat: Chat-Centric Video Understanding

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.242711Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.242711Z digest=sha256:8491d49cc71039df40f4bbf5a66f28eac03d00c226e047de28e1387bfcbd006b

Observation fad59bd5-0922-4de9-a41e-8df0a5f489eb · outbound

This paper cites Unmasked teacher: Towards training-efficient video foundation models.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Unmasked teacher: Towards training-efficient video foundation models

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.247559Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.247559Z digest=sha256:e8f7e7d5a70a47c1063e901bc75ac39ea2d7c18dba1204931eb2be1d398a8c2b

Observation bdc73eca-2634-4f3e-aa64-e621c3e803e8 · outbound

This paper cites Mvbench: A comprehensive multi-modal video under- standing benchmark.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Mvbench: A comprehensive multi-modal video under- standing benchmark

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.252019Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.252019Z digest=sha256:46b5ec34bd3d14c7e75c0c73eb60d97808c45472f208614a835da5751c6fde85

Observation c13ec71b-bf5f-49dd-9338-dff9dac4361f · outbound

This paper cites Video-LLaVA: Learning United Visual Representation by Alignment Before Projection.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Video-LLaVA: Learning United Visual Representation by Alignment Before Projection

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.256747Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.256747Z digest=sha256:003bc968aa92988086fd339069c32fd6d3c61f72aa7d413b32620cd511200b9f

Observation 9fcd10b2-ebe7-4196-aa91-09b95183cdb2 · outbound

This paper cites Univtg: Towards unified video- language temporal grounding.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Univtg: Towards unified video- language temporal grounding

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.262395Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.262395Z digest=sha256:a0ab5d6cd6f2d8903cf76d583df7c7b638060410e9fd9b0bab44170b74643457

Observation c7984272-a9f4-4441-b274-3554065941cf · outbound

This paper cites Visual instruction tuning.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Visual instruction tuning

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.266822Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.266822Z digest=sha256:467d17770e2310cd19e3cafd65a517920372f88892245431a6d3788eae8ac719

Observation 09c50c66-4d0c-4c60-b7f3-235b2c9d26a9 · outbound

This paper cites St-llm: Large language models are effective temporal learners.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment St-llm: Large language models are effective temporal learners

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.271112Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.271112Z digest=sha256:18801a3558692f23a96281768cdce1dfc7972488c5253ff0638ed3bf591d00d5

Observation 34c63680-e0c1-4889-8d82-48ce724812de · outbound

This paper cites Grounding dino: Marrying dino with grounded pre-training for open-set object detection.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Grounding dino: Marrying dino with grounded pre-training for open-set object detection

Reference 53

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.275158Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.275158Z digest=sha256:8d9b3462cbef9ced8db8ee577e02ef9c3e890db99ddd5daa4c66f9fb0fa68330

Observation d809c351-6fd8-452c-a66d-568c620d301d · outbound

This paper cites Decoupled Weight Decay Regularization.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Decoupled Weight Decay Regularization

Reference 54

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.278739Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.278739Z digest=sha256:5488ddcfca6f16343dfd6f685501fe8be37211a2f601d7d2ff74a9fe9b608c53

Observation 3defb2b0-6e33-438f-9072-c5d2d5a88ec6 · outbound

This paper cites Unified-io: A uni- fied model for vision, language, and multi-modal tasks.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Unified-io: A uni- fied model for vision, language, and multi-modal tasks

Reference 55

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.283388Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.283388Z digest=sha256:431c67ba80871fdc063a91cbadf19796f882ac248f3c4f05946091e9f0920db0

Observation c1b178b1-1e35-4331-b275-62fea2903a2d · outbound

This paper cites VideoGPT+: Integrating Image and Video Encoders for Enhanced Video Understanding.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment VideoGPT+: Integrating Image and Video Encoders for Enhanced Video Understanding

Reference 56

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.288900Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.288900Z digest=sha256:431e9fb57aa7106e56af1a4b3f9602aaddc776ee7819e5540b6cc68d4b58ee9e

Observation 8c743a22-0b1a-42a3-9780-6b6493ba03e4 · outbound

This paper cites Video-chatgpt: Towards detailed video understanding via large vision and language models.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Video-chatgpt: Towards detailed video understanding via large vision and language models

Reference 57

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.293816Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.293816Z digest=sha256:a23b488464788ce8b6eec940f8a151116d4c9a5514329c263aa0a35aa876ff28

Observation 4a7162bd-a6bb-495a-b577-6d8d03ffcced · outbound

This paper cites Generation and comprehension of unambiguous object descriptions.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Generation and comprehension of unambiguous object descriptions

Reference 58

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.298300Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.298300Z digest=sha256:ee6548195e0973ae2aabd995bbe6af193160d15f19fb4ede9f84d4c6a5c9b476

Observation 1a20f7b7-3880-4f7d-9299-d3d699dc12bf · outbound

This paper cites MMIU: Multimodal Multi-image Understanding for Evaluating Large Vision-Language Models.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment MMIU: Multimodal Multi-image Understanding for Evaluating Large Vision-Language Models

Reference 59

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.303561Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.303561Z digest=sha256:f074a21d75df750453460720c868de3c5b4704eccf0efc58d9e32f8118bca3af

Observation 40e62f33-85da-4f3a-bd82-dc428f754b52 · outbound

This paper cites Correlation-Guided Query-Dependency Calibration for Video Temporal Grounding.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Correlation-Guided Query-Dependency Calibration for Video Temporal Grounding

Reference 60

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.308118Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.308118Z digest=sha256:b00ad6356cabf4f3be8136ba2870e67e550dc0c99c53d142fe93364f9872ea5a

Observation 5b331ab6-7166-4a09-9665-0190eca0c328 · outbound

This paper cites Query-dependent video representa- tion for moment retrieval and highlight detection.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Query-dependent video representa- tion for moment retrieval and highlight detection

Reference 61

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.312789Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.312789Z digest=sha256:dbc37cd6184821aeb907992c096c29323664d6a52f325c74a192a34089fa4827

Observation 9968bae1-ca09-491b-952f-6d6f168c4089 · outbound

This paper cites Queryd: A video dataset with high-quality text and audio narrations.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Queryd: A video dataset with high-quality text and audio narrations

Reference 62

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.317196Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.317196Z digest=sha256:ccbf76b91f2149952787e62ec48fc57cabc58b3ba700047a75ba55cbced305bc

Observation 8d9cff8a-e079-4b2f-93f3-ed73883400ba · outbound

This paper cites Perception test: A diagnostic benchmark for multimodal video models.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Perception test: A diagnostic benchmark for multimodal video models

Reference 63

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.322288Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.322288Z digest=sha256:f7a45fa3694165905b1c242b7aa52c3cd49696ab00419903372fca051b5155eb

Observation 39a8fa6e-9ea8-497c-b21c-8e2b8f6bf09d · outbound

This paper cites Streaming Long Video Understanding with Large Language Models.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Streaming Long Video Understanding with Large Language Models

Reference 64

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.326508Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.326508Z digest=sha256:565782a4a163dac36c938b4dcef17eefd26de698c43ef791317dd2ed55360a75

Observation e2d36a86-b50a-4fac-938f-4371443238f7 · outbound

This paper cites Chatvtg: Video temporal grounding via chat with video dialogue large language models.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Chatvtg: Video temporal grounding via chat with video dialogue large language models

Reference 65

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.332811Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.332811Z digest=sha256:00a1132b93a61cea2f6e9558095443283af063730410850b0119a621403f32ed

Observation c1701f76-a5c1-4331-9487-caf296513d44 · outbound

This paper cites Direct preference optimization: Your language model is secretly a reward model.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Direct preference optimization: Your language model is secretly a reward model

Reference 66

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.336988Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.336988Z digest=sha256:78844dfa89b63515ac7b1803529d5fad151949b1506a6aadee7c1af45f6f4bd4

Observation 59c7af4f-bccb-4e68-978c-8817061a0711 · outbound

This paper cites Deepspeed: System optimizations enable training deep learning models with over 100 billion param- eters.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Deepspeed: System optimizations enable training deep learning models with over 100 billion param- eters

Reference 67

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.341269Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.341269Z digest=sha256:8a19f0167de688a7e1f221948bd1a77d2a46444ea1c3820baaa3375652f13405

Observation 6ac49e2a-8bd7-413c-bd64-1c43dcf8b128 · outbound

This paper cites SAM 2: Segment Anything in Images and Videos.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment SAM 2: Segment Anything in Images and Videos

Reference 68

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.345742Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.345742Z digest=sha256:fa9e720e0e3d7063464aca05efb363be010b19265201c0b2ffe9535c530ec531

Observation b08a3b39-9ca2-4c34-80ee-5658aa397b2a · outbound

This paper cites Ground- ing action descriptions in videos.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Ground- ing action descriptions in videos

Reference 69

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.351149Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.351149Z digest=sha256:65dc4de2666ec03632616f8ca6d5445e5f8392e2439a9d7615ed147d5d257d66

Observation a3e98c36-3502-47d6-b542-48226d44bbbe · outbound

This paper cites TimeChat: A Time-sensitive Multimodal Large Language Model for Long Video Understanding.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment TimeChat: A Time-sensitive Multimodal Large Language Model for Long Video Understanding

Reference 70

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.355668Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.355668Z digest=sha256:3566ae1459bae72f0b73275a909fc4aed86f55ab281f0db8a8a8e4c912217f22

Observation 17dbad4b-7936-4613-9729-c3849276a502 · outbound

This paper cites Proximal Policy Optimization Algorithms.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Proximal Policy Optimization Algorithms

Reference 71

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.360128Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.360128Z digest=sha256:d8b307c9e90a4920800a5aa570a064b575b9ad30cd5ecd938f497e5dabd9d869

Observation 51259c39-5220-4606-bc20-07784baa90fb · outbound

This paper cites Urvos: Unified referring video object segmentation network with a large-scale benchmark.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Urvos: Unified referring video object segmentation network with a large-scale benchmark

Reference 72

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.364501Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.364501Z digest=sha256:e4ee57b41368e1ac9e5fb895fc578041294dda517f677c4cc298d05c3a2a827c

Observation f9bbda58-9867-4d77-ad12-18f39f3505bf · outbound

This paper cites INTERN: A New Learning Paradigm Towards General Vision.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment INTERN: A New Learning Paradigm Towards General Vision

Reference 73

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.369157Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.369157Z digest=sha256:e62e283bb89c46767e48ab6f60e292af64abcf901651595c72adf12049d470b7

Observation 1644b85d-d3fe-450f-84e7-f25adc439ad4 · outbound

This paper cites Aligning Large Multimodal Models with Factually Augmented RLHF.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Aligning Large Multimodal Models with Factually Augmented RLHF

Reference 74

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.373619Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.373619Z digest=sha256:e87abdfe12586cc2216b5c13a93aa797e64ee5c1ff9fea23e7bebb362766f266

Observation 34da1976-ea7c-4349-b3f2-78c89cec254b · outbound

This paper cites Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context

Reference 75

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.378201Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.378201Z digest=sha256:990bb177181ed6d0798cfd6b04db68e1c2b4d0827aaf019b3b12611d7d1713b9

Observation 2fbe6ac4-4c09-4a10-a61d-1f7bc63deb60 · outbound

This paper cites Videomae: Masked autoencoders are data-efficient learners for self-supervised video pre-training.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Videomae: Masked autoencoders are data-efficient learners for self-supervised video pre-training

Reference 76

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.382579Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.382579Z digest=sha256:508aa80b959b459e7ac22b068520ca07adce085a13b29322fa7278d72143e6f5

Observation d3958667-486e-4e66-b164-d7e9e50dd5bd · outbound

This paper cites Grounded-VideoLLM: Sharpening Fine-grained Temporal Grounding in Video Large Language Models.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Grounded-VideoLLM: Sharpening Fine-grained Temporal Grounding in Video Large Language Models

Reference 77

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.387207Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.387207Z digest=sha256:140d69122bfd31db303d0dc0ee7cc51186940ff7b48803d7fbb5df2acfb9660d

Observation 2112d1ed-6146-47f7-92ea-6bdcb1547a2c · outbound

This paper cites Temporal segment networks: Towards good practices for deep action recogni- tion.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Temporal segment networks: Towards good practices for deep action recogni- tion

Reference 78

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.391944Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.391944Z digest=sha256:0f669b2b7bf272b691fd4c08f4f2f82b0821a33b738b507136612eb8a95b9b26

Observation ec9bd1bd-44ba-4c59-a207-49c8d7f51987 · outbound

This paper cites Videomae v2: Scaling video masked autoencoders with dual masking.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Videomae v2: Scaling video masked autoencoders with dual masking

Reference 79

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.396143Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.396143Z digest=sha256:9b41c4dfe98c0217257374658b34f51badf8c32b377497580bc7d9497d1a3e77

Observation 950ebfcc-fe51-4d1e-b994-3a6ba25d58ec · outbound

This paper cites Ofa: Unifying architectures, tasks, and modalities through a simple sequence-to-sequence learning framework.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Ofa: Unifying architectures, tasks, and modalities through a simple sequence-to-sequence learning framework

Reference 80

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.400268Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.400268Z digest=sha256:f1cfab5e9f8f22db9520da63780239a33dfc71d611361778eeae592006aa85a7

Observation 74d4d335-58f0-4119-9d72-0528800240be · outbound

This paper cites Masked video distillation: Rethinking masked feature mod- eling for self-supervised video representation learning.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Masked video distillation: Rethinking masked feature mod- eling for self-supervised video representation learning

Reference 81

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.404321Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.404321Z digest=sha256:687d4e5835f9d7cb613927ba8a000fa73a690b2cb6e14cf65f90320fdc50f1ae

Observation e144cf75-68db-4d8c-8b1f-f2b7b0840a06 · outbound

This paper cites Visionllm: Large language model is also an open-ended decoder for vision-centric tasks.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Visionllm: Large language model is also an open-ended decoder for vision-centric tasks

Reference 82

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.408253Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.408253Z digest=sha256:308eba35b7691bb1fd12d626a940b1919e36a1ac5f29f2dc36f322ff6283cabb

Observation 5a475ba5-0bba-44a8-8f13-ad99d42f6da7 · outbound

This paper cites The All-Seeing Project V2: Towards General Relation Comprehension of the Open World.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment The All-Seeing Project V2: Towards General Relation Comprehension of the Open World

Reference 83

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.411857Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.411857Z digest=sha256:66e9e8a2f2502f62fde94ab2a618fa059850aeac732a112fb74cc4228262c374

Observation 7183b465-9ded-40cb-ac24-a0a124b62acc · outbound

This paper cites Seggpt: Towards seg- menting everything in context.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Seggpt: Towards seg- menting everything in context

Reference 84

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.415522Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.415522Z digest=sha256:e838e9d97a4e08a88330fdfd1d6b77f1b0ffc2e5fc3b26a6829493a3f81febc4

Observation b9879015-eb3b-4f0e-92e7-a6d1a3500f8e · outbound

This paper cites Internvideo2: Scaling video foundation models for multimodal video understanding.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Internvideo2: Scaling video foundation models for multimodal video understanding

Reference 85

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.420144Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.420144Z digest=sha256:2c21a61917a36c5ca5cb2517a114077b382e624b434fc769f740a69d19e3c389

Observation d1d2b970-e28e-4342-86a8-428ab4a2ecd2 · outbound

This paper cites HawkEye: Training Video-Text LLMs for Grounding Text in Videos.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment HawkEye: Training Video-Text LLMs for Grounding Text in Videos

Reference 86

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.424055Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.424055Z digest=sha256:bbbbbbf93de3e355edf3d46c22502f7f48c8018e2936599a6c431693a8c0f08f

Observation f5828baf-26d0-4374-96a8-f28430e0b0e0 · outbound

This paper cites Onlinerefer: A simple online baseline for referring video object segmentation.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Onlinerefer: A simple online baseline for referring video object segmentation

Reference 87

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.428352Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.428352Z digest=sha256:e61b2f259570a0e595414a67d664827fcec493d08f5a0a2ad486be37b06ac771

Observation 0fa3f08d-b539-4dd9-bfe4-2fd269787767 · outbound

This paper cites Language as queries for referring video object seg- mentation.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Language as queries for referring video object seg- mentation

Reference 88

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.432309Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.432309Z digest=sha256:974883cdc8b842f4562d2113807eb20800d3fb60522ef53cfea682b57472f1f8

Observation 88ea1575-cc00-4422-b235-a431703f2c99 · outbound

This paper cites VisionLLM v2: An End-to-End Generalist Multimodal Large Language Model for Hundreds of Vision-Language Tasks.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment VisionLLM v2: An End-to-End Generalist Multimodal Large Language Model for Hundreds of Vision-Language Tasks

Reference 89

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.436431Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.436431Z digest=sha256:bd9450333c6026ad98efd9382739377321bd4012408be7a1b6a9e7a00d2f5365

Observation 4ad712a8-de74-4069-91b1-a9578a193cfe · outbound

This paper cites Can i trust your answer? visually grounded video question answering.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Can i trust your answer? visually grounded video question answering

Reference 90

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.440788Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.440788Z digest=sha256:0151e4c0a92433caf9eeeb2b679e433101479071493efc9aa305dacdc912a191

Observation 3ddf5ce7-84dc-42d3-8609-cc57bdfe64fc · outbound

This paper cites Videoclip: Contrastive pre- training for zero-shot video-text understanding.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Videoclip: Contrastive pre- training for zero-shot video-text understanding

Reference 91

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.445447Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.445447Z digest=sha256:507342f0e05e94e1ee54cdb6d1b82d1158d61744845dce1624da7aa880a54ae0

Observation b0326a83-5692-4b07-a186-e7fe06aba81e · outbound

This paper cites PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning

Reference 92

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.450250Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.450250Z digest=sha256:b36f8c184f2324bf949cef51594c19edf4a8e8dd6db8aa472ed02bbfab017380

Observation 642dc38d-2816-4dc2-b509-2e43aa7a8eca · outbound

This paper cites Siamfc++: Towards robust and accurate visual tracking with target estimation guidelines.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Siamfc++: Towards robust and accurate visual tracking with target estimation guidelines

Reference 93

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.455596Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.455596Z digest=sha256:c955dec0c2d3c51579a11accb7c547ac502e433fd38c626a49e576b94ed652d0

Observation 33e06ae5-572b-4d9c-9a21-50afbc3fc684 · outbound

This paper cites VideoCoCa: Video-Text Modeling with Zero-Shot Transfer from Contrastive Captioners.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment VideoCoCa: Video-Text Modeling with Zero-Shot Transfer from Contrastive Captioners

Reference 94

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.459953Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.459953Z digest=sha256:a5c904c3d3fea06a784b44e28474b5151428b53c3db2ce4e5432428e3ced676d

Observation 52dcc8d0-e514-4265-abb9-3f22a5911a0d · outbound

This paper cites Zero-shot video question answering via frozen bidirectional language models.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Zero-shot video question answering via frozen bidirectional language models

Reference 95

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.464454Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.464454Z digest=sha256:a83caf465374edb1ea8633c0576b2dcef026dcb141edcde151f0f905143d155c

Observation bb85984f-c062-49d6-aaa2-f2dfe3d3d98d · outbound

This paper cites mplug-owl: Modularization empowers large lan- guage models with multimodality, 2023.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment mplug-owl: Modularization empowers large lan- guage models with multimodality, 2023

Reference 96

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.468728Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.468728Z digest=sha256:60e1b2a929af850b39debfabf47a8d83cfc75a466869f79b04074d1e63f42113

Observation 13197f99-7de3-49ea-8b23-66128b57d23b · outbound

This paper cites Merlin: Empowering multimodal llms with foresight minds.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Merlin: Empowering multimodal llms with foresight minds

Reference 97

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.473590Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.473590Z digest=sha256:f1a21a6ce0bb6703aeaf7aeef378153d1338fc6cf96c0b4315807f6e40de6769

Observation c9399eb5-9bae-4a8a-b799-c04f20dd3c4f · outbound

This paper cites Modeling context in referring expres- sions.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Modeling context in referring expres- sions

Reference 98

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.478410Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.478410Z digest=sha256:e5103384ffe1227853d95c25ecfc4f520617f50c637e920dbc00f3bc538df865

Observation 8789c826-b9f5-461e-b2cf-73d5383661ee · outbound

This paper cites Mattnet: Modular at- tention network for referring expression comprehension.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Mattnet: Modular at- tention network for referring expression comprehension

Reference 99

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.482453Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.482453Z digest=sha256:44d7216d83589ef785fa3500c7f4f87c41ac59b08a50605b52c53d8a2b8a737f

Observation bf830b6e-aec6-42a2-af31-67bb9de7d17f · outbound

This paper cites Self-chained image-language model for video localization and question answering.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Self-chained image-language model for video localization and question answering

Reference 100

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.486338Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.486338Z digest=sha256:1d3b814d88ccf37adeb3789f5c72d080b75c89cbf6cca639077403ca967b6eb1

Observation f6f89742-adc7-4844-b86d-f59213dfa980 · outbound

This paper cites Rlhf-v: Towards trustworthy mllms via behavior alignment from fine-grained correctional human feedback.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Rlhf-v: Towards trustworthy mllms via behavior alignment from fine-grained correctional human feedback

Reference 101

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T00:47:14.010847Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-08-11T00:47:12.490079Z digest=sha256:91402a4f20e887da92be5ae8f2ff1d7e402f2504bbb373a1cf8edbe5764e062f

Pith citing papers

Observation d9d4332a-5f1e-483f-a493-4b5634d2952e · inbound

InternVideo2.5: Empowering Video MLLMs with Long and Rich Context Modeling cites this paper.

InternVideo2.5: Empowering Video MLLMs with Long and Rich Context Modeling Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment

Reference 32

Resolution
verified exact
arxiv_id, observed 2026-05-17T02:52:20.806469Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-05-17T02:52:20.643070Z digest=sha256:96c605e08670aa6aea4686f994212bcfe97e9d83a1effac2335e5e496ec4d71f

Observation 38640935-a25c-466a-b623-b70ebbdb310d · inbound

VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning cites this paper.

VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment

Reference 33

Resolution
verified exact
arxiv_id, observed 2026-05-15T20:56:07.724355Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-05-15T20:56:07.247122Z digest=sha256:73f56b9d6e248477ab4d34b74df16a87469dfaa4c0ecd4f9092c231d61d0e761

Observation 14bcbbf9-5db4-4c97-b06d-1947d947e93e · inbound

MUPA: Towards Multi-Path Agentic Reasoning for Grounded Video Question Answering cites this paper.

MUPA: Towards Multi-Path Agentic Reasoning for Grounded Video Question Answering Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-06T23:29:27.161964Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:29:27.161964Z digest=sha256:8314ee9de2d087eb8c42373ab00b404b04bc2a55e0c1560efbe1e2026b2f610a

Observation a6be8cda-4407-4ef7-acbc-29899c8ec6c1 · inbound

A Survey on Video Temporal Grounding with Multimodal Large Language Model cites this paper.

A Survey on Video Temporal Grounding with Multimodal Large Language Model Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment

Reference 122

Resolution
unresolved
no resolver link, observed 2026-08-05T23:32:18.017165Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T23:32:18.017165Z digest=sha256:4bcc0a8844bd72a0c819ebbe4727196cf42f82112c3d17a69f49036da54c504d