Pith. sign in

Paper Citation Record · LEDGER

Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models

As of 7 August 2026, this Paper Citation Record lists 84 of 84 outbound references and 2 inbound Pith citation observations for arXiv:2603.01400.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2603.01400 v2

Coverage vector

measured 84 of 84 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-05-15T18:25:21.621268Z

measured 86 of 86 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-07T06:34:17.273281+00:00

measured 2 of 2 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-05-13T05:49:36.807884Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: pith, observed 2026-05-13T05:52:22.302025Z

Reference resolution

84 of 84 outbound references displayed

  • verified exact34
  • verified fuzzy50
  • unresolved0
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 7c10f71f-402b-4d28-871f-b86f7a71bebe · outbound

This paper cites GPT-4 Technical Report.

Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models GPT-4 Technical Report

Reference 1

Resolution
verified exact
local_arxiv, observed 2026-05-15T18:26:26.912056Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-15T18:25:21.621268Z digest=sha256:da06ec8ef51b15483271a0c69d79b3a51fdcdc8e7604750548a4c9c18d5a83cc

Observation 1253536a-4a15-4c1e-8aee-7b006f87ad0f · outbound

This paper cites Flamingo: a visual language model for few-shot learning.

Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models Flamingo: a visual language model for few-shot learning

Reference 2

Resolution
verified fuzzy
raw_fallback, observed 2026-05-15T18:26:27.377182Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-15T18:25:21.621268Z digest=sha256:b0461e818cef6b16c57ef5b75da579efa1f2f058e561293af5e331b831477567

Observation 1055f925-b328-461c-b4ae-ae9e7c4202ec · outbound

This paper cites LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training.

Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training

Reference 3

Resolution
verified exact
local_arxiv, observed 2026-05-15T18:26:26.935702Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-15T18:25:21.621268Z digest=sha256:a0c92866e7084c3ec5acf73bc63e81384c9527e23d86e607aa5a13858a48b7d9

Observation f8cb1e64-111b-4df6-b4c1-364fc4cc487a · outbound

This paper cites Hired: Attention-guided token dropping for efficient inference of high-resolution vision-language models.

Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models Hired: Attention-guided token dropping for efficient inference of high-resolution vision-language models

Reference 4

Resolution
verified fuzzy
raw_fallback, observed 2026-05-15T18:26:27.298589Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-15T18:25:21.621268Z digest=sha256:088582805254b359a205e9d6af25c137e2988c1576eed0dd3ed1fa2eadcaa548

Observation 1974daac-f804-45c3-bfe7-fdf8eed4ac00 · outbound

This paper cites Qwen2.5-VL Technical Report.

Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models Qwen2.5-VL Technical Report

Reference 5

Resolution
verified exact
local_arxiv, observed 2026-05-15T18:26:26.956008Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-15T18:25:21.621268Z digest=sha256:08fb4e8065586eae7baf44e73cd8b522a2f075f090bf76b82e38908239848994

Observation 69462350-8708-4509-97f6-41300568aaa4 · outbound

This paper cites Token Merging: Your ViT But Faster.

Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models Token Merging: Your ViT But Faster

Reference 6

Resolution
verified exact
local_arxiv, observed 2026-05-15T18:26:27.061121Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-15T18:25:21.621268Z digest=sha256:ccf8b98c88084de6d0289c94cee773acd2ff40d4da68d133bf19e0a45f0f0b7a

Observation 307b969c-1c54-4663-83d5-2209560690f9 · outbound

This paper cites AuroraCap: Efficient, Performant Video Detailed Captioning and a New Benchmark.

Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models AuroraCap: Efficient, Performant Video Detailed Captioning and a New Benchmark

Reference 7

Resolution
verified exact
arxiv_id, observed 2026-05-15T18:26:27.013397Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-15T18:25:21.621268Z digest=sha256:c22609b92f403e59241d5b92975893bbd607b356fbcb8843bcf29042747f86e1

Observation ba2e3575-e5bf-49a5-ac5c-d197410f1676 · outbound

This paper cites Sharegpt4video: Improving video understand- ing and generation with better captions.

Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models Sharegpt4video: Improving video understand- ing and generation with better captions

Reference 8

Resolution
verified fuzzy
raw_fallback, observed 2026-05-15T18:26:27.280286Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-15T18:25:21.621268Z digest=sha256:d28b9ce29d17f8af537c638c5a42cd5de6e835d8fcad29991aa148354ff579e3

Observation bd15f5b5-a452-4350-a714-280ea226f9e8 · outbound

This paper cites An image is worth 1/2 tokens after layer 2: Plug-and-play inference acceleration for large vision-language models.

Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models An image is worth 1/2 tokens after layer 2: Plug-and-play inference acceleration for large vision-language models

Reference 9

Resolution
verified fuzzy
raw_fallback, observed 2026-05-15T18:26:27.293304Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-15T18:25:21.621268Z digest=sha256:dc5380a8b10f1b6f1f61a73bb95691b8308602a89bf828af98e8bdecf31e9fd2

Observation 4e4871fc-92c5-47fb-bab8-9107a70e4b50 · outbound

This paper cites How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites.Science China Information Sciences, 67(12):220101.

Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites.Science China Information Sciences, 67(12):220101

Reference 10

Resolution
verified fuzzy
raw_fallback, observed 2026-05-15T18:26:27.277559Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-15T18:25:21.621268Z digest=sha256:fb02af3f89fbc2df6cfe1372d2d078eeac25f28a2fe00ecdf4c86a0e0026cf77

Observation 5df7632b-e571-4beb-bf7b-51967f4adc3a · outbound

This paper cites VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs.

Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs

Reference 11

Resolution
verified exact
local_arxiv, observed 2026-05-15T18:26:26.978538Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-15T18:25:21.621268Z digest=sha256:59ab62169f83d710e11b37fe729ca132f8043904df1bb18f132ea93ce5c2df21

Observation ee3ff07b-972b-45f9-bd2a-785c6d92e094 · outbound

This paper cites Vicuna: An open-source chatbot impressing gpt-4 with 90%* chatgpt quality.See https://vicuna.

Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models Vicuna: An open-source chatbot impressing gpt-4 with 90%* chatgpt quality.See https://vicuna

Reference 12

Resolution
verified fuzzy
raw_fallback, observed 2026-05-15T18:26:27.344774Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-15T18:25:21.621268Z digest=sha256:228af61c8bd672c1d3328ea7d64991f7a7e95f147c5b26dc06deeca9eb791f4c

Observation cd2cbf18-b934-4781-a422-e2a96b0501eb · outbound

This paper cites Sinkhorn distances: Lightspeed computation of optimal transport.

Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models Sinkhorn distances: Lightspeed computation of optimal transport

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-05-15T18:26:27.261925Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-15T18:25:21.621268Z digest=sha256:9fc1f891871b4a53a1387498af0208c229c59b04554428eb3d77673cbe556966

Observation 6e9f6adb-3187-4cd9-92eb-39f2b6bde528 · outbound

This paper cites An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale.

Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale

Reference 14

Resolution
verified exact
local_arxiv, observed 2026-05-15T18:26:26.996414Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-15T18:25:21.621268Z digest=sha256:0de1cfec9af034de5f47ce937df364f5fc1c912b1ec9483c6f23c6fa34b5d687

Observation 46372f6a-4618-4cca-b194-81b6f406c0a5 · outbound

This paper cites Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis.

Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis

Reference 15

Resolution
verified fuzzy
raw_fallback, observed 2026-05-15T18:26:27.274073Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-15T18:25:21.621268Z digest=sha256:b31b0efd450f943d32ec874405b86b78d98cb4bd6e2f90a6c3410481b4b03e3e

Observation f2b099df-6088-4428-8865-d4a635427214 · outbound

This paper cites FrameFusion: Combining Similarity and Importance for Video Token Reduction on Large Vision Language Models.

Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models FrameFusion: Combining Similarity and Importance for Video Token Reduction on Large Vision Language Models

Reference 16

Resolution
verified exact
arxiv_id, observed 2026-05-15T18:26:26.952439Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-15T18:25:21.621268Z digest=sha256:d3bc93b1061b09377a134158d003c82df09a1d3b18a613b6ac4d000acdcf8ab7

Observation 352f6555-5169-49e5-ab23-c28f34d52a3b · outbound

This paper cites PruneVid: Visual Token Pruning for Efficient Video Large Language Models.

Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models PruneVid: Visual Token Pruning for Efficient Video Large Language Models

Reference 17

Resolution
verified exact
arxiv_id, observed 2026-05-15T18:26:26.984952Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-15T18:25:21.621268Z digest=sha256:062c93a54f6b0f566c594aecba0feea8f4c57223f97e6a6e7a6962e2bda0b515

Observation dff2baec-d180-4d96-9c24-da12c23c0a9b · outbound

This paper cites Chat-univi: Unified visual representation em- powers large language models with image and video under- standing.

Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models Chat-univi: Unified visual representation em- powers large language models with image and video under- standing

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-05-15T18:26:27.290323Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-15T18:25:21.621268Z digest=sha256:bc4dbb8f6b79072069ae1762bd01d66b653818924f7b2ffc9f6a60398431f361

Observation 4478dee3-eee3-4428-a230-199ad501ce69 · outbound

This paper cites Sparsevila: Decoupling visual sparsity for efficient vlm inference.

Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models Sparsevila: Decoupling visual sparsity for efficient vlm inference

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-05-15T18:26:27.322490Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-15T18:25:21.621268Z digest=sha256:8c0e478fab5de41f024b51084c16e440e3e8b6c312fb7ca7b3c2049fada39d47

Observation 3dd5e7e3-2fbb-44dd-af9b-fa21596f9abb · outbound

This paper cites arXiv preprint arXiv:2505.18227 , year=.

Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models arXiv preprint arXiv:2505.18227 , year=

Reference 20

Resolution
verified exact
arxiv_id, observed 2026-05-15T18:26:27.056369Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-15T18:25:21.621268Z digest=sha256:dda54d2a30e454e25133b41bc1fa8bdb9f12dd377c87b1192479d353ae2e5299

Observation 428ecb9f-3562-4fb6-8fa0-dfa92f52b5a5 · outbound

This paper cites Lmms-eval: Accelerating the develop- ment of large multimoal models.

Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models Lmms-eval: Accelerating the develop- ment of large multimoal models

Reference 21

Resolution
verified fuzzy
raw_fallback, observed 2026-05-15T18:26:27.308834Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-15T18:25:21.621268Z digest=sha256:b2a779557e90316dd56fa71aa0c8c8696af63d31b3751833c19178ce15de65fd

Observation 8865f885-a212-4fcb-8ffe-17891dd57711 · outbound

This paper cites LLaVA-OneVision: Easy Visual Task Transfer.

Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models LLaVA-OneVision: Easy Visual Task Transfer

Reference 22

Resolution
verified exact
local_arxiv, observed 2026-05-15T18:26:27.041003Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-15T18:25:21.621268Z digest=sha256:0c735b191e383e237beebdb0b522585bf2754914cd67cbfc0ddedd16c750c7c6

Observation 686986fc-58d7-4137-9653-ee300307b388 · outbound

This paper cites Expansion and shrinkage of localization for weakly- supervised semantic segmentation.NeurIPS, 35:16037– 16051.

Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models Expansion and shrinkage of localization for weakly- supervised semantic segmentation.NeurIPS, 35:16037– 16051

Reference 23

Resolution
verified fuzzy
raw_fallback, observed 2026-05-15T18:26:27.328858Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-15T18:25:21.621268Z digest=sha256:4cdc4e33c0c9c97350bf28c83f69e5093580fbd58e54faa939e21b1b51728f57

Observation a2ef54d3-0c89-4a57-8c38-d213e13a7912 · outbound

This paper cites Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models.

Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models

Reference 24

Resolution
verified fuzzy
raw_fallback, observed 2026-05-15T18:26:27.325630Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-15T18:25:21.621268Z digest=sha256:d4924fe7689235b65a6c1fb5125b512be8c69756fdb839aa024db61c33383388

Observation 21ee01fe-f803-4313-ba9f-37ff6aef794d · outbound

This paper cites Cross-modal and uncertainty-aware agglomeration for open- vocabulary 3d scene understanding.

Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models Cross-modal and uncertainty-aware agglomeration for open- vocabulary 3d scene understanding

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-05-15T18:26:27.240097Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-15T18:25:21.621268Z digest=sha256:d72bec3b245f1b4bd8bacc7ad181871bb563c5afe3cca04238bd190dfac74a15

Observation dfa922e3-a8f2-4bc4-9a88-33451116a8f3 · outbound

This paper cites Orthogonal Projection Subspace to Aggregate Online Prior-knowledge for Continual Test-time Adaptation.

Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models Orthogonal Projection Subspace to Aggregate Online Prior-knowledge for Continual Test-time Adaptation

Reference 26

Resolution
verified exact
arxiv_id, observed 2026-05-15T18:26:26.948407Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-15T18:25:21.621268Z digest=sha256:8b2f4d1c4933444749ff29b9c830ce2a2a493e13ee14654d171739b90495435b

Observation b81222d6-1c0c-456b-a895-5978774aac55 · outbound

This paper cites VideoChat: Chat-Centric Video Understanding.

Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models VideoChat: Chat-Centric Video Understanding

Reference 27

Resolution
verified exact
local_arxiv, observed 2026-05-15T18:26:26.928192Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-15T18:25:21.621268Z digest=sha256:6c3effd8f50de9ef6db7d3ffdf97fb09f627231da406d882778586eeb1b51346

Observation d3c1fd37-8662-4bbe-95d9-8e16c98864c8 · outbound

This paper cites Mvbench: A comprehensive multi-modal video understand- ing benchmark.

Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models Mvbench: A comprehensive multi-modal video understand- ing benchmark

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-05-15T18:26:27.311328Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-15T18:25:21.621268Z digest=sha256:bb2178cc19d3fdb294a29ddcbabfd70ebcc43849c7ee33c83b167af8448ee490

Observation 0ca99f3f-3ac6-469b-b433-50a8ad459118 · outbound

This paper cites Llama-vid: An image is worth 2 tokens in large language models.

Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models Llama-vid: An image is worth 2 tokens in large language models

Reference 29

Resolution
verified fuzzy
raw_fallback, observed 2026-05-15T18:26:27.237289Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-15T18:25:21.621268Z digest=sha256:0d7074aa5d9991d9289f73672500617f6b53a535c3315379e1e947bc2975c4f9

Observation 1cc47a42-5cb6-4f36-90de-b608a721c1cc · outbound

This paper cites Video-LLaVA: Learning United Visual Representation by Alignment Before Projection.

Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models Video-LLaVA: Learning United Visual Representation by Alignment Before Projection

Reference 30

Resolution
verified exact
local_arxiv, observed 2026-05-15T18:26:26.944119Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-15T18:25:21.621268Z digest=sha256:b48bf5c3b5d4dc4815a2725718ab2d265e098eb104036285a853c264370ddecf

Observation 50387c75-1d4d-413c-9df0-f1c51e32d1cc · outbound

This paper cites Vila: On pre-training for visual language models.

Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models Vila: On pre-training for visual language models

Reference 31

Resolution
verified fuzzy
raw_fallback, observed 2026-05-15T18:26:27.242622Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-15T18:25:21.621268Z digest=sha256:c21be569eb9f4621858d1da01384d48029fa77746d88c7b0476161c152e77620

Observation 97643793-6fb5-42a3-85e4-f8ab4c8720ae · outbound

This paper cites Improved baselines with visual instruction tuning.

Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models Improved baselines with visual instruction tuning

Reference 32

Resolution
verified fuzzy
raw_fallback, observed 2026-05-15T18:26:27.331859Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-15T18:25:21.621268Z digest=sha256:8b6a8d7b24ea11e06b6d8f14a4acba6abd3dba2bf8a0233a6112d7b2ceb31cb7

Observation 333756eb-327e-4182-94d1-986f82bd549f · outbound

This paper cites Llavanext: Improved reasoning, ocr, and world knowledge.

Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models Llavanext: Improved reasoning, ocr, and world knowledge

Reference 33

Resolution
verified fuzzy
raw_fallback, observed 2026-05-15T18:26:27.316806Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-15T18:25:21.621268Z digest=sha256:3e7a1e171b2757d752d5b4a0b2c16835295693a465bb1375aeaefad933c8c205

Observation c04c2190-6cf4-4248-a223-772acb2fbd56 · outbound

This paper cites Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model.

Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model

Reference 34

Resolution
verified exact
arxiv_id, observed 2026-05-15T18:26:26.920542Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-15T18:25:21.621268Z digest=sha256:c88421cd41e5f1b24be8bcb4f3b769b7e534d59d73c707b654a33a0dab2522a4

Observation f78afe71-546c-4bf0-832f-bfe4925584b2 · outbound

This paper cites Less: Label-efficient and single-stage referring 3d instance segmentation.

Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models Less: Label-efficient and single-stage referring 3d instance segmentation

Reference 35

Resolution
verified fuzzy
raw_fallback, observed 2026-05-15T18:26:27.228851Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-15T18:25:21.621268Z digest=sha256:37d60b10a16e58dcdca0c7d0431f97aa1f2fd1a1a70149c6d90e1ce1cfe7fb1c

Observation dd783566-e8cb-4ea9-8c0f-855c4dcb10c8 · outbound

This paper cites Hybrid-level instruction injection for video token com- pression in multi-modal large language models.

Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models Hybrid-level instruction injection for video token com- pression in multi-modal large language models

Reference 36

Resolution
verified fuzzy
raw_fallback, observed 2026-05-15T18:26:27.271560Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-15T18:25:21.621268Z digest=sha256:3ef985894cb20f3b0b58394ab3741d43c21c8d4ad7c41517d4ea96bac044b9c6

Observation 4b253035-c0cc-4c9a-ad00-75b558830e2b · outbound

This paper cites Nvila: Efficient frontier visual language models.

Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models Nvila: Efficient frontier visual language models

Reference 37

Resolution
verified fuzzy
raw_fallback, observed 2026-05-15T18:26:27.256555Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-15T18:25:21.621268Z digest=sha256:006aeb205f7d70a8e763a58961e8eb3edfb9300c806db79965e3f2cabe7e8ec1

Observation 119419f0-a3c9-4320-aa07-95ed7de6e61f · outbound

This paper cites Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models.

Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models

Reference 38

Resolution
verified exact
local_arxiv, observed 2026-05-15T18:26:26.991401Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-15T18:25:21.621268Z digest=sha256:49cc85bd24afac5a29ec9fce60b386e4c73f25f9d0660eb11bd4879143614671

Observation d8d0dbef-36dc-4286-85f0-503ff62da652 · outbound

This paper cites Egoschema: A diagnostic benchmark for very long- form video language understanding.

Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models Egoschema: A diagnostic benchmark for very long- form video language understanding

Reference 39

Resolution
verified fuzzy
raw_fallback, observed 2026-05-15T18:26:27.248078Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-15T18:25:21.621268Z digest=sha256:10fccf5c36a22a3c805703de8c3431d69aa4a6c2658b7cc9778597e697a40262

Observation f2727595-b486-495a-9b65-2650249c2315 · outbound

This paper cites Perla: Perceptive 3d language assistant.

Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models Perla: Perceptive 3d language assistant

Reference 40

Resolution
verified fuzzy
raw_fallback, observed 2026-05-15T18:26:27.362604Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-15T18:25:21.621268Z digest=sha256:66d3a8a107ad4a734bc1e9e542b22a74a2d814a4f057aa791e88edad1cf9fa6d

Observation 08caf57a-46e1-4c13-a6bc-39a19e2ebb52 · outbound

This paper cites M ´emoire sur la th ´eorie des d ´eblais et des remblais.Mem.

Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models M ´emoire sur la th ´eorie des d ´eblais et des remblais.Mem

Reference 41

Resolution
verified fuzzy
raw_fallback, observed 2026-05-15T18:26:27.365862Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-15T18:25:21.621268Z digest=sha256:539024bb40da79141ed621e0b02fa203ca76e09477debf0afa3904e225c4ba3e

Observation 87e95e8c-7ad4-4f95-af23-b688b1630d64 · outbound

This paper cites T2td: Text-3d generation model based on prior knowledge guidance.IEEE Transactions on Pattern Analysis and Machine Intelligence, 47(1):172–189.

Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models T2td: Text-3d generation model based on prior knowledge guidance.IEEE Transactions on Pattern Analysis and Machine Intelligence, 47(1):172–189

Reference 42

Resolution
verified fuzzy
raw_fallback, observed 2026-05-15T18:26:27.352537Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-15T18:25:21.621268Z digest=sha256:fc77d789af96e318157054c712506e7fdee6bac1df9406159de9b39f071ec504

Observation fad83d17-fa96-4fb7-add5-f142e4908837 · outbound

This paper cites Learn- ing transferable visual models from natural language super- vision.

Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models Learn- ing transferable visual models from natural language super- vision

Reference 43

Resolution
verified fuzzy
raw_fallback, observed 2026-05-15T18:26:27.359194Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-15T18:25:21.621268Z digest=sha256:6d33f80517c655adf895c60f3ae9c0b42671bf023f2b942050ab8d5acf0f7419

Observation d1ae580b-a2b5-4911-9389-01680269bb93 · outbound

This paper cites Llava-prumerge: Adaptive token reduction for efficient large multimodal models.

Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models Llava-prumerge: Adaptive token reduction for efficient large multimodal models

Reference 44

Resolution
verified fuzzy
raw_fallback, observed 2026-05-15T18:26:27.373553Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-15T18:25:21.621268Z digest=sha256:8a08b1ffc987de7cef2ccfdc0e56b9580d743ea7d52e7c62c34d30a099bfb49d

Observation bd723006-e8a7-4702-afa8-a3c10793bff8 · outbound

This paper cites arXiv preprint arXiv:2505.21334 , year=.

Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models arXiv preprint arXiv:2505.21334 , year=

Reference 45

Resolution
verified exact
arxiv_id, observed 2026-05-15T18:26:27.018134Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-15T18:25:21.621268Z digest=sha256:99697c179075dff025ab88759e44a31a2309facfd8ec35dab502bae2023bddf4

Observation e6373ec4-0774-4ee1-8c9a-40bb5e22f222 · outbound

This paper cites TempMe: Video Temporal Token Merging for Efficient Text-Video Retrieval.

Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models TempMe: Video Temporal Token Merging for Efficient Text-Video Retrieval

Reference 46

Resolution
verified exact
arxiv_id, observed 2026-05-15T18:26:27.050959Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-15T18:25:21.621268Z digest=sha256:60f192eb8a20a325f65e7b627b8a2478c06c3b45057a3a06cb25931338704cc2

Observation 6bbf309f-ade3-41ff-a155-ff5a2fe005b9 · outbound

This paper cites Fastvid: Dynamic density pruning for fast video large language models.

Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models Fastvid: Dynamic density pruning for fast video large language models

Reference 47

Resolution
verified exact
arxiv_id, observed 2026-05-15T18:26:27.024250Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-15T18:25:21.621268Z digest=sha256:95e57b20606b9c169b6272b7579eeaa393a908fa3ddb5f286e9da3c1100d9ac3

Observation 9bc14500-af25-4c75-9f31-cda3689159b6 · outbound

This paper cites LongVU: Spatiotemporal Adaptive Compression for Long Video-Language Understanding.

Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models LongVU: Spatiotemporal Adaptive Compression for Long Video-Language Understanding

Reference 48

Resolution
verified exact
arxiv_id, observed 2026-05-16T13:53:33.725971Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-15T18:25:21.621268Z digest=sha256:63b014a29e008107970dff6b889e0fb21a661da22bc427434f5a391b8a5a4269

Observation bfa32464-5aad-4bc0-9041-c8da6c5b5c72 · outbound

This paper cites Moviechat: From dense token to sparse memory for long video understanding.

Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models Moviechat: From dense token to sparse memory for long video understanding

Reference 49

Resolution
verified fuzzy
raw_fallback, observed 2026-05-15T18:26:27.334653Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-15T18:25:21.621268Z digest=sha256:a9c3c2074dbbf1f9e435e18872ca33a51063474baa29c54c90e25196b206bc7f

Observation 989474e8-b56d-4783-82f1-5a2c5cb5ac92 · outbound

This paper cites TokenCarve: Information-Preserving Visual Token Compression in Multimodal Large Language Models.

Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models TokenCarve: Information-Preserving Visual Token Compression in Multimodal Large Language Models

Reference 50

Resolution
verified exact
arxiv_id, observed 2026-05-15T18:26:27.066331Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-15T18:25:21.621268Z digest=sha256:dac2e467bcd59b028a95393010e680751152f4e96a502fdb0a009ed1cde71916

Observation 7588e5c2-9c25-4a18-8251-fd0d9493dfd5 · outbound

This paper cites Dycoke: Dynamic compression of tokens for fast video large language models.

Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models Dycoke: Dynamic compression of tokens for fast video large language models

Reference 51

Resolution
verified fuzzy
raw_fallback, observed 2026-05-15T18:26:27.337712Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-15T18:25:21.621268Z digest=sha256:f8862404dec3e0dc31c41f83dc46e33ac3b1fccd7aea195217dc2ac6b511b092

Observation 52a2c208-bf56-4fd8-a039-25a8e104e1ea · outbound

This paper cites Stanford alpaca: An instruction-following llama model.

Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models Stanford alpaca: An instruction-following llama model

Reference 52

Resolution
verified fuzzy
raw_fallback, observed 2026-05-15T18:26:27.340873Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-15T18:25:21.621268Z digest=sha256:81f7cd1b480c3dd396715447e807322a1c79fc3d9e5372957ebee225ca56e925

Observation 13e0de41-33bf-4729-85de-bf7be3322db2 · outbound

This paper cites Gemini: A Family of Highly Capable Multimodal Models.

Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models Gemini: A Family of Highly Capable Multimodal Models

Reference 53

Resolution
verified exact
local_arxiv, observed 2026-05-15T18:26:26.924185Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-15T18:25:21.621268Z digest=sha256:8cbc23df15ef326a33b54f40a3099532d1d488447c1b6d2ddb024826a2e8c3ea

Observation 27654a1b-7146-4301-a713-b381a7990ea8 · outbound

This paper cites Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context.

Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context

Reference 54

Resolution
verified exact
local_arxiv, observed 2026-05-15T18:26:26.931899Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-15T18:25:21.621268Z digest=sha256:1ff1fce48c74d49f596b9913bc69b1e948251d215d62290239326555c9bf24dc

Observation 31b238ec-1cb4-4325-8768-9d21905c70d2 · outbound

This paper cites Introduction to optimal transport.Notes of Course at University of Cambridge, 3.

Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models Introduction to optimal transport.Notes of Course at University of Cambridge, 3

Reference 55

Resolution
verified fuzzy
raw_fallback, observed 2026-05-15T18:26:27.234249Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-15T18:25:21.621268Z digest=sha256:77dfaffce37debe16de8d58352e696581c2d701e5fd8512e1d597f90dba182a6

Observation d5e2a7a3-8853-4cc8-93b2-0d7d378f2015 · outbound

This paper cites Springer.

Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models Springer

Reference 56

Resolution
verified fuzzy
raw_fallback, observed 2026-05-15T18:26:27.253693Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-15T18:25:21.621268Z digest=sha256:5ac04248389f201541e6ee5a0f19d3b857705e56e00aba25ce8abdad9ccf6406

Observation 41ed44ae-c1df-4774-9b91-4580736da2aa · outbound

This paper cites Ross3d: Re- constructive visual instruction tuning with 3d-awareness.

Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models Ross3d: Re- constructive visual instruction tuning with 3d-awareness

Reference 57

Resolution
verified fuzzy
raw_fallback, observed 2026-05-15T18:26:27.314206Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-15T18:25:21.621268Z digest=sha256:f86af99d14637c3a3b4d3e0a8f4f11e84053690c821bb3808a20540babebb3a1

Observation 5763ab29-2d37-442c-86c7-bfe7cc13504d · outbound

This paper cites ChatVideo: A Tracklet-centric Multimodal and Versatile Video Understanding System.

Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models ChatVideo: A Tracklet-centric Multimodal and Versatile Video Understanding System

Reference 58

Resolution
verified exact
arxiv_id, observed 2026-05-15T18:26:27.035766Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-15T18:25:21.621268Z digest=sha256:2ed0be40bf341a675969bd7118c66b3f0fb5f80bd3a2657cda9cddc30863db07

Observation e54f96a9-a8cd-4e1e-8374-b0af4b18f2b0 · outbound

This paper cites Uvmap-id: A controllable and personalized uv map generative model.

Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models Uvmap-id: A controllable and personalized uv map generative model

Reference 59

Resolution
verified fuzzy
raw_fallback, observed 2026-05-15T18:26:27.370028Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-15T18:25:21.621268Z digest=sha256:289f4c156045cdf3534b4174b710d46d0f687cb6e988fe09ee55637b1a889338

Observation fa469ff6-c5a0-423b-a471-560860c4103d · outbound

This paper cites Stop Looking for Important Tokens in Multimodal Language Models: Duplication Matters More.

Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models Stop Looking for Important Tokens in Multimodal Language Models: Duplication Matters More

Reference 60

Resolution
verified exact
arxiv_id, observed 2026-05-15T18:26:27.002398Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-15T18:25:21.621268Z digest=sha256:edd8ecd6f86df58cfbaf4e851d93c216e4e5e36c9cc1f39789033c71b65c3576

Observation 936eb09b-3111-47d2-a29e-0e6f8d874e28 · outbound

This paper cites Longvlm: Efficient long video understand- ing via large language models.

Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models Longvlm: Efficient long video understand- ing via large language models

Reference 61

Resolution
verified fuzzy
raw_fallback, observed 2026-05-15T18:26:27.267065Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-15T18:25:21.621268Z digest=sha256:344e59deeadeba74dd89e25326b44fe1b93982e7a4303d0a8af78e41b84e63ea

Observation 0233a267-69d2-4fe4-8eb5-4edf7cdeec25 · outbound

This paper cites Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models.

Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models

Reference 62

Resolution
verified exact
local_arxiv, observed 2026-05-15T18:26:26.964302Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-15T18:25:21.621268Z digest=sha256:c42ad578776ffc2f4bc9999367e59efd354ddd207f6d9b58e7c5260522748b3c

Observation a5f3a305-0905-4ffe-9d69-5e604be1e28e · outbound

This paper cites Longvideobench: A benchmark for long-context interleaved video-language understanding.

Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models Longvideobench: A benchmark for long-context interleaved video-language understanding

Reference 63

Resolution
verified fuzzy
raw_fallback, observed 2026-05-15T18:26:27.284735Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-15T18:25:21.621268Z digest=sha256:a399b535aa404bbfa03bbcc4424482712fb9080ab0a98414a7769baf35b6cb5c

Observation 2037e54b-31c8-416e-b5fc-ae29cfee9e3a · outbound

This paper cites PyramidDrop: Accelerating Your Large Vision-Language Models via Pyramid Visual Redundancy Reduction.

Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models PyramidDrop: Accelerating Your Large Vision-Language Models via Pyramid Visual Redundancy Reduction

Reference 64

Resolution
verified exact
local_arxiv, observed 2026-05-15T18:26:26.974162Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-15T18:25:21.621268Z digest=sha256:3de235445bb507f6e19a4fab5abcc18662861349ceed3395ccb4ce1fe90798f5

Observation dc8c9f21-d6f1-439f-9ab8-4caacc9ff7d8 · outbound

This paper cites Conical visual concentration for efficient large vision-language models.

Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models Conical visual concentration for efficient large vision-language models

Reference 65

Resolution
verified fuzzy
raw_fallback, observed 2026-05-15T18:26:27.287311Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-15T18:25:21.621268Z digest=sha256:ec91cb0dff9685afddd7a5c628ebcb9ff829e1fce107cff0a11fb8bc549b926c

Observation 6c7c6dd1-3510-4128-a3f6-85ee4a6f7e05 · outbound

This paper cites PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning.

Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning

Reference 66

Resolution
verified exact
arxiv_id, observed 2026-05-15T20:21:58.165262Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-15T18:25:21.621268Z digest=sha256:4f926bc3963e9b88b0265a6a654678b7cb0e9a76534214b350cc71b76dec4a65

Observation 910a5ad1-c5bd-4f2a-bf96-d8646a932163 · outbound

This paper cites Topv: Compatible token pruning with infer- ence time optimization for fast and low-memory multimodal vision language model.

Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models Topv: Compatible token pruning with infer- ence time optimization for fast and low-memory multimodal vision language model

Reference 67

Resolution
verified fuzzy
raw_fallback, observed 2026-05-15T18:26:27.231490Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-15T18:25:21.621268Z digest=sha256:6fb565bf98eb5cf935fa69292e0a9b1fcb5e70c9cb2a1e654d4c0d317d12844c

Observation 6bb79c97-e5cc-467c-9eff-f274ef67b8d8 · outbound

This paper cites Visionzip: Longer is better but not necessary in vision language models.

Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models Visionzip: Longer is better but not necessary in vision language models

Reference 68

Resolution
verified fuzzy
raw_fallback, observed 2026-05-15T18:26:27.301957Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-15T18:25:21.621268Z digest=sha256:f2d47d4a701cbe99855e83fa8bcf405dce880416956e9966d9f65963167f3658

Observation 9b795a22-c186-4d82-9ceb-07e2ef51ca43 · outbound

This paper cites Atp-llava: Adaptive token pruning for large vision language models.

Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models Atp-llava: Adaptive token pruning for large vision language models

Reference 69

Resolution
verified fuzzy
raw_fallback, observed 2026-05-15T18:26:27.319661Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-15T18:25:21.621268Z digest=sha256:c837f946a4befb0a81da516d5cd9eb37bef0865b2215c7bef68d5364cad620b4

Observation 497c6d8d-8b7b-422b-a3cc-707d95f77df8 · outbound

This paper cites Video question answering with prior knowledge and object-sensitive learning.IEEE Transactions on Image Processing, 31:5936–5948.

Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models Video question answering with prior knowledge and object-sensitive learning.IEEE Transactions on Image Processing, 31:5936–5948

Reference 70

Resolution
verified fuzzy
raw_fallback, observed 2026-05-15T18:26:27.269399Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-15T18:25:21.621268Z digest=sha256:81b82b20161de91ac20bd52cad0115062a0450d6866b731644277f908a98fd79

Observation 19451f1f-e827-4dee-9245-d8da96bf0313 · outbound

This paper cites Sigmoid loss for language image pre-training.

Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models Sigmoid loss for language image pre-training

Reference 71

Resolution
verified fuzzy
raw_fallback, observed 2026-05-15T18:26:27.251311Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-15T18:25:21.621268Z digest=sha256:04e1b7c520c78ec13e43bbc08483c2097eaca9f20b6b2b3fb14cc036c7731a09

Observation 7accfd02-4002-4099-bac7-57c4f08f4157 · outbound

This paper cites arXiv preprint arXiv:2505.22654 , year=.

Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models arXiv preprint arXiv:2505.22654 , year=

Reference 72

Resolution
verified exact
arxiv_id, observed 2026-05-15T18:26:27.008012Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-15T18:25:21.621268Z digest=sha256:03190e0960fe991a9238e142ac3f64bca3183b2184b074ff31dcdb234ffd5e89

Observation 1fa2b1de-1857-4a5b-ae05-2bf9db620fb5 · outbound

This paper cites Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding.

Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding

Reference 73

Resolution
verified exact
local_arxiv, observed 2026-05-15T18:26:27.046262Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-15T18:25:21.621268Z digest=sha256:f61cd384b61c0994cf6f23726de8d41c73e44ea742845f08aa56af0c1e8a3e1f

Observation da801dc0-aab0-4ce9-ad44-52e5365121a7 · outbound

This paper cites Omnicharacter: Towards immersive role- playing agents with seamless speech-language personality interaction.

Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models Omnicharacter: Towards immersive role- playing agents with seamless speech-language personality interaction

Reference 74

Resolution
verified fuzzy
raw_fallback, observed 2026-05-15T18:26:27.356002Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-15T18:25:21.621268Z digest=sha256:75c8f757179e0caf9d4f05640a26c3ab91cd2a7679228f8bf8d902f8e42baa4e

Observation d6442c55-87c2-4295-8a0d-5f0a1c26eeb9 · outbound

This paper cites Text-video re- trieval with global-local semantic consistent learning.IEEE Transactions on Image Processing.

Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models Text-video re- trieval with global-local semantic consistent learning.IEEE Transactions on Image Processing

Reference 75

Resolution
verified fuzzy
raw_fallback, observed 2026-05-15T18:26:27.259230Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-15T18:25:21.621268Z digest=sha256:586c7266dce9962c73fafe0bd1f3c7f3315cf6a6aa27b9eb8c32b78c108c6db7

Observation 0360cb4f-239e-43ce-a38b-344b429992d2 · outbound

This paper cites Lmms-eval: Re- ality check on the evaluation of large multimodal models.

Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models Lmms-eval: Re- ality check on the evaluation of large multimodal models

Reference 76

Resolution
verified fuzzy
raw_fallback, observed 2026-05-15T18:26:27.348659Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-15T18:25:21.621268Z digest=sha256:fb0ce111af60d9a77ffa03f6a15df3f429a7e2d25c47a8823b59446c0e3f7e20

Observation 6d743b53-706a-4d33-b0e2-5707633b4264 · outbound

This paper cites [cls] attention is all you need for training-free visual token pruning: Make vlm inference faster.arXiv e- prints, pages arXiv–2412.

Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models [cls] attention is all you need for training-free visual token pruning: Make vlm inference faster.arXiv e- prints, pages arXiv–2412

Reference 77

Resolution
verified fuzzy
raw_fallback, observed 2026-05-15T18:26:27.245048Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-15T18:25:21.621268Z digest=sha256:877cb0bf64fa613eba67e225d7340fbc9b35448fb6d205e3e72ab1e9ea08fcec

Observation 6d510b01-19d4-4d2f-8829-9cf4b29286e2 · outbound

This paper cites SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference.

Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference

Reference 78

Resolution
verified exact
local_arxiv, observed 2026-05-15T18:26:27.029877Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-15T18:25:21.621268Z digest=sha256:04647dfd5033e4a7b6bf5af60fc58e1b613e1681ad587a3e5ad7af7c889ac398

Observation 3630be8a-844e-43a2-a638-af0d7ff4f7fd · outbound

This paper cites Llava- next: A strong zero-shot video understanding model.

Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models Llava- next: A strong zero-shot video understanding model

Reference 79

Resolution
verified fuzzy
raw_fallback, observed 2026-05-15T18:26:27.264782Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-15T18:25:21.621268Z digest=sha256:2f91e2111ea3571cf5a4a415c7f9a1625791339161b5eece5c52bbea15177622

Observation 29b998a0-8613-4a1a-a67d-e000e269443c · outbound

This paper cites LLaVA-Video: Video Instruction Tuning With Synthetic Data.

Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models LLaVA-Video: Video Instruction Tuning With Synthetic Data

Reference 80

Resolution
verified exact
local_arxiv, observed 2026-05-15T18:26:26.969533Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-15T18:25:21.621268Z digest=sha256:550eee0dda8a32aa5bec1c8c56f5f8c0bf9a65c5aa794f8ada036f305ed86848

Observation 32f9a511-da57-4916-ac08-9d42fb29f604 · outbound

This paper cites Video-3d llm: Learning position-aware video representation for 3d scene understanding.

Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models Video-3d llm: Learning position-aware video representation for 3d scene understanding

Reference 81

Resolution
verified fuzzy
raw_fallback, observed 2026-05-15T18:26:27.295927Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-15T18:25:21.621268Z digest=sha256:f93b46c562f3dc89cda21c4e20cb432b527f8e0bc88a1174072054425efe1715

Observation bf521ba6-1604-4758-b59a-e5446d40d410 · outbound

This paper cites LLaVA-3D: A Simple yet Effective Pathway to Empowering LMMs with 3D-awareness.

Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models LLaVA-3D: A Simple yet Effective Pathway to Empowering LMMs with 3D-awareness

Reference 82

Resolution
verified exact
arxiv_id, observed 2026-05-15T18:26:26.916148Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-15T18:25:21.621268Z digest=sha256:f1c1fd9442f6744689109c4c02745811a97f8e1da8f99f34ede4713d39858d94

Observation 0c57d810-ae1e-4d7e-81fc-2223d5a8a1ef · outbound

This paper cites InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models.

Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models

Reference 83

Resolution
verified exact
local_arxiv, observed 2026-05-15T18:26:27.070691Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-15T18:25:21.621268Z digest=sha256:b86f199106c6cee9e44bfe138d4cf20a4fdc842bbf6774a197914e57a3729ea5

Observation 07e72e4f-10d8-46c3-b257-6b3bfdb52187 · outbound

This paper cites Apollo: An explo- ration of video understanding in large multimodal models.

Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models Apollo: An explo- ration of video understanding in large multimodal models

Reference 84

Resolution
verified fuzzy
raw_fallback, observed 2026-05-15T18:26:27.306236Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-15T18:25:21.621268Z digest=sha256:ff73bd4635b04bc3761e5681d40f463ed5a5032241402c22fd068d8bd8641cfd

Pith citing papers

Observation d4204f00-7efd-4621-a236-4d9caf0f85ab · inbound

PoInit-of-View: Poisoning Initialization of Views Transfers Across Multiple 3D Reconstruction Systems cites this paper.

PoInit-of-View: Poisoning Initialization of Views Transfers Across Multiple 3D Reconstruction Systems Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models

Reference 19

Resolution
verified exact
local_arxiv, observed 2026-05-10T08:58:12.746045Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-10T08:53:40.661558Z digest=sha256:97163baf225f77ba38633a046412564d4fc74c427d3f7ce81d85e20a3fd9b9b8

Observation e38e845a-639f-486f-8083-1956331cd973 · inbound

OTT-Vid: Optimal Transport Temporal Token Compression for Video Large Language Models cites this paper.

OTT-Vid: Optimal Transport Temporal Token Compression for Video Large Language Models Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models

Reference 22

Resolution
verified exact
local_arxiv, observed 2026-05-13T05:52:22.303693Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-13T05:49:36.807884Z digest=sha256:d79999febcc0249f9ec4bf6a5bdca65c0c617116e0e8f39c24c52335a3d42002