Pith. sign in

Paper Citation Record · LEDGER

Advancing Visual Large Language Model for Multi-granular Versatile Perception

As of 8 August 2026, this Paper Citation Record lists 90 of 90 outbound references and 0 inbound Pith citation observations for arXiv:2507.16213.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2507.16213 v1

Coverage vector

measured 90 of 90 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-06T15:25:03.219873Z

measured 90 of 90 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-08T06:32:00.761636+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

90 of 90 outbound references displayed

  • verified exact1
  • verified fuzzy59
  • unresolved30
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 661f57e2-4e32-438c-b154-cecc90c08493 · outbound

This paper cites Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-06T15:25:02.937567Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:25:02.937567Z digest=sha256:1f162bafa04c1bacc8ac171f3822503970b9f00c434e57c69705e750692fd496

Observation a6ac2b05-fc2e-46be-ae01-43ad91b33401 · outbound

This paper cites End-to- end object detection with transformers.

Advancing Visual Large Language Model for Multi-granular Versatile Perception End-to- end object detection with transformers

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-06T15:25:02.941989Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:25:02.941989Z digest=sha256:e99ef3dd6ae5cba4f9ae57b1b5914e08d4e5b4924a25f1f06d6f07038c431ebf

Observation 31b4a95e-7c6f-425c-b80d-b069b98b2a3c · outbound

This paper cites See-through-text grouping for referring image segmentation.

Advancing Visual Large Language Model for Multi-granular Versatile Perception See-through-text grouping for referring image segmentation

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-06T15:25:02.944924Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:25:02.944924Z digest=sha256:b47ee67957f092f4039955b8a3a954a7e62e00a68f5fb781de1fd2e60fbe2854

Observation 47df1633-dd0f-4905-95a1-a9e790ebee79 · outbound

This paper cites Hybrid task cascade for instance seg- mentation.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Hybrid task cascade for instance seg- mentation

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-06T15:25:02.948306Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:25:02.948306Z digest=sha256:6ccdddb740ed877152c4b40d6716821b4a9b212f69bc91fdb53b421cda4b4a97

Observation 7f727e24-feac-491c-87f6-c04008f95c50 · outbound

This paper cites Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-06T15:25:02.951332Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:25:02.951332Z digest=sha256:181a31a2c574a18f648e449461d0fe9a4d4303e961419e4572a2e0f33776db6e

Observation 63d09218-62d6-4d70-9ae5-a041c6419513 · outbound

This paper cites Internvl: Scaling up vision foundation mod- els and aligning for generic visual-linguistic tasks.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Internvl: Scaling up vision foundation mod- els and aligning for generic visual-linguistic tasks

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-06T15:25:02.954769Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:25:02.954769Z digest=sha256:f198fca9a1ee1a03922cb06b6c290e7fc6ab97078261276b9373bd650bb8ec96

Observation bd29b6f5-3711-4d88-99ad-f6bbd9fa9895 · outbound

This paper cites Masked-attention mask transformer for universal image segmentation.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Masked-attention mask transformer for universal image segmentation

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-06T15:25:02.957777Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:25:02.957777Z digest=sha256:2bb1da3146494a9131a40c969eac93b60b860f94516c196ab65bea19324a97eb

Observation ab19eb58-68c8-41ff-8140-995f6a9f6a23 · outbound

This paper cites The cityscapes dataset for semantic urban scene understanding.

Advancing Visual Large Language Model for Multi-granular Versatile Perception The cityscapes dataset for semantic urban scene understanding

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-06T15:25:02.960867Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:25:02.960867Z digest=sha256:d196b48f203e3063db60d09ff4d573f1f355855d4897a9a512bae55380b77e03

Observation 898316a0-dea6-4eea-9633-15ea60828160 · outbound

This paper cites Phraseclick: toward achieving flexible interactive segmenta- tion by phrase and click.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Phraseclick: toward achieving flexible interactive segmenta- tion by phrase and click

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-06T15:25:02.963638Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:25:02.963638Z digest=sha256:95135458fa0dfad7c81d88363f084f587987671d17734447b16e5fec00a700e9

Observation b1f8d708-1c0e-4e9b-9ad4-979bbb24ecc8 · outbound

This paper cites Vision-language transformer and query generation for refer- ring segmentation.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Vision-language transformer and query generation for refer- ring segmentation

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-06T15:25:02.966434Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:25:02.966434Z digest=sha256:a7d79d321ef74fb1444bcc20ae49e7a93bfbfac629bcc1637f040c5d34a9397f

Observation 83ff79e8-4352-442e-be00-2935499567f7 · outbound

This paper cites Open- vocabulary universal image segmentation with maskclip.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Open- vocabulary universal image segmentation with maskclip

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-06T15:25:02.969366Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:25:02.969366Z digest=sha256:dc18916d7afb3bc5c08ae58738bbad974359046620beb901d9fa65e74758e1de

Observation 1c7f3ab4-afa8-4929-a9b5-0f808f00106e · outbound

This paper cites The pascal visual object classes (voc) challenge.

Advancing Visual Large Language Model for Multi-granular Versatile Perception The pascal visual object classes (voc) challenge

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-06T15:25:02.972553Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:25:02.972553Z digest=sha256:8237de444141fd707f76d83b7562a07ab024e3aa38c0f9bbbb7c085549f86737

Observation 7bcd79f2-9a5a-4a80-97f0-ca091d410fc5 · outbound

This paper cites Scott, and Weilin Huang.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Scott, and Weilin Huang

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.879861Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T15:25:02.975450Z digest=sha256:247633b97356f866a03cae32d2903484d14a747b3a34ece6aa1e41a35ba5e3ac

Observation 663cab1d-8cc8-4886-9358-6fe0e6212210 · outbound

This paper cites Prompt- det: Towards open-vocabulary detection using uncurated im- ages.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Prompt- det: Towards open-vocabulary detection using uncurated im- ages

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.872634Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T15:25:02.978290Z digest=sha256:fe6197b7f08f4a908a20bed0fafee48d51526b37ea04f5bafca02b4710f188f5

Observation 44550596-7f95-4528-9499-cfb82c36b281 · outbound

This paper cites Instagen: Enhancing object detection by training on syn- thetic dataset.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Instagen: Enhancing object detection by training on syn- thetic dataset

Reference 15

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.865238Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T15:25:02.981188Z digest=sha256:d47211cddb534c45eb7369a34826598e542997ce96e0eb4e0615080fcbb84cf3

Observation d86fcecc-3ec4-41d0-83dd-71f50e25360e · outbound

This paper cites Video-r1: Reinforcing video reasoning in mllms, 2025.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Video-r1: Reinforcing video reasoning in mllms, 2025

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.857596Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T15:25:02.983811Z digest=sha256:5f59d44ebd2da48cbabbdc2055a620a08656bac4bbef4f6f8247dce59f4b36de

Observation 76ea7b3a-3f72-4747-b11b-86cc895129d4 · outbound

This paper cites Frozen-detr: Enhancing detr with image understanding from frozen foundation models.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Frozen-detr: Enhancing detr with image understanding from frozen foundation models

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.849441Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T15:25:02.987069Z digest=sha256:f8af06728a21113a2f80171dac49cf0d98ad3362b115bed25d9f90da51ad9b93

Observation 4a16c1d6-ff58-4e98-9d1d-9379d7b4e173 · outbound

This paper cites Open-vocabulary object detection via vision and language knowledge distillation.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Open-vocabulary object detection via vision and language knowledge distillation

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.841674Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T15:25:02.989754Z digest=sha256:0afc852aa6b77b555844b60db8ae00ac841c17dc567ebc8bc8acfe8be3d4a82b

Observation 99d82295-8421-4552-897d-37e54cda6251 · outbound

This paper cites Dataseg: Taming a universal multi-dataset multi-task segmentation model.Ad- vances in Neural Information Processing Systems, 36, 2024.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Dataseg: Taming a universal multi-dataset multi-task segmentation model.Ad- vances in Neural Information Processing Systems, 36, 2024

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.833711Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T15:25:02.992355Z digest=sha256:948eac67242834887a46d9a70f4d0fde698029a24c4dd1ad47924d36b684c161

Observation 6d5f152c-c330-4b77-a032-e1b528425c83 · outbound

This paper cites Textbooks Are All You Need.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Textbooks Are All You Need

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-06T15:25:02.996158Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:25:02.996158Z digest=sha256:d629049fcf85ecfb2e4aea11f83755d55dbea4b42703fef08ea0312e54b87912

Observation 7a0f9581-8649-42bc-a3c2-150d50c2c733 · outbound

This paper cites Llava-uhd: An lmm perceiving any aspect ratio and high- resolution images.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Llava-uhd: An lmm perceiving any aspect ratio and high- resolution images

Reference 21

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.825303Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T15:25:02.999268Z digest=sha256:82665bf9182f628015ad0068b28be12556288361620b8099cac1ca4f2f116292

Observation d7750ed9-fcd1-4a89-b2fe-202c81e2919c · outbound

This paper cites Open-vocabulary semantic segmentation with decou- pled one-pass network.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Open-vocabulary semantic segmentation with decou- pled one-pass network

Reference 22

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.817355Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T15:25:03.002244Z digest=sha256:8ce60fb9053ecb823c562180a554898d4b305188eeb793b811eb61c3fd4371b8

Observation 4b126936-388e-4bcb-9fb3-ce6583a596a5 · outbound

This paper cites Mask r-cnn.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Mask r-cnn

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-06T15:25:03.005059Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:25:03.005059Z digest=sha256:38b3e1965d46b932bebedf53b0e39ff8ae569690516c877eb02f71c2ac4c0f0a

Observation 532f1273-a3a6-4c33-8345-f58a67eb9341 · outbound

This paper cites Bi-directional relationship inferring net- work for referring image segmentation.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Bi-directional relationship inferring net- work for referring image segmentation

Reference 24

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.804540Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T15:25:03.007733Z digest=sha256:571e041a07bddbe45d979be9dfa9f57f9fc5558935ecfada70bba8cf485d2588

Observation f170f6c4-87ad-442b-9138-18c255b56c3c · outbound

This paper cites Densely connected parameter- efficient tuning for referring image segmentation, 2025.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Densely connected parameter- efficient tuning for referring image segmentation, 2025

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.797166Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T15:25:03.010900Z digest=sha256:09bd2279f0256b0b5ab5475e8c0cbe1b6b6d226bb6617b6b3a37390c23f2b28c

Observation 8937b392-bcdb-4806-998f-86ff53dc2c35 · outbound

This paper cites Referring im- age segmentation via cross-modal progressive comprehen- sion.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Referring im- age segmentation via cross-modal progressive comprehen- sion

Reference 26

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.789460Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T15:25:03.013622Z digest=sha256:c2085582966c755bb350bade0e26647b37d87c19fca7ca9f8a030227e1524f76

Observation 4af64b3f-61c2-4889-81eb-fa0ee31fc2fe · outbound

This paper cites Linguistic structure guided context modeling for referring image segmentation.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Linguistic structure guided context modeling for referring image segmentation

Reference 27

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.781953Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T15:25:03.016386Z digest=sha256:d5afececc209c3522f2f32f70e0b72aaa68cfc8f3540049e04686eb1659355b2

Observation 742758de-c6f1-475c-9ffa-76cb73bafa49 · outbound

This paper cites Oneformer: One transformer to rule universal image segmentation.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Oneformer: One transformer to rule universal image segmentation

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.774039Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T15:25:03.020091Z digest=sha256:73388dcc3bcc06722d5aaac740edf9d001222983d86ec309bbf833f6adee8ee0

Observation 31ef1670-998f-420a-ba23-576d05d84415 · outbound

This paper cites Mdetr- modulated detection for end-to-end multi-modal understand- ing.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Mdetr- modulated detection for end-to-end multi-modal understand- ing

Reference 29

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.765376Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T15:25:03.022727Z digest=sha256:cb09889784c37863fa01dadad9837aabcfba4f6ac9f11d6be5b552d13b9b91a0

Observation d53df0f2-aa30-40d1-9b56-9037c47276d8 · outbound

This paper cites A spoken language dataset of descrip- tions for speech-based grounded language learning.

Advancing Visual Large Language Model for Multi-granular Versatile Perception A spoken language dataset of descrip- tions for speech-based grounded language learning

Reference 30

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.756673Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T15:25:03.025578Z digest=sha256:170bdd48ee1cc22f616509891a829a73d4339829e8b56afcb173adb72dd5e518

Observation 0b4fbcd1-5e82-4d56-8527-7aebafa74693 · outbound

This paper cites F-vlm: Open-vocabulary object detection upon frozen vision and language models.

Advancing Visual Large Language Model for Multi-granular Versatile Perception F-vlm: Open-vocabulary object detection upon frozen vision and language models

Reference 31

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.748921Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T15:25:03.028433Z digest=sha256:31900902e5ea4c02a4bb4da050f83cbfac0b363e3b77c6d685b84b807500a02e

Observation 8230abef-3c1f-45fa-a6dd-28c842cf370b · outbound

This paper cites LISA: Reasoning Segmentation via Large Language Model.

Advancing Visual Large Language Model for Multi-granular Versatile Perception LISA: Reasoning Segmentation via Large Language Model

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-06T15:25:03.031233Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:25:03.031233Z digest=sha256:ae3715c4a5e926cea0f1a9fe05d10395b4c956d4501388f3b7d3e71b0d3f2036

Observation b3c4cae8-f981-4ecc-96ce-7fb7dd9ae564 · outbound

This paper cites Lisa: Reasoning segmentation via large language model.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Lisa: Reasoning segmentation via large language model

Reference 33

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.740982Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T15:25:03.034435Z digest=sha256:401bd880d45cfde5b091d1706861c052ec18c3e3d6edfccabb4194e6da25ac28

Observation 0c07afee-1d4f-4160-ae0d-529ef1a26bd5 · outbound

This paper cites Discobox: Weakly supervised instance segmentation and semantic correspondence from box super- vision.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Discobox: Weakly supervised instance segmentation and semantic correspondence from box super- vision

Reference 34

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.733055Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T15:25:03.037235Z digest=sha256:5062cb202b71862a6ec678829cf701091880b696fc9b3dacb9fa8a31dad7c026

Observation 63fea573-a68e-4e5b-8d5d-f9b7e661d10f · outbound

This paper cites Vision Transformers Are Good Mask Auto-Labelers.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Vision Transformers Are Good Mask Auto-Labelers

Reference 35

Resolution
verified exact
local_arxiv, observed 2026-08-06T15:25:03.315861Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T15:25:03.040147Z digest=sha256:3dbe3e1772b9c57d4ea13cbcdc8b9108715ef73ea05841f6f3322f318c208bf5

Observation b97777ef-b346-48bf-9c22-83ad347d63df · outbound

This paper cites Mask dino: Towards a unified transformer-based framework for object detection and segmentation.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Mask dino: Towards a unified transformer-based framework for object detection and segmentation

Reference 36

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.725166Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T15:25:03.044358Z digest=sha256:c2e6fc53c3f174202d35d9a0181acc80880ccc7fb3338aa4305b16b00e245297

Observation c765920b-5ec7-4141-bf16-ba1e6b80c835 · outbound

This paper cites Distilling detr with visual-linguistic knowledge for open-vocabulary object detection.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Distilling detr with visual-linguistic knowledge for open-vocabulary object detection

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-06T15:25:03.047346Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:25:03.047346Z digest=sha256:5f37e45fae4c9cfa5258b8b192e93b33fa1f293916368ffe46d49e3b54c9f34a

Observation 5f13d64f-ef6b-4553-9b6b-3ee39ac0a1b7 · outbound

This paper cites Grounded language-image pre-training.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Grounded language-image pre-training

Reference 38

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.711995Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T15:25:03.051037Z digest=sha256:de9e9cffd9fbababcd98c2e23c3f0a210a9d7a0b01cdee5e0e3081eac75d6ed6

Observation ee04b3ad-bf10-4c3d-9327-b6faafbf605d · outbound

This paper cites Box-supervised instance seg- mentation with level set evolution.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Box-supervised instance seg- mentation with level set evolution

Reference 39

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.703807Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T15:25:03.053794Z digest=sha256:38b2b315a6cde73652ed0d439c2644c61644a70a8ca9c2dd95e7e75169091e0a

Observation 8aed0da2-f026-4012-b0c5-292b7ad09795 · outbound

This paper cites Fully convolutional networks for panoptic segmentation with point-based supervision.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Fully convolutional networks for panoptic segmentation with point-based supervision

Reference 40

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.695829Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T15:25:03.056437Z digest=sha256:47ef53408e43ca41ff40381591646b5917d89cec78c63a2327e4e13ceb26cfab

Observation 00a7a282-fc22-4e44-a7d1-25e6ddf1e20e · outbound

This paper cites A real-time cross-modality correlation fil- tering method for referring expression comprehension.

Advancing Visual Large Language Model for Multi-granular Versatile Perception A real-time cross-modality correlation fil- tering method for referring expression comprehension

Reference 41

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.687610Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T15:25:03.059281Z digest=sha256:fad9ecddc05263a42e736c82c997411e02d99157a1f0408ad586a4793e14702e

Observation 4a1657f9-3b3c-4191-a321-b25b7226597a · outbound

This paper cites Belongie, James Hays, Pietro Perona, Deva Ramanan, Piotr Doll ´ar, and C.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Belongie, James Hays, Pietro Perona, Deva Ramanan, Piotr Doll ´ar, and C

Reference 42

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.680245Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T15:25:03.061929Z digest=sha256:7c862adbb4428ae2eb80524887c3158165143f704a4f9a5a34df7c2b127c39e6

Observation 2651bf09-4a8b-45ec-9acb-82ad86de3712 · outbound

This paper cites Gres: Gener- alized referring expression segmentation.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Gres: Gener- alized referring expression segmentation

Reference 43

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.672328Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T15:25:03.064565Z digest=sha256:16d5966bfa7ef1582a271acecb106c46d765ba91cf6fa72373378fc8032889d6

Observation 516d1c06-fccd-472e-9311-c0d9b60eae89 · outbound

This paper cites Visual instruction tuning.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Visual instruction tuning

Reference 44

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.663833Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T15:25:03.067583Z digest=sha256:656daf75f48b63f027f5bc75a7b13dd06f97d29a2c22506002a5348cf9effe43

Observation 396ea93a-94bd-43c9-bcfe-5e7eadd99cda · outbound

This paper cites Poly- former: Referring image segmentation as sequential poly- gon generation.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Poly- former: Referring image segmentation as sequential poly- gon generation

Reference 45

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.655401Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T15:25:03.070394Z digest=sha256:32bca29dd11e62ad4de814dfb86e297e94b43094ead2d7bb85a757bc04ff600e

Observation 0b59ecd3-f4d4-4402-b6b1-8d487fe0098b · outbound

This paper cites Grounding dino: Marrying dino with grounded pre-training for open-set object detection.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Grounding dino: Marrying dino with grounded pre-training for open-set object detection

Reference 46

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.647545Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T15:25:03.073090Z digest=sha256:7a88ff77fddf69cd04079c63c50df373b34b2dc6d3dc566684039f472c22967d

Observation 4bc258ef-85e1-45bc-9f4e-ec3f03888c67 · outbound

This paper cites Knowledge-guided pairwise recon- struction network for weakly supervised referring expression grounding.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Knowledge-guided pairwise recon- struction network for weakly supervised referring expression grounding

Reference 47

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.638476Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T15:25:03.075993Z digest=sha256:82e9f7074147fb0a0a753190882c0572e7ab5dc378fdef0915672a7879bac28f

Observation b5080384-84b0-44e6-b417-7c5cd23d5ae8 · outbound

This paper cites Learn- ing cross-modal context graph for visual grounding.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Learn- ing cross-modal context graph for visual grounding

Reference 48

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.630597Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T15:25:03.078779Z digest=sha256:f85bc9845b1c192c4180fc4e68b2ecd15f3bdc3e0c5e686168a3f776e1017812

Observation 11f99a97-e9db-4615-9b27-6c0bb48cc3bd · outbound

This paper cites Swin transformer: Hierarchical vision transformer using shifted windows.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Swin transformer: Hierarchical vision transformer using shifted windows

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-06T15:25:03.081686Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:25:03.081686Z digest=sha256:d6a09a18502d3c067d481d46ae139af9e50dbd18bc4d5b69108fd5e1052b7e8a

Observation 90d19aa5-8690-4e28-99a6-18f1f3dec4e4 · outbound

This paper cites Visual- rft: Visual reinforcement fine-tuning, 2025.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Visual- rft: Visual reinforcement fine-tuning, 2025

Reference 50

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.617590Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T15:25:03.084391Z digest=sha256:81dac8e3890ac982c5d3de959f9b5ca8b9dc601d006ea9190708f3400b6b4d52

Observation e9b21f22-e97f-48cb-9b98-250a81250791 · outbound

This paper cites DeepSeek-VL: Towards Real-World Vision-Language Understanding.

Advancing Visual Large Language Model for Multi-granular Versatile Perception DeepSeek-VL: Towards Real-World Vision-Language Understanding

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-06T15:25:03.086999Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:25:03.086999Z digest=sha256:b0c52e8dbb6731a6dd698a2075517be6d52605df2c04946e4a807e0bb407991e

Observation adf0279d-f848-4aa0-bb46-befbf3392261 · outbound

This paper cites Scaling open-vocabulary object detection.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Scaling open-vocabulary object detection

Reference 52

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.609171Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T15:25:03.090622Z digest=sha256:adab46f51120c25dac1e020cae5fd6155944122bfd8176b3dbae1ab02fd2b086

Observation 01d20d78-7508-4559-a76f-22cb2c4321b9 · outbound

This paper cites The role of context for object detection and semantic segmentation in the wild.

Advancing Visual Large Language Model for Multi-granular Versatile Perception The role of context for object detection and semantic segmentation in the wild

Reference 53

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.600915Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T15:25:03.093349Z digest=sha256:4c4ac847402e8b650e7b43b7f6ac6e7755316d06ee40399d799ea03b4ebd6eaa

Observation 50d46028-436f-4fc3-a959-83ce2362efd2 · outbound

This paper cites Mod- eling context between objects for referring expression under- standing.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Mod- eling context between objects for referring expression under- standing

Reference 55

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.592309Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T15:25:03.099243Z digest=sha256:0b097305ac570391851b66bdba423c9c1bef89a458111f3e8a3fe679ea124867

Observation c58cdb6b-764e-4a4f-bce1-383a37d9f6e5 · outbound

This paper cites Vision-aware text features in referring image segmentation: From object understanding to context understanding, 2024.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Vision-aware text features in referring image segmentation: From object understanding to context understanding, 2024

Reference 56

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.584054Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T15:25:03.101957Z digest=sha256:cc447ca40ebe4f8d565dd2f01e9c05151bf36e5498b8b0aa50fffc89abf532c1

Observation 15adb626-08b6-4fb3-8aef-df41b9d5c851 · outbound

This paper cites GLaMM: Pixel Grounding Large Multimodal Model.

Advancing Visual Large Language Model for Multi-granular Versatile Perception GLaMM: Pixel Grounding Large Multimodal Model

Reference 57

Resolution
unresolved
no resolver link, observed 2026-08-06T15:25:03.104795Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:25:03.104795Z digest=sha256:420237d16df05a83ca30321f5ec5b72b9e78ada5f3df50a62591815b0967d306

Observation 5cf9db23-a1b3-4486-9bd3-6d6313aaeca9 · outbound

This paper cites PixelLM: Pixel Reasoning with Large Multimodal Model.

Advancing Visual Large Language Model for Multi-granular Versatile Perception PixelLM: Pixel Reasoning with Large Multimodal Model

Reference 58

Resolution
unresolved
no resolver link, observed 2026-08-06T15:25:03.107930Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:25:03.107930Z digest=sha256:f2320c27363e3b7a816f2e572ceedb57477ca39975bece088dc39a64d30af234

Observation cc0390e1-8c0b-464c-999f-62c436354f77 · outbound

This paper cites Pixellm: Pixel reasoning with large multimodal model.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Pixellm: Pixel reasoning with large multimodal model

Reference 59

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.574542Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T15:25:03.110890Z digest=sha256:d739ef659b606944d02a4de27af215eadc46ccb3b6949063e02de850ae94cac4

Observation 13f2513a-d917-4376-bb03-c9e5c923fe19 · outbound

This paper cites Grounding of textual phrases in images by reconstruction.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Grounding of textual phrases in images by reconstruction

Reference 60

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.565223Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T15:25:03.114638Z digest=sha256:b95c13cf629da138ab9e2327019b87f4ae917a2e9522def597d864ea4e96551a

Observation d5a2c00e-8dde-4ada-bc17-2b65970cbd35 · outbound

This paper cites Objects365: A large-scale, high-quality dataset for object detection.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Objects365: A large-scale, high-quality dataset for object detection

Reference 61

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.556025Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T15:25:03.117431Z digest=sha256:80ceb08c06bc2273af01ca4e80913855cecf2511e7e4af7947fcb0d2a8713828

Observation b2d08439-a2d8-4034-97ca-e4c024525b74 · outbound

This paper cites an unresolved cited work.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Unresolved cited work

Reference 62

Resolution
unresolved
no resolver link, observed 2026-08-06T15:25:03.120304Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:25:03.120304Z digest=sha256:150309e04ff24f355416675a00447e3794ea141700e5c7992ecc0731408c2f35

Observation ef191971-6719-4529-8669-d85a212a1bb2 · outbound

This paper cites Conceptual captions: A cleaned, hypernymed, im- age alt-text dataset for automatic image captioning.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Conceptual captions: A cleaned, hypernymed, im- age alt-text dataset for automatic image captioning

Reference 63

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.541868Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T15:25:03.123158Z digest=sha256:163fcc1a28eb3b4b81982672b809670a7301be096535f9493b566c9171694e12

Observation cff9cb04-e1f7-441d-ad2e-147517293b21 · outbound

This paper cites Boxinst: High-performance instance segmentation with box annotations.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Boxinst: High-performance instance segmentation with box annotations

Reference 64

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.533787Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T15:25:03.125882Z digest=sha256:75e011ea05b789a0627ffaefab0f8061820488facc519fba68a8799f28ec88c5

Observation 34336494-a6a6-4418-ab58-be450b0b032f · outbound

This paper cites Max-deeplab: End-to-end panoptic segmentation with mask transformers.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Max-deeplab: End-to-end panoptic segmentation with mask transformers

Reference 65

Resolution
unresolved
no resolver link, observed 2026-08-06T15:25:03.128732Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:25:03.128732Z digest=sha256:b243fbc2cbe64ebd2aa5232fb6b4f05ee83cce6efa17c5b313ec353e48f2e0b5

Observation 98f4faab-7e40-497d-b19a-127eb7ff4cb4 · outbound

This paper cites OV-DINO: Unified Open-Vocabulary Detection with Language-Aware Selective Fusion.

Advancing Visual Large Language Model for Multi-granular Versatile Perception OV-DINO: Unified Open-Vocabulary Detection with Language-Aware Selective Fusion

Reference 66

Resolution
unresolved
no resolver link, observed 2026-08-06T15:25:03.131454Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:25:03.131454Z digest=sha256:5957c703980d4ac8f7dda5c954fe15c17d5d4b0f0b10e0fe86dea368ea8ce257

Observation bb6d06a3-b170-4103-bd28-90dcb74f6005 · outbound

This paper cites Neighbourhood watch: Refer- ring expression comprehension via language-guided graph attention networks.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Neighbourhood watch: Refer- ring expression comprehension via language-guided graph attention networks

Reference 67

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.518088Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T15:25:03.134522Z digest=sha256:df902b708dc4ed907c6b94d7d6d673ff3068523ee82dcd1edcafccab6aee25ad

Observation cb440322-a61d-4a06-8915-060afcbbc754 · outbound

This paper cites Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding

Reference 68

Resolution
unresolved
no resolver link, observed 2026-08-06T15:25:03.137410Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:25:03.137410Z digest=sha256:cebdb8cdc9e0ef1db4bad79d4ef7d87f10148aae17497a451081a84003fcee5d

Observation afadd51a-cd52-44c8-b374-d943f9aeb7d6 · outbound

This paper cites Cris: Clip- driven referring image segmentation.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Cris: Clip- driven referring image segmentation

Reference 69

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.509852Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T15:25:03.140488Z digest=sha256:0464aab74c4ce4f323a1f2abba550a7cadb46fb55796e0db3e59969b81d8f061

Observation 25011881-7661-4cc4-ad98-2e6e512407ab · outbound

This paper cites LaSagnA: Language-based Segmentation Assistant for Complex Queries.

Advancing Visual Large Language Model for Multi-granular Versatile Perception LaSagnA: Language-based Segmentation Assistant for Complex Queries

Reference 70

Resolution
unresolved
no resolver link, observed 2026-08-06T15:25:03.143395Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:25:03.143395Z digest=sha256:e586ef64c9be86a6ab1408450049d00bb32926b5f0770dd199bd031d35cdd705

Observation 6c1f6087-bed1-425b-84d5-aa0f2c9c261e · outbound

This paper cites Hyperseg: Hybrid segmentation assistant with fine-grained visual perceiver.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Hyperseg: Hybrid segmentation assistant with fine-grained visual perceiver

Reference 71

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.501288Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T15:25:03.146653Z digest=sha256:1478d7dbe16e28ade6512948342242540e5f1cd6120039f31e994f74a4aec56e

Observation 02f804a7-f5e7-4b3a-ace8-42250d64c4e5 · outbound

This paper cites Chain-of-thought prompting elicits reasoning in large lan- guage models.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Chain-of-thought prompting elicits reasoning in large lan- guage models

Reference 72

Resolution
unresolved
no resolver link, observed 2026-08-06T15:25:03.149351Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:25:03.149351Z digest=sha256:6e6c7484ba5b0f40b4cb099a026365a3df5e215d47f49a1b71b1dd033e3d35ed

Observation 6db5f32d-b051-46b5-9ea5-90634e417c42 · outbound

This paper cites Aligning bag of regions for open- vocabulary object detection.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Aligning bag of regions for open- vocabulary object detection

Reference 73

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.487596Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T15:25:03.152081Z digest=sha256:cdef727f59d8e1a34e6be46e0e5e1c0881efa988e306a25016625f793aa6db67

Observation 2c52f9d3-d099-4c71-a893-df38831c04ce · outbound

This paper cites GSVA: Generalized Segmentation via Multimodal Large Language Models.

Advancing Visual Large Language Model for Multi-granular Versatile Perception GSVA: Generalized Segmentation via Multimodal Large Language Models

Reference 74

Resolution
unresolved
no resolver link, observed 2026-08-06T15:25:03.155595Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:25:03.155595Z digest=sha256:a994da3c2b645426827b78d51c502ad76b6a830a309262f03f73dc04fdb3bce1

Observation 724b5fbe-581d-4ebf-9e0c-5a5490c7dcda · outbound

This paper cites Upsnet: A unified panoptic segmentation network.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Upsnet: A unified panoptic segmentation network

Reference 75

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.480035Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T15:25:03.158835Z digest=sha256:d6e563e8c04f6dc77ddca533647547c0eac32480c55c140d48a54116dbe23ae5

Observation ba103859-1933-47a2-b932-916dd704c33b · outbound

This paper cites A simple baseline for open- vocabulary semantic segmentation with pre-trained vision- language model.

Advancing Visual Large Language Model for Multi-granular Versatile Perception A simple baseline for open- vocabulary semantic segmentation with pre-trained vision- language model

Reference 76

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.472575Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T15:25:03.162083Z digest=sha256:5ec59186ec4fc55f0e3318b33e7a8379b6331ed161e001d54283f3c262c0687f

Observation ef29d085-269c-400e-9da7-81aeaa72966c · outbound

This paper cites Dynamic graph at- tention for referring expression comprehension.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Dynamic graph at- tention for referring expression comprehension

Reference 77

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.464252Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T15:25:03.165628Z digest=sha256:dc6469a8bf2606f67c590d3cfd395bea8b9e07fa4598873d6cdf2ef36168f296

Observation 0fa72d14-b0f8-446d-8546-d554b1f3a4a6 · outbound

This paper cites R1-onevision: Advancing generalized multimodal reasoning through cross- modal formalization, 2025.

Advancing Visual Large Language Model for Multi-granular Versatile Perception R1-onevision: Advancing generalized multimodal reasoning through cross- modal formalization, 2025

Reference 78

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.456045Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T15:25:03.170854Z digest=sha256:9e7cb19bd680fc79ae0775417897f8f3878d0d6e064ce0648a6d3a31acefff3b

Observation c0a577bb-61fe-4fe8-ae83-69622b4af0f6 · outbound

This paper cites Lavt: Language-aware vision transformer for referring image segmentation.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Lavt: Language-aware vision transformer for referring image segmentation

Reference 79

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.447077Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T15:25:03.175849Z digest=sha256:4a1a784527c5b2d639ac55273e222fe8ba9c3f050411cb7c0e89e48d7c701310

Observation 4c3979b2-5e45-45c8-9d4d-5aeb617b094f · outbound

This paper cites Modeling context in referring expres- sions.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Modeling context in referring expres- sions

Reference 80

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.438827Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T15:25:03.181626Z digest=sha256:049507896f426ba0f6528d1bc81eb9d0a2bf95243c175c9aae94307241f483a8

Observation b3d0bdee-5d38-4dca-beba-9523bd29be32 · outbound

This paper cites Modeling context in referring expres- sions.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Modeling context in referring expres- sions

Reference 81

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.430991Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T15:25:03.186291Z digest=sha256:9abd4278c236532433d37eeec0b780f4ac6474aa6a2061c2ad3b7a9a464677f9

Observation 55de4384-c3c4-4386-a750-18a9859a40bb · outbound

This paper cites v-clr: View-consistent learning for open-world instance seg- mentation.

Advancing Visual Large Language Model for Multi-granular Versatile Perception v-clr: View-consistent learning for open-world instance seg- mentation

Reference 82

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.422698Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T15:25:03.192454Z digest=sha256:c69c2b493f447296af1371b6a0b4b2b810837ec3861a20f3e8d98cfd7ec43ca1

Observation 025244fb-29af-46ee-accf-28ea3e981ce6 · outbound

This paper cites an unresolved cited work.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Unresolved cited work

Reference 83

Resolution
unresolved
raw_fallback, observed 2026-08-06T15:25:03.414643Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T15:25:03.200344Z digest=sha256:82bb3992c82f5b34b4ce4c7f1deb7c38f92c6f42aae4e01e70b26c0542b964a9

Observation 18bcd259-4f19-4ff8-b318-985f7371594f · outbound

This paper cites Grounding referring expressions in images by variational context.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Grounding referring expressions in images by variational context

Reference 84

Resolution
unresolved
no resolver link, observed 2026-08-06T15:25:03.203135Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:25:03.203135Z digest=sha256:be70f0429cfda61b15adbd93f21c45c611211e2e6f718589cbc2dcb0f8d4afdb

Observation 765e2d08-ab87-4cbf-bb9c-cbe49607ab6e · outbound

This paper cites A simple framework for open-vocabulary segmentation and detection.

Advancing Visual Large Language Model for Multi-granular Versatile Perception A simple framework for open-vocabulary segmentation and detection

Reference 85

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.401452Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T15:25:03.205535Z digest=sha256:c14e06158743d4b8f783d8bcc7a80bd5f17fdc6730b94ab8a2329b534ee1e3ff

Observation a3953e7e-616e-4d20-b302-4430a72a2996 · outbound

This paper cites R1-vl: Learning to reason with multimodal large language models via step- wise group relative policy optimization, 2025.

Advancing Visual Large Language Model for Multi-granular Versatile Perception R1-vl: Learning to reason with multimodal large language models via step- wise group relative policy optimization, 2025

Reference 86

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.392598Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T15:25:03.207897Z digest=sha256:1338ab96d27a0187926b6b24724700f7f3ba63bc63cd4ee16e507d3087facb57

Observation b42c9963-2ac2-42be-af19-2bc9d7ac31f2 · outbound

This paper cites OMG-LLaVA: Bridging Image-level, Object-level, Pixel-level Reasoning and Understanding.

Advancing Visual Large Language Model for Multi-granular Versatile Perception OMG-LLaVA: Bridging Image-level, Object-level, Pixel-level Reasoning and Understanding

Reference 87

Resolution
unresolved
no resolver link, observed 2026-08-06T15:25:03.210189Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:25:03.210189Z digest=sha256:21bc2fc3750b01815dc50ab8f417174087b0c0062c0927bf7567c578efbf6188

Observation 1d326492-bdc2-4deb-9447-6726ca52a6e7 · outbound

This paper cites Psalm: Pixelwise segmentation with large multi-modal model.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Psalm: Pixelwise segmentation with large multi-modal model

Reference 88

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.384291Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T15:25:03.212699Z digest=sha256:291dfeb095127c69d68c1b48bb9eae814a9b0ceef8886b1a01cd9e6a076b2a7c

Observation c5aaccc8-7ae1-40fb-a4bf-45c33e0a6902 · outbound

This paper cites Semantic under- standing of scenes through the ade20k dataset.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Semantic under- standing of scenes through the ade20k dataset

Reference 89

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.376001Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T15:25:03.215135Z digest=sha256:c3015c3a43f18fc432d20a1f26f6308a2ffdaca8c70737a489d7dec97976ecf3

Observation 27c1b8fe-6856-40f3-812b-6a0db2ab204d · outbound

This paper cites Generalized decoding for pixel, image, and lan- guage.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Generalized decoding for pixel, image, and lan- guage

Reference 90

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.367658Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T15:25:03.217526Z digest=sha256:2f25faa8c7317ef369f652de11246a7e7f943fd6e3aed84cc9e9117cc160e731

Observation ee94fd56-822c-4f04-8f19-475ccc1c2842 · outbound

This paper cites Segment everything everywhere all at once.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Segment everything everywhere all at once

Reference 91

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.359490Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T15:25:03.219873Z digest=sha256:9ff7ffae6127cd9a9970ab4d20ec64007b0995ff74c19c86b65b1cf9e8511a7b

Pith citing papers

No inbound Pith citation observations are available.