Pith. sign in

Paper Citation Record · LEDGER

Advancing Visual Large Language Model for Multi-granular Versatile Perception

As of 15 August 2026, this Paper Citation Record lists 90 of 90 outbound references and 0 inbound Pith citation observations for arXiv:2507.16213.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2507.16213 v1

Coverage vector

measured 90 of 90 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-06T15:25:03.219873Z

measured 90 of 90 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-15T06:32:42.880941+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

90 of 90 outbound references displayed

  • verified exact1
  • verified fuzzy59
  • unresolved30
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 661f57e2-4e32-438c-b154-cecc90c08493 · outbound

This paper cites Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-06T15:25:02.937567Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:25:02.937567Z digest=sha256:38520299b8cddcdab8b0b3553f0308cc85c324e4057aba6ba844c7e08d914274

Observation a6ac2b05-fc2e-46be-ae01-43ad91b33401 · outbound

This paper cites End-to- end object detection with transformers.

Advancing Visual Large Language Model for Multi-granular Versatile Perception End-to- end object detection with transformers

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-06T15:25:02.941989Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:25:02.941989Z digest=sha256:f7bd4e141014658494f147fbcede84d293c1818bfd091e4d5a91112e510ad737

Observation 31b4a95e-7c6f-425c-b80d-b069b98b2a3c · outbound

This paper cites See-through-text grouping for referring image segmentation.

Advancing Visual Large Language Model for Multi-granular Versatile Perception See-through-text grouping for referring image segmentation

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-06T15:25:02.944924Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:25:02.944924Z digest=sha256:0f3fa15357ffa1d014a356a02184c2f0a0461ac3f3dfcb3d0722e2e2e22a6ed8

Observation 47df1633-dd0f-4905-95a1-a9e790ebee79 · outbound

This paper cites Hybrid task cascade for instance seg- mentation.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Hybrid task cascade for instance seg- mentation

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-06T15:25:02.948306Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:25:02.948306Z digest=sha256:f050ba691b13422f7b4bf1e8c7253ddbfa56db155bc570223f06dec1685e2162

Observation 7f727e24-feac-491c-87f6-c04008f95c50 · outbound

This paper cites Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-06T15:25:02.951332Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:25:02.951332Z digest=sha256:1ee99e31dbc185c885e35cb014831a086b347b5c5d146e891a0190d84bc77c8c

Observation 63d09218-62d6-4d70-9ae5-a041c6419513 · outbound

This paper cites Internvl: Scaling up vision foundation mod- els and aligning for generic visual-linguistic tasks.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Internvl: Scaling up vision foundation mod- els and aligning for generic visual-linguistic tasks

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-06T15:25:02.954769Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:25:02.954769Z digest=sha256:c3dfefcd3b9b9af244465d656b84002ba385011927749ca624ffd50fbaeb76a9

Observation bd29b6f5-3711-4d88-99ad-f6bbd9fa9895 · outbound

This paper cites Masked-attention mask transformer for universal image segmentation.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Masked-attention mask transformer for universal image segmentation

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-06T15:25:02.957777Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:25:02.957777Z digest=sha256:575dc53b60b55d2cc3d5092009485cc1e494cec354e28ade66acae2cc2989cfe

Observation ab19eb58-68c8-41ff-8140-995f6a9f6a23 · outbound

This paper cites The cityscapes dataset for semantic urban scene understanding.

Advancing Visual Large Language Model for Multi-granular Versatile Perception The cityscapes dataset for semantic urban scene understanding

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-06T15:25:02.960867Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:25:02.960867Z digest=sha256:8eda639b360d877bb3ee5cff4ef903993ea65cf54bda850b09c1243fc64e909a

Observation 898316a0-dea6-4eea-9633-15ea60828160 · outbound

This paper cites Phraseclick: toward achieving flexible interactive segmenta- tion by phrase and click.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Phraseclick: toward achieving flexible interactive segmenta- tion by phrase and click

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-06T15:25:02.963638Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:25:02.963638Z digest=sha256:b234009b64bf2e6b3edce631025d160960ae56c299602f587fc4baa3986134e7

Observation b1f8d708-1c0e-4e9b-9ad4-979bbb24ecc8 · outbound

This paper cites Vision-language transformer and query generation for refer- ring segmentation.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Vision-language transformer and query generation for refer- ring segmentation

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-06T15:25:02.966434Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:25:02.966434Z digest=sha256:a5c2de7796bb406be9175aa2089027f67d99cfac6d63f5e5499c40c4f165bf90

Observation 83ff79e8-4352-442e-be00-2935499567f7 · outbound

This paper cites Open- vocabulary universal image segmentation with maskclip.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Open- vocabulary universal image segmentation with maskclip

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-06T15:25:02.969366Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:25:02.969366Z digest=sha256:af6b1da2678f0b578cc3b675423ea1133fca85de3a5bccf3280e664dd85f05b0

Observation 1c7f3ab4-afa8-4929-a9b5-0f808f00106e · outbound

This paper cites The pascal visual object classes (voc) challenge.

Advancing Visual Large Language Model for Multi-granular Versatile Perception The pascal visual object classes (voc) challenge

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-06T15:25:02.972553Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:25:02.972553Z digest=sha256:3067a232c3b874e947399565cd93eb203b178f521cf9720e84bdff78745a657a

Observation 7bcd79f2-9a5a-4a80-97f0-ca091d410fc5 · outbound

This paper cites Scott, and Weilin Huang.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Scott, and Weilin Huang

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.879861Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T15:25:02.975450Z digest=sha256:9ac592c17ded66cc04672070312b4c275b083257df403fbf39c8b76b49dce1a2

Observation 663cab1d-8cc8-4886-9358-6fe0e6212210 · outbound

This paper cites Prompt- det: Towards open-vocabulary detection using uncurated im- ages.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Prompt- det: Towards open-vocabulary detection using uncurated im- ages

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.872634Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T15:25:02.978290Z digest=sha256:2185a64fafe378379cfdd9795a3c842aa8aab3b7efdba86df74b7b903cf61e2d

Observation 44550596-7f95-4528-9499-cfb82c36b281 · outbound

This paper cites Instagen: Enhancing object detection by training on syn- thetic dataset.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Instagen: Enhancing object detection by training on syn- thetic dataset

Reference 15

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.865238Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T15:25:02.981188Z digest=sha256:ab1f02aad6dc6b5b6911b90d2dc2734fe540d62fa7fc67b9faf51a8d1addaff3

Observation d86fcecc-3ec4-41d0-83dd-71f50e25360e · outbound

This paper cites Video-r1: Reinforcing video reasoning in mllms, 2025.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Video-r1: Reinforcing video reasoning in mllms, 2025

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.857596Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T15:25:02.983811Z digest=sha256:c4b3401ea9fca39e710b7905f507fb6153a8bc1047c207237f25c66eb8b8ecc0

Observation 76ea7b3a-3f72-4747-b11b-86cc895129d4 · outbound

This paper cites Frozen-detr: Enhancing detr with image understanding from frozen foundation models.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Frozen-detr: Enhancing detr with image understanding from frozen foundation models

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.849441Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T15:25:02.987069Z digest=sha256:740a6662f621e1a288660a99200055b45521dede3b3f4534f99306dd4444009b

Observation 4a16c1d6-ff58-4e98-9d1d-9379d7b4e173 · outbound

This paper cites Open-vocabulary object detection via vision and language knowledge distillation.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Open-vocabulary object detection via vision and language knowledge distillation

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.841674Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T15:25:02.989754Z digest=sha256:2f9f53b90a58024d1a5ef8dd6f9c10b7eab92edf016a869640d748180efb9b8d

Observation 99d82295-8421-4552-897d-37e54cda6251 · outbound

This paper cites Dataseg: Taming a universal multi-dataset multi-task segmentation model.Ad- vances in Neural Information Processing Systems, 36, 2024.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Dataseg: Taming a universal multi-dataset multi-task segmentation model.Ad- vances in Neural Information Processing Systems, 36, 2024

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.833711Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T15:25:02.992355Z digest=sha256:9f0e23ae23b8492de219216e5fca2008ba3d78b8bb851b389e8876b62acbbade

Observation 6d5f152c-c330-4b77-a032-e1b528425c83 · outbound

This paper cites Textbooks Are All You Need.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Textbooks Are All You Need

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-06T15:25:02.996158Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:25:02.996158Z digest=sha256:17e7e6220e17ab8ce2a3ad05cfaef42e94724368c7ae768129c79c084c6a25d7

Observation 7a0f9581-8649-42bc-a3c2-150d50c2c733 · outbound

This paper cites Llava-uhd: An lmm perceiving any aspect ratio and high- resolution images.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Llava-uhd: An lmm perceiving any aspect ratio and high- resolution images

Reference 21

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.825303Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T15:25:02.999268Z digest=sha256:8b76029ffeab2f6dc357139f70bd29afb63acfd0ee609585a5e74aa141deee43

Observation d7750ed9-fcd1-4a89-b2fe-202c81e2919c · outbound

This paper cites Open-vocabulary semantic segmentation with decou- pled one-pass network.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Open-vocabulary semantic segmentation with decou- pled one-pass network

Reference 22

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.817355Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T15:25:03.002244Z digest=sha256:9510953bb04b563b17a24a4e15950643e0d32bc563ece8086b1402ee15d4e1d7

Observation 4b126936-388e-4bcb-9fb3-ce6583a596a5 · outbound

This paper cites Mask r-cnn.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Mask r-cnn

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-06T15:25:03.005059Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:25:03.005059Z digest=sha256:cc8ab1932e5220f303774306cc12a5307f2e379ed79f779b65aee0afe4f3c68e

Observation 532f1273-a3a6-4c33-8345-f58a67eb9341 · outbound

This paper cites Bi-directional relationship inferring net- work for referring image segmentation.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Bi-directional relationship inferring net- work for referring image segmentation

Reference 24

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.804540Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T15:25:03.007733Z digest=sha256:08236d2764b4b7c9bb3a9aaf0b7fdcbdb7e322ff5b813cae831f23bc166ca163

Observation f170f6c4-87ad-442b-9138-18c255b56c3c · outbound

This paper cites Densely connected parameter- efficient tuning for referring image segmentation, 2025.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Densely connected parameter- efficient tuning for referring image segmentation, 2025

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.797166Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T15:25:03.010900Z digest=sha256:f14a5a69bc3f48d3fb1933fd1db5252a8b930a696f142580d826c3766587bdcf

Observation 8937b392-bcdb-4806-998f-86ff53dc2c35 · outbound

This paper cites Referring im- age segmentation via cross-modal progressive comprehen- sion.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Referring im- age segmentation via cross-modal progressive comprehen- sion

Reference 26

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.789460Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T15:25:03.013622Z digest=sha256:d24ff0de2cb9806d32d138b32d7177107b4574692d03dd5daa9938653d08a295

Observation 4af64b3f-61c2-4889-81eb-fa0ee31fc2fe · outbound

This paper cites Linguistic structure guided context modeling for referring image segmentation.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Linguistic structure guided context modeling for referring image segmentation

Reference 27

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.781953Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T15:25:03.016386Z digest=sha256:30fa7e46392ab4df5c374bec6c0f66b7e5370b8673f2581295c7ec49332abbd1

Observation 742758de-c6f1-475c-9ffa-76cb73bafa49 · outbound

This paper cites Oneformer: One transformer to rule universal image segmentation.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Oneformer: One transformer to rule universal image segmentation

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.774039Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T15:25:03.020091Z digest=sha256:ef55820546fdeb6ba03b355f1f601926f454a2f11d2e259fd0512025f146ae8b

Observation 31ef1670-998f-420a-ba23-576d05d84415 · outbound

This paper cites Mdetr- modulated detection for end-to-end multi-modal understand- ing.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Mdetr- modulated detection for end-to-end multi-modal understand- ing

Reference 29

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.765376Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T15:25:03.022727Z digest=sha256:443f8e96252f58e6e251cae64ccebe2111ed4a2eb308cf1bebca84b55b0283f6

Observation d53df0f2-aa30-40d1-9b56-9037c47276d8 · outbound

This paper cites A spoken language dataset of descrip- tions for speech-based grounded language learning.

Advancing Visual Large Language Model for Multi-granular Versatile Perception A spoken language dataset of descrip- tions for speech-based grounded language learning

Reference 30

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.756673Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T15:25:03.025578Z digest=sha256:ccedae8717d57f8adeb026ed265cb77efec746f3c3db489c3932a2f7ed8018f6

Observation 0b4fbcd1-5e82-4d56-8527-7aebafa74693 · outbound

This paper cites F-vlm: Open-vocabulary object detection upon frozen vision and language models.

Advancing Visual Large Language Model for Multi-granular Versatile Perception F-vlm: Open-vocabulary object detection upon frozen vision and language models

Reference 31

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.748921Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T15:25:03.028433Z digest=sha256:f98a5013b6488348809785e188fd09d34c084745a433b05502132031365346b1

Observation 8230abef-3c1f-45fa-a6dd-28c842cf370b · outbound

This paper cites LISA: Reasoning Segmentation via Large Language Model.

Advancing Visual Large Language Model for Multi-granular Versatile Perception LISA: Reasoning Segmentation via Large Language Model

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-06T15:25:03.031233Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:25:03.031233Z digest=sha256:f7cd837bb1ba5e43506c851b04bfdd4a3fc450e826fc30bdf77e65ebc4fad4f3

Observation b3c4cae8-f981-4ecc-96ce-7fb7dd9ae564 · outbound

This paper cites Lisa: Reasoning segmentation via large language model.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Lisa: Reasoning segmentation via large language model

Reference 33

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.740982Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T15:25:03.034435Z digest=sha256:aa1a0f310a2cad38db3537f7828bb7a7eff40db11f8a3664c7b1b195c7fac3f0

Observation 0c07afee-1d4f-4160-ae0d-529ef1a26bd5 · outbound

This paper cites Discobox: Weakly supervised instance segmentation and semantic correspondence from box super- vision.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Discobox: Weakly supervised instance segmentation and semantic correspondence from box super- vision

Reference 34

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.733055Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T15:25:03.037235Z digest=sha256:213c485900a47d1dbdacc3b36cf48fa4fc77638df6ca46a6a167b81804aa5184

Observation 63fea573-a68e-4e5b-8d5d-f9b7e661d10f · outbound

This paper cites Vision Transformers Are Good Mask Auto-Labelers.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Vision Transformers Are Good Mask Auto-Labelers

Reference 35

Resolution
verified exact
local_arxiv, observed 2026-08-06T15:25:03.315861Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T15:25:03.040147Z digest=sha256:370d02c9e925a75af60d2380af7a98a4309d7b1492bf99e47115ca183f0ba2ee

Observation b97777ef-b346-48bf-9c22-83ad347d63df · outbound

This paper cites Mask dino: Towards a unified transformer-based framework for object detection and segmentation.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Mask dino: Towards a unified transformer-based framework for object detection and segmentation

Reference 36

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.725166Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T15:25:03.044358Z digest=sha256:ee9511ee025736e0b165e7a598a2a92590a204e211d50027a561e56681cc4e7d

Observation c765920b-5ec7-4141-bf16-ba1e6b80c835 · outbound

This paper cites Distilling detr with visual-linguistic knowledge for open-vocabulary object detection.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Distilling detr with visual-linguistic knowledge for open-vocabulary object detection

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-06T15:25:03.047346Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:25:03.047346Z digest=sha256:94f79ac94ecd81b2922ba6a36bf5519bc99dc3c395e97348e2d5c710aa41f435

Observation 5f13d64f-ef6b-4553-9b6b-3ee39ac0a1b7 · outbound

This paper cites Grounded language-image pre-training.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Grounded language-image pre-training

Reference 38

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.711995Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T15:25:03.051037Z digest=sha256:a62005a5dd013b2c919cb60120463f3b8d0d103e5fa44c58282f01553e21dbd0

Observation ee04b3ad-bf10-4c3d-9327-b6faafbf605d · outbound

This paper cites Box-supervised instance seg- mentation with level set evolution.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Box-supervised instance seg- mentation with level set evolution

Reference 39

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.703807Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T15:25:03.053794Z digest=sha256:72056772368be3b6ded5928f541013ddc3ddafa54c718aa06fa5f814348424a4

Observation 8aed0da2-f026-4012-b0c5-292b7ad09795 · outbound

This paper cites Fully convolutional networks for panoptic segmentation with point-based supervision.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Fully convolutional networks for panoptic segmentation with point-based supervision

Reference 40

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.695829Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T15:25:03.056437Z digest=sha256:c7da348b4e8ba7b72069e248eaf1dca1dc3b78a522f76905525f8492c51391d8

Observation 00a7a282-fc22-4e44-a7d1-25e6ddf1e20e · outbound

This paper cites A real-time cross-modality correlation fil- tering method for referring expression comprehension.

Advancing Visual Large Language Model for Multi-granular Versatile Perception A real-time cross-modality correlation fil- tering method for referring expression comprehension

Reference 41

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.687610Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T15:25:03.059281Z digest=sha256:634cd71ef3e211a9bca7a6a78bdc5edcb6bb5029a18f92f1e1e3cf229149fd18

Observation 4a1657f9-3b3c-4191-a321-b25b7226597a · outbound

This paper cites Belongie, James Hays, Pietro Perona, Deva Ramanan, Piotr Doll ´ar, and C.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Belongie, James Hays, Pietro Perona, Deva Ramanan, Piotr Doll ´ar, and C

Reference 42

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.680245Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T15:25:03.061929Z digest=sha256:39b7e6dcab6fce09abefb7852dcae6eeee7c7b555186d2037137782e68c5df36

Observation 2651bf09-4a8b-45ec-9acb-82ad86de3712 · outbound

This paper cites Gres: Gener- alized referring expression segmentation.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Gres: Gener- alized referring expression segmentation

Reference 43

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.672328Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T15:25:03.064565Z digest=sha256:5e7b47f1d04f010c241afd0b8b38591c79bb671cd7c2601008d49fb1c1e18f56

Observation 516d1c06-fccd-472e-9311-c0d9b60eae89 · outbound

This paper cites Visual instruction tuning.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Visual instruction tuning

Reference 44

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.663833Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T15:25:03.067583Z digest=sha256:0b2b78194abdbaf1ad9456ca84704e87efc508fe226e9e75e53e2b6f6749f2ac

Observation 396ea93a-94bd-43c9-bcfe-5e7eadd99cda · outbound

This paper cites Poly- former: Referring image segmentation as sequential poly- gon generation.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Poly- former: Referring image segmentation as sequential poly- gon generation

Reference 45

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.655401Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T15:25:03.070394Z digest=sha256:fcdc98868ee0789f7b0890f1c758f795c82761f227a1dd5a7a1288f5f4b00942

Observation 0b59ecd3-f4d4-4402-b6b1-8d487fe0098b · outbound

This paper cites Grounding dino: Marrying dino with grounded pre-training for open-set object detection.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Grounding dino: Marrying dino with grounded pre-training for open-set object detection

Reference 46

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.647545Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T15:25:03.073090Z digest=sha256:21f5eaca5df3fbc71631a75399d27193e397db4e76e984118a8f16377a99d1d6

Observation 4bc258ef-85e1-45bc-9f4e-ec3f03888c67 · outbound

This paper cites Knowledge-guided pairwise recon- struction network for weakly supervised referring expression grounding.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Knowledge-guided pairwise recon- struction network for weakly supervised referring expression grounding

Reference 47

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.638476Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T15:25:03.075993Z digest=sha256:37b3de829747b630e318d00272646f8acad81f479f5e60f0185814e4dab06ecb

Observation b5080384-84b0-44e6-b417-7c5cd23d5ae8 · outbound

This paper cites Learn- ing cross-modal context graph for visual grounding.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Learn- ing cross-modal context graph for visual grounding

Reference 48

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.630597Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T15:25:03.078779Z digest=sha256:41dd578b9be151c8cb9fd4255390d133f42b58a0eac650cd4fb5d873454acf50

Observation 11f99a97-e9db-4615-9b27-6c0bb48cc3bd · outbound

This paper cites Swin transformer: Hierarchical vision transformer using shifted windows.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Swin transformer: Hierarchical vision transformer using shifted windows

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-06T15:25:03.081686Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:25:03.081686Z digest=sha256:dfdc180d8bacd64a48a4c6d1c2890f1b8e82e93027aea86288b136bae0bc8a23

Observation 90d19aa5-8690-4e28-99a6-18f1f3dec4e4 · outbound

This paper cites Visual- rft: Visual reinforcement fine-tuning, 2025.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Visual- rft: Visual reinforcement fine-tuning, 2025

Reference 50

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.617590Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T15:25:03.084391Z digest=sha256:5f90f903a8fb4ea5dee5d15be95f3baa3751bdc4d5396b1aab83569a8c3b7cf4

Observation e9b21f22-e97f-48cb-9b98-250a81250791 · outbound

This paper cites DeepSeek-VL: Towards Real-World Vision-Language Understanding.

Advancing Visual Large Language Model for Multi-granular Versatile Perception DeepSeek-VL: Towards Real-World Vision-Language Understanding

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-06T15:25:03.086999Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:25:03.086999Z digest=sha256:e08d9d1b92c11ef273ca5221fd9cd27b33167a6ee2c2ce7c74f6a13cd0f79df5

Observation adf0279d-f848-4aa0-bb46-befbf3392261 · outbound

This paper cites Scaling open-vocabulary object detection.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Scaling open-vocabulary object detection

Reference 52

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.609171Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T15:25:03.090622Z digest=sha256:874b43496efe0a467da85fd5fb2ace2a5a1c40843fc031e13f9e5889aef9dcbc

Observation 01d20d78-7508-4559-a76f-22cb2c4321b9 · outbound

This paper cites The role of context for object detection and semantic segmentation in the wild.

Advancing Visual Large Language Model for Multi-granular Versatile Perception The role of context for object detection and semantic segmentation in the wild

Reference 53

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.600915Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T15:25:03.093349Z digest=sha256:305f66a4cc5df7cf4c23e89a9673b36ae1e25bf966fcf31def8f47ed1b3fe8be

Observation 50d46028-436f-4fc3-a959-83ce2362efd2 · outbound

This paper cites Mod- eling context between objects for referring expression under- standing.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Mod- eling context between objects for referring expression under- standing

Reference 55

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.592309Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T15:25:03.099243Z digest=sha256:606bffc0446b78784336de9228252b6a33868b9cb5dda4580f9dcbc9946289e1

Observation c58cdb6b-764e-4a4f-bce1-383a37d9f6e5 · outbound

This paper cites Vision-aware text features in referring image segmentation: From object understanding to context understanding, 2024.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Vision-aware text features in referring image segmentation: From object understanding to context understanding, 2024

Reference 56

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.584054Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T15:25:03.101957Z digest=sha256:391b0e64b2e09dbf7236509400f3c4f2caa47a32af367c04490749b1d03cf99e

Observation 15adb626-08b6-4fb3-8aef-df41b9d5c851 · outbound

This paper cites GLaMM: Pixel Grounding Large Multimodal Model.

Advancing Visual Large Language Model for Multi-granular Versatile Perception GLaMM: Pixel Grounding Large Multimodal Model

Reference 57

Resolution
unresolved
no resolver link, observed 2026-08-06T15:25:03.104795Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:25:03.104795Z digest=sha256:fe75e690638f61a5164d8fd14da61c19ff176e55bdd85194d67e666b1ab3ac33

Observation 5cf9db23-a1b3-4486-9bd3-6d6313aaeca9 · outbound

This paper cites PixelLM: Pixel Reasoning with Large Multimodal Model.

Advancing Visual Large Language Model for Multi-granular Versatile Perception PixelLM: Pixel Reasoning with Large Multimodal Model

Reference 58

Resolution
unresolved
no resolver link, observed 2026-08-06T15:25:03.107930Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:25:03.107930Z digest=sha256:010d7fa163c7876ab99bedfc18010069a04299431a80456ba36c24c5bde37e96

Observation cc0390e1-8c0b-464c-999f-62c436354f77 · outbound

This paper cites Pixellm: Pixel reasoning with large multimodal model.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Pixellm: Pixel reasoning with large multimodal model

Reference 59

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.574542Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T15:25:03.110890Z digest=sha256:27db1fbc35d44f6e3374e0dfa42cc19abeae450c1b056614a81b0ccdd723be0e

Observation 13f2513a-d917-4376-bb03-c9e5c923fe19 · outbound

This paper cites Grounding of textual phrases in images by reconstruction.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Grounding of textual phrases in images by reconstruction

Reference 60

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.565223Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T15:25:03.114638Z digest=sha256:8d99ac4e71d0a56c1dadfa523146c5731a899a2725d3ffd06337adaa94fe1aab

Observation d5a2c00e-8dde-4ada-bc17-2b65970cbd35 · outbound

This paper cites Objects365: A large-scale, high-quality dataset for object detection.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Objects365: A large-scale, high-quality dataset for object detection

Reference 61

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.556025Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T15:25:03.117431Z digest=sha256:2ae9d39398f0fbc2d1f759abb6016ab6c72d0feb0b1f9a9c9f83041d1a100a78

Observation b2d08439-a2d8-4034-97ca-e4c024525b74 · outbound

This paper cites an unresolved cited work.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Unresolved cited work

Reference 62

Resolution
unresolved
no resolver link, observed 2026-08-06T15:25:03.120304Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:25:03.120304Z digest=sha256:6d849930e33c811a4dafa7ef88d60cba4182bf16609be7552524561f69ad251f

Observation ef191971-6719-4529-8669-d85a212a1bb2 · outbound

This paper cites Conceptual captions: A cleaned, hypernymed, im- age alt-text dataset for automatic image captioning.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Conceptual captions: A cleaned, hypernymed, im- age alt-text dataset for automatic image captioning

Reference 63

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.541868Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T15:25:03.123158Z digest=sha256:5ff9512a822e0c0f174c98eb96932db2b4655464c8fd2e178a245e86bf97bfff

Observation cff9cb04-e1f7-441d-ad2e-147517293b21 · outbound

This paper cites Boxinst: High-performance instance segmentation with box annotations.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Boxinst: High-performance instance segmentation with box annotations

Reference 64

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.533787Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T15:25:03.125882Z digest=sha256:3a4ae34c76f07db0a3f9ba3abea0e6706b07517530d283f2d6f2d0596eb61113

Observation 34336494-a6a6-4418-ab58-be450b0b032f · outbound

This paper cites Max-deeplab: End-to-end panoptic segmentation with mask transformers.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Max-deeplab: End-to-end panoptic segmentation with mask transformers

Reference 65

Resolution
unresolved
no resolver link, observed 2026-08-06T15:25:03.128732Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:25:03.128732Z digest=sha256:61661562853d87b8eb3f92220012d24df8fce00b09ce9d32130510ca68b6b6a2

Observation 98f4faab-7e40-497d-b19a-127eb7ff4cb4 · outbound

This paper cites OV-DINO: Unified Open-Vocabulary Detection with Language-Aware Selective Fusion.

Advancing Visual Large Language Model for Multi-granular Versatile Perception OV-DINO: Unified Open-Vocabulary Detection with Language-Aware Selective Fusion

Reference 66

Resolution
unresolved
no resolver link, observed 2026-08-06T15:25:03.131454Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:25:03.131454Z digest=sha256:b21391cf460d515199d9c5f019c220e29fc20259f50798cb75b5dd4f5905f395

Observation bb6d06a3-b170-4103-bd28-90dcb74f6005 · outbound

This paper cites Neighbourhood watch: Refer- ring expression comprehension via language-guided graph attention networks.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Neighbourhood watch: Refer- ring expression comprehension via language-guided graph attention networks

Reference 67

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.518088Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T15:25:03.134522Z digest=sha256:6ced1dbb4d6ba461d09c94be0357e277a32466b496a18d37a524e76e9366c20b

Observation cb440322-a61d-4a06-8915-060afcbbc754 · outbound

This paper cites Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding

Reference 68

Resolution
unresolved
no resolver link, observed 2026-08-06T15:25:03.137410Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:25:03.137410Z digest=sha256:0cb66cb487105903dc9cccba96d0558fb77ace13cb7327ed4fa5f3bbbea179a9

Observation afadd51a-cd52-44c8-b374-d943f9aeb7d6 · outbound

This paper cites Cris: Clip- driven referring image segmentation.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Cris: Clip- driven referring image segmentation

Reference 69

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.509852Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T15:25:03.140488Z digest=sha256:ca85c08fe29bb3815b39d5c9ac318f1f20d8330a52edc937e1577e819208c1e1

Observation 25011881-7661-4cc4-ad98-2e6e512407ab · outbound

This paper cites LaSagnA: Language-based Segmentation Assistant for Complex Queries.

Advancing Visual Large Language Model for Multi-granular Versatile Perception LaSagnA: Language-based Segmentation Assistant for Complex Queries

Reference 70

Resolution
unresolved
no resolver link, observed 2026-08-06T15:25:03.143395Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:25:03.143395Z digest=sha256:d0006a4431b6cb0643d79c326932f88ec662f0c182a7f15c9cdf69061ff585dc

Observation 6c1f6087-bed1-425b-84d5-aa0f2c9c261e · outbound

This paper cites Hyperseg: Hybrid segmentation assistant with fine-grained visual perceiver.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Hyperseg: Hybrid segmentation assistant with fine-grained visual perceiver

Reference 71

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.501288Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T15:25:03.146653Z digest=sha256:23b8e51138c278ceb950897d7176a6c858a5a52c7bec547effa06d6bc946fd8d

Observation 02f804a7-f5e7-4b3a-ace8-42250d64c4e5 · outbound

This paper cites Chain-of-thought prompting elicits reasoning in large lan- guage models.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Chain-of-thought prompting elicits reasoning in large lan- guage models

Reference 72

Resolution
unresolved
no resolver link, observed 2026-08-06T15:25:03.149351Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:25:03.149351Z digest=sha256:0c3dba14cebc6d8701463cb06ad26c0c977950c8d07e10bc9648c5758a18c8dc

Observation 6db5f32d-b051-46b5-9ea5-90634e417c42 · outbound

This paper cites Aligning bag of regions for open- vocabulary object detection.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Aligning bag of regions for open- vocabulary object detection

Reference 73

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.487596Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T15:25:03.152081Z digest=sha256:9df9fbdd67311ab477304b0ab4862246ac51d806429efc11c33b34b989f08944

Observation 2c52f9d3-d099-4c71-a893-df38831c04ce · outbound

This paper cites GSVA: Generalized Segmentation via Multimodal Large Language Models.

Advancing Visual Large Language Model for Multi-granular Versatile Perception GSVA: Generalized Segmentation via Multimodal Large Language Models

Reference 74

Resolution
unresolved
no resolver link, observed 2026-08-06T15:25:03.155595Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:25:03.155595Z digest=sha256:4610662dd64695ed635b62f8d204293a5fceb8326eac2d6fac72c53129a09e23

Observation 724b5fbe-581d-4ebf-9e0c-5a5490c7dcda · outbound

This paper cites Upsnet: A unified panoptic segmentation network.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Upsnet: A unified panoptic segmentation network

Reference 75

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.480035Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T15:25:03.158835Z digest=sha256:f7fdded3e2c03b89200ca033862538c0c60b2aa703bdee3dd5643293bc4e69f5

Observation ba103859-1933-47a2-b932-916dd704c33b · outbound

This paper cites A simple baseline for open- vocabulary semantic segmentation with pre-trained vision- language model.

Advancing Visual Large Language Model for Multi-granular Versatile Perception A simple baseline for open- vocabulary semantic segmentation with pre-trained vision- language model

Reference 76

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.472575Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T15:25:03.162083Z digest=sha256:cf5f5a31519cf3fdf7b4c1c8553ae4f37b81f74dd45009296a9dee044e10f230

Observation ef29d085-269c-400e-9da7-81aeaa72966c · outbound

This paper cites Dynamic graph at- tention for referring expression comprehension.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Dynamic graph at- tention for referring expression comprehension

Reference 77

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.464252Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T15:25:03.165628Z digest=sha256:c815d818357bcfbedbb5027922d70fc89d6f9281922d15f025dd24858dfc77ab

Observation 0fa72d14-b0f8-446d-8546-d554b1f3a4a6 · outbound

This paper cites R1-onevision: Advancing generalized multimodal reasoning through cross- modal formalization, 2025.

Advancing Visual Large Language Model for Multi-granular Versatile Perception R1-onevision: Advancing generalized multimodal reasoning through cross- modal formalization, 2025

Reference 78

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.456045Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T15:25:03.170854Z digest=sha256:878efb625630fd3645a1ff7f0c09be56a4a68ad2c23082e634e86e21791fb5af

Observation c0a577bb-61fe-4fe8-ae83-69622b4af0f6 · outbound

This paper cites Lavt: Language-aware vision transformer for referring image segmentation.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Lavt: Language-aware vision transformer for referring image segmentation

Reference 79

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.447077Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T15:25:03.175849Z digest=sha256:fe9d62ddd5b54b4497c1a6b4eec319f6d6afaa49b5dba85b05169d32b88ffa04

Observation 4c3979b2-5e45-45c8-9d4d-5aeb617b094f · outbound

This paper cites Modeling context in referring expres- sions.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Modeling context in referring expres- sions

Reference 80

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.438827Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T15:25:03.181626Z digest=sha256:1bf325e0cadfcb338a30a4cd3fa734adacb79afda932a8f1bc0d11e4e93a7fda

Observation b3d0bdee-5d38-4dca-beba-9523bd29be32 · outbound

This paper cites Modeling context in referring expres- sions.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Modeling context in referring expres- sions

Reference 81

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.430991Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T15:25:03.186291Z digest=sha256:6d76c9c5e4d6681c27f9a269e82fb052ff75a369260ca23c5882e9fa88eb60e7

Observation 55de4384-c3c4-4386-a750-18a9859a40bb · outbound

This paper cites v-clr: View-consistent learning for open-world instance seg- mentation.

Advancing Visual Large Language Model for Multi-granular Versatile Perception v-clr: View-consistent learning for open-world instance seg- mentation

Reference 82

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.422698Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T15:25:03.192454Z digest=sha256:e577f183df5ce432ff08c431bc1854dd45e35820cf58062f9d998ee34c76dd50

Observation 025244fb-29af-46ee-accf-28ea3e981ce6 · outbound

This paper cites an unresolved cited work.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Unresolved cited work

Reference 83

Resolution
unresolved
raw_fallback, observed 2026-08-06T15:25:03.414643Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T15:25:03.200344Z digest=sha256:cc007dabaaf87915b093bdced3e72f83102a1297ace8d35e5f0893489826c819

Observation 18bcd259-4f19-4ff8-b318-985f7371594f · outbound

This paper cites Grounding referring expressions in images by variational context.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Grounding referring expressions in images by variational context

Reference 84

Resolution
unresolved
no resolver link, observed 2026-08-06T15:25:03.203135Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:25:03.203135Z digest=sha256:0bb0a0750bc19baab26b4b480d9e56f5a12cfccdcad9b8ee9d991dff2c50268e

Observation 765e2d08-ab87-4cbf-bb9c-cbe49607ab6e · outbound

This paper cites A simple framework for open-vocabulary segmentation and detection.

Advancing Visual Large Language Model for Multi-granular Versatile Perception A simple framework for open-vocabulary segmentation and detection

Reference 85

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.401452Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T15:25:03.205535Z digest=sha256:2c7ef9a3f5519b9f50b116b1915ab24d015e86907f59b8e8892cf8f4e44e4c1c

Observation a3953e7e-616e-4d20-b302-4430a72a2996 · outbound

This paper cites R1-vl: Learning to reason with multimodal large language models via step- wise group relative policy optimization, 2025.

Advancing Visual Large Language Model for Multi-granular Versatile Perception R1-vl: Learning to reason with multimodal large language models via step- wise group relative policy optimization, 2025

Reference 86

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.392598Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T15:25:03.207897Z digest=sha256:1f22fd3c2ee12c5ac5c7193b35d8c518eff21e0c8a229112ea14779f07d7d078

Observation b42c9963-2ac2-42be-af19-2bc9d7ac31f2 · outbound

This paper cites OMG-LLaVA: Bridging Image-level, Object-level, Pixel-level Reasoning and Understanding.

Advancing Visual Large Language Model for Multi-granular Versatile Perception OMG-LLaVA: Bridging Image-level, Object-level, Pixel-level Reasoning and Understanding

Reference 87

Resolution
unresolved
no resolver link, observed 2026-08-06T15:25:03.210189Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:25:03.210189Z digest=sha256:7d412c30bab5b9315f17b9e94aa0557c5cabee17d2143b5f26a057000c2a7487

Observation 1d326492-bdc2-4deb-9447-6726ca52a6e7 · outbound

This paper cites Psalm: Pixelwise segmentation with large multi-modal model.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Psalm: Pixelwise segmentation with large multi-modal model

Reference 88

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.384291Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T15:25:03.212699Z digest=sha256:51c26f566d7884379c58643e52a5aa9800e110608593950e98cdeafd756f6125

Observation c5aaccc8-7ae1-40fb-a4bf-45c33e0a6902 · outbound

This paper cites Semantic under- standing of scenes through the ade20k dataset.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Semantic under- standing of scenes through the ade20k dataset

Reference 89

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.376001Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T15:25:03.215135Z digest=sha256:6fb816f67e3a3b24151bb2f2e16094a0a76b4c66a14690ef6dd3370110300e5f

Observation 27c1b8fe-6856-40f3-812b-6a0db2ab204d · outbound

This paper cites Generalized decoding for pixel, image, and lan- guage.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Generalized decoding for pixel, image, and lan- guage

Reference 90

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.367658Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T15:25:03.217526Z digest=sha256:082e4b00d53d1f4d5d1370686e13d1db99e870eb347746d28961d9cebd136dc5

Observation ee94fd56-822c-4f04-8f19-475ccc1c2842 · outbound

This paper cites Segment everything everywhere all at once.

Advancing Visual Large Language Model for Multi-granular Versatile Perception Segment everything everywhere all at once

Reference 91

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:25:03.359490Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T15:25:03.219873Z digest=sha256:1efff309402b7e773f5cbde9c2076bc4d3dad2f7d1001b6423fa8b1e4749a139

Pith citing papers

No inbound Pith citation observations are available.