Pith. sign in

Paper Citation Record · LEDGER

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation

As of 16 August 2026, this Paper Citation Record lists 76 of 76 outbound references and 0 inbound Pith citation observations for arXiv:2608.02791.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2608.02791 v1

Coverage vector

measured 76 of 76 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-15T15:03:54.710735Z

measured 76 of 76 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-15T06:32:42.880941+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

76 of 76 outbound references displayed

  • verified exact1
  • verified fuzzy52
  • unresolved23
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 04b08a1d-1618-4655-a739-2cf0e76629af · outbound

This paper cites Better, stronger, faster: Tackling the trilemma in mllm-based segmentation with simultaneous textual mask prediction,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation Better, stronger, faster: Tackling the trilemma in mllm-based segmentation with simultaneous textual mask prediction,

Reference 1

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:03:55.761672Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-15T15:03:54.451796Z digest=sha256:307c105b48eac590962ba517fd3a1d98a6af305e47d8a746fdaad5653508bdfa

Observation b8bfe145-ca25-4b8d-8ae0-6e0548181006 · outbound

This paper cites Qwen3 Technical Report.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation Qwen3 Technical Report

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-15T15:03:54.455763Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T15:03:54.455763Z digest=sha256:574d4e96300bff70b098a44169821ad6c6430cfbce83dbe6dd861a7595b10a2a

Observation 3d1abe1e-a1fb-45e0-b662-4ffe1e1796eb · outbound

This paper cites LION: Empowering multimodal large language model with dual-level visual knowledge,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation LION: Empowering multimodal large language model with dual-level visual knowledge,

Reference 3

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:03:55.752270Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-15T15:03:54.458646Z digest=sha256:88e44ba26287811f5ccd096a2bdc7ed9c64c82bc3108a6e14e2f0649fa62d3aa

Observation ca71740f-6953-4b02-9706-29476b94628c · outbound

This paper cites MLLMs know where to look: Training-free perception of small visual details with multimodal llms,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation MLLMs know where to look: Training-free perception of small visual details with multimodal llms,

Reference 4

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:03:55.742657Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-15T15:03:54.461511Z digest=sha256:4495be1323f6ee7f7fd48a89299baaae4c59f8cb4402cca81bab0945e7696476

Observation fd34f1a2-1f9d-4b9a-92b8-e75336cd8852 · outbound

This paper cites Detect anything via next point prediction,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation Detect anything via next point prediction,

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-15T15:03:54.464691Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T15:03:54.464691Z digest=sha256:8e7d6c7a9c7fd23df083944a8f5caeb51162edd0382855adc638e3658367c68f

Observation ee3bf2eb-43a2-496a-881a-07ff99bee524 · outbound

This paper cites InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-15T15:03:54.467561Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T15:03:54.467561Z digest=sha256:afec0129877ac4e43e26cdd544d44cec35ab9f96a1d6f303caf85d53e1abc0af

Observation 43e2b31a-79ee-4d7c-a186-bdf99bf31cac · outbound

This paper cites LLaVA-OneVision: Easy Visual Task Transfer.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation LLaVA-OneVision: Easy Visual Task Transfer

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-15T15:03:54.471468Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T15:03:54.471468Z digest=sha256:d389de7fb536080b12f0e99c7aabc95d9d2faa8f232e8923fbf107788b795119

Observation c482a154-3187-4ee1-abb6-cc7a6053be76 · outbound

This paper cites PhD: A ChatGPT-prompted visual halluci- nation evaluation dataset,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation PhD: A ChatGPT-prompted visual halluci- nation evaluation dataset,

Reference 8

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:03:55.732220Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-15T15:03:54.475046Z digest=sha256:f76d5f4c8596c771855bad80e3e441d9a519dff1c2445d021079b9ab72b43a3a

Observation fe07297c-e113-4a74-a93a-53d6c32697a0 · outbound

This paper cites Qwen2.5-VL Technical Report.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation Qwen2.5-VL Technical Report

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-15T15:03:54.478261Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T15:03:54.478261Z digest=sha256:6e23f32769fe236c0ec977c3a9a842b36dc5947934ae3df700d2485a775ef493

Observation 74ed9fa0-c20d-4ae6-b070-15bd8cf4e1c8 · outbound

This paper cites Segmentation as a plug-and-play capability for frozen multimodal LLMs,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation Segmentation as a plug-and-play capability for frozen multimodal LLMs,

Reference 10

Resolution
verified exact
raw_fallback, observed 2026-08-15T15:03:54.999538Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-15T15:03:54.481589Z digest=sha256:9838da27fd7d88587adc0b5dff91d5f82a8b829778b84368c47c01b676379af5

Observation a224531b-01d7-47f8-abe9-b5079e6bed0b · outbound

This paper cites Text4Seg: Reimagining image segmentation as text generation,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation Text4Seg: Reimagining image segmentation as text generation,

Reference 11

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:03:55.721351Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-15T15:03:54.485332Z digest=sha256:cc28eb88146ab84687910987e4dd396713d2669630dc92dbd6805440d8d42646

Observation cfd23eaa-e655-4fde-b097-85598dce54c2 · outbound

This paper cites LISA: Reasoning segmentation via large language model,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation LISA: Reasoning segmentation via large language model,

Reference 12

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:03:55.710085Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-15T15:03:54.488627Z digest=sha256:f5c3642353254302ae5b6deda76d0032ea92fde090d22adcb29b471d8a76c9a5

Observation e441a837-c859-4918-bd43-56a6b0bd4abb · outbound

This paper cites GSV A: Generalized segmentation via multimodal large language models,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation GSV A: Generalized segmentation via multimodal large language models,

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:03:55.699166Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-15T15:03:54.491801Z digest=sha256:1427d24649e0aa904a1c40a1504f9789e5c0cfd2b5e3891f6b5dff40cccf42df

Observation eb594ba4-8168-43c7-8986-3c49e5eeae95 · outbound

This paper cites PixelLM: Pixel reasoning with large multimodal model,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation PixelLM: Pixel reasoning with large multimodal model,

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:03:55.687046Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-15T15:03:54.495099Z digest=sha256:aa20481c3e93f9eb5ae508bfa9dae52cae399d4673b9354d447580d747724e80

Observation 7c0d53ec-299e-45d1-b124-5e19aee050d1 · outbound

This paper cites MMR: A large-scale benchmark dataset for multi-target and multi- granularity reasoning segmentation,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation MMR: A large-scale benchmark dataset for multi-target and multi- granularity reasoning segmentation,

Reference 15

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:03:55.675152Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-15T15:03:54.498237Z digest=sha256:98b4c1075514ddc10a1abf274072988328151609dc14607b2c639849ad2c518b

Observation fef7e871-c616-421b-9dec-eb69d416b313 · outbound

This paper cites Reasoning to attend: Try to understand how<SEG>token works,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation Reasoning to attend: Try to understand how<SEG>token works,

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:03:55.658171Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-15T15:03:54.501558Z digest=sha256:c43ea849759fe2d72cd3e0a8f2ceed82d1a48c5ce070bd95a911fb10a90714b9

Observation 03e114b1-1560-4466-9e71-3d6dd8b1a0d0 · outbound

This paper cites VisionLLM v2: An end-to-end generalist multimodal large language SUBMISSION 17 model for hundreds of vision-language tasks,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation VisionLLM v2: An end-to-end generalist multimodal large language SUBMISSION 17 model for hundreds of vision-language tasks,

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:03:55.647250Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-15T15:03:54.504748Z digest=sha256:3ff31d5303221d5199e7a81fc90edbd5dbb0be124ba9f8318a5989c96aa5c2a7

Observation a2b4c67b-43b8-4186-bbfb-521c4f802bb2 · outbound

This paper cites Seg-Zero: Reasoning-Chain Guided Segmentation via Cognitive Reinforcement.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation Seg-Zero: Reasoning-Chain Guided Segmentation via Cognitive Reinforcement

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-15T15:03:54.508438Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T15:03:54.508438Z digest=sha256:8ee83e452f96e45cbd8a59f9b829307e28938cde2bb284502e9d2199b26ae833

Observation 1cd02046-2b11-4129-b374-725484920792 · outbound

This paper cites SegAgent: Exploring pixel understanding capabilities in mllms by imitating human annotator trajectories,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation SegAgent: Exploring pixel understanding capabilities in mllms by imitating human annotator trajectories,

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:03:55.636086Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-15T15:03:54.512508Z digest=sha256:b777fa12fbb287fed639ad44aac66a19dc54f3fe3a3dfab906051c25a3e5dcf4

Observation 406235f7-a893-424f-82dc-c6601765be84 · outbound

This paper cites Text4Seg++: Advancing image segmentation via generative language modeling,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation Text4Seg++: Advancing image segmentation via generative language modeling,

Reference 20

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:03:55.624006Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-15T15:03:54.515797Z digest=sha256:2ccfdb620b0b50c1784d07067684d5a191b957002891ed2198aa1698c6297c13

Observation 0593f58f-a32d-4410-bbc3-0c92be3785c8 · outbound

This paper cites GLaMM: Pixel grounding large multimodal model,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation GLaMM: Pixel grounding large multimodal model,

Reference 21

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:03:55.610352Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-15T15:03:54.519060Z digest=sha256:f3a95510255a50be001705f4e61e30b87b5828edf057ef393c526748991ac326

Observation 2f93bd10-bd8f-48bc-8cda-0272fd706c1d · outbound

This paper cites See say and segment: Teaching LMMs to overcome false premises,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation See say and segment: Teaching LMMs to overcome false premises,

Reference 22

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:03:55.597190Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-15T15:03:54.522174Z digest=sha256:f1719dad39607f4138368ccbbaa208ce4d76df95286ea15167009cb68c0d6f6d

Observation 6c2cd546-1986-45f4-9431-bc70bd7b7acd · outbound

This paper cites VisionLLM: Large language model is also an open-ended decoder for vision-centric tasks,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation VisionLLM: Large language model is also an open-ended decoder for vision-centric tasks,

Reference 23

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:03:55.584499Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-15T15:03:54.525407Z digest=sha256:2f9c66a703034631c0ff9cfacbde8714d5310e9c75606b11a17c732ec26a202d

Observation 29f44c12-a969-43fd-9612-dd62a074efcb · outbound

This paper cites ReferItGame: Referring to objects in photographs of natural scenes,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation ReferItGame: Referring to objects in photographs of natural scenes,

Reference 24

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:03:55.572467Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-15T15:03:54.529505Z digest=sha256:7fddbd5cae27e11581fd79b22e16a3a28be9c4572ee70772a80b4228db61a639

Observation 4b02c12e-dc90-4336-ac4f-24207e27f9fb · outbound

This paper cites Generation and comprehension of un- ambiguous object descriptions,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation Generation and comprehension of un- ambiguous object descriptions,

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:03:55.562135Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-15T15:03:54.532686Z digest=sha256:72ec9b6226849caf0d08d69ef4b0776fc611497d95a896acde5fed7bc0a7eb75

Observation 719a921b-2021-4c44-b8e0-e1ba6d91a1df · outbound

This paper cites Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-15T15:03:54.535460Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T15:03:54.535460Z digest=sha256:315d35960fac9d99ad12f6f45f2847358dc81b1281da07c9aac2ce9851e60356

Observation d939e361-afbb-4349-97ee-e866c4f81170 · outbound

This paper cites Scaling Laws for Neural Language Models.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation Scaling Laws for Neural Language Models

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-15T15:03:54.538716Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T15:03:54.538716Z digest=sha256:10ffc47062311203932ffe8fbbc44fb8fa6ca09cc77db704b42c297e2c09bcf4

Observation 1426642a-64c0-4a48-85f4-5549ba467a59 · outbound

This paper cites Hello GPT-4o,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation Hello GPT-4o,

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:03:55.552541Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-15T15:03:54.541848Z digest=sha256:57463fc9f5307f129a5cd1a6611aefe951d378ea7dec0c7e06bfd3ad15c0da49

Observation e219408a-a3d9-46a8-9b7e-8476dfae5a2c · outbound

This paper cites Google Gemini 2.5 Pro,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation Google Gemini 2.5 Pro,

Reference 29

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:03:55.543034Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-15T15:03:54.544489Z digest=sha256:2fb033bf4f5907da93f023c0dd8b7942a4e59ceb582818694a9ebcc9ca3ec46c

Observation 912d1f00-b430-4f06-84fd-bc4c4677137f · outbound

This paper cites Empowering small VLMs to think with dynamic memorization and exploration,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation Empowering small VLMs to think with dynamic memorization and exploration,

Reference 30

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:03:55.532537Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-15T15:03:54.547166Z digest=sha256:700b07399674789aca28a99e687ce30917fe41e31a7faaa61f8195ae6cd9d14b

Observation ba301dd4-4fb2-48c0-9f4b-9cd6aa462077 · outbound

This paper cites Flamingo: a visual language model for few-shot learning,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation Flamingo: a visual language model for few-shot learning,

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-15T15:03:54.549912Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T15:03:54.549912Z digest=sha256:f106918108019ab4be1ca0c4ff80fc6388cad3a37ff02f2bb04766e8c0a43e83

Observation 4ef2b056-5ca2-4e0f-b851-d7cfdeda56ed · outbound

This paper cites InstructBLIP: Towards general- purpose vision-language models with instruction tuning,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation InstructBLIP: Towards general- purpose vision-language models with instruction tuning,

Reference 32

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:03:55.515579Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-15T15:03:54.552627Z digest=sha256:af1ef2163b63236eda3e3098ef50bb44d6a364941e6cd389511a2fa14b6e14e7

Observation b1bfb3f6-1214-4997-bad2-880feadda6ea · outbound

This paper cites Visual instruc- tion tuning,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation Visual instruc- tion tuning,

Reference 33

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:03:55.503849Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-15T15:03:54.555846Z digest=sha256:d3ff2e9ae50dfc1059f748f755d129e603ce1949ce492af4158738a9d2023a8f

Observation 4bcfd626-2366-4f5a-9e93-9a24e3ad82a9 · outbound

This paper cites Improved baselines with visual instruction tuning,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation Improved baselines with visual instruction tuning,

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-15T15:03:54.559036Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T15:03:54.559036Z digest=sha256:f690a2ade774f82510693760eab7edc275c68a20713f11fb8ed6ddf4af9c2523

Observation 601a7695-856f-42b3-9a2d-7cf4149bce0b · outbound

This paper cites Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-15T15:03:54.562380Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T15:03:54.562380Z digest=sha256:5ca6ee5f7d53947dfa6c8dc5aa18ed1dda0958bed959b5f6400fcee201975323

Observation b60787d1-80fa-49d2-a7ce-2e81bbe1d8cf · outbound

This paper cites Qwen3-VL Technical Report.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation Qwen3-VL Technical Report

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-15T15:03:54.565807Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T15:03:54.565807Z digest=sha256:bbc005ee931a362c9900b6230372a70cfa2e20e826f210a9f4ea9d3cd399b17b

Observation d7be95b9-76e9-4630-add3-b89b088f9cb8 · outbound

This paper cites Latent Visual Reasoning.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation Latent Visual Reasoning

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-15T15:03:54.569025Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T15:03:54.569025Z digest=sha256:8b0a8417d3880a3a8a7aa0823f61372ecf8fb770895906991eaaa45a9ceae750

Observation cc610fa0-ba34-4b73-82ad-5953674b34df · outbound

This paper cites Segment anything,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation Segment anything,

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-15T15:03:54.572969Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T15:03:54.572969Z digest=sha256:bf074ca21c2d6f73fda94af98ca4924b63b2fd66d57aae7c30cdf908f0638967

Observation 89d0900f-e339-48d5-9708-b9d2454358b2 · outbound

This paper cites SegLLM: Multi- round reasoning segmentation with large language mod- els,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation SegLLM: Multi- round reasoning segmentation with large language mod- els,

Reference 39

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:03:55.477234Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-15T15:03:54.576145Z digest=sha256:ee42af489a7e5b12efbe6f919786811b1084e0775dd875217ec8a76ac0728033

Observation 880f5ac2-2e34-495f-ab32-5e666196e4dd · outbound

This paper cites MLLM can see? dynamic correction decoding for hallucination mitigation,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation MLLM can see? dynamic correction decoding for hallucination mitigation,

Reference 40

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:03:55.465603Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-15T15:03:54.579585Z digest=sha256:c472f48b01b108759385b3dcc629fc7a339b06a9eeb9d71b0f77651ff46b72c0

Observation 0dbd1d34-3a1f-4c57-a305-322c6a077190 · outbound

This paper cites Grounding multimodal large lan- guage models to the world,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation Grounding multimodal large lan- guage models to the world,

Reference 41

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:03:55.454938Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-15T15:03:54.582934Z digest=sha256:6f0c8df8657e8595fe20da4e2b62c0d4eeb539b29c5303fff8e3127f66283dd8

Observation 7a34b36a-3858-4006-9236-d7ef689eefbc · outbound

This paper cites Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-15T15:03:54.586131Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T15:03:54.586131Z digest=sha256:a832714cac35858e920841537b376f4b1e1091eb7b5bda2b0e77e121c3c2e241

Observation aa5a3832-948a-4297-8a62-0e08b2f85793 · outbound

This paper cites Perception tokens en- hance visual reasoning in multimodal language models,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation Perception tokens en- hance visual reasoning in multimodal language models,

Reference 43

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:03:55.444001Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-15T15:03:54.590186Z digest=sha256:98b93a9b41fbb3f6c7739bfbf11845c4a66a2ef8aca88710b14c8b07df891932

Observation eb3ae115-811f-4f68-b83c-eef6c98af6df · outbound

This paper cites ViperGPT: Visual inference via python execution for reasoning,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation ViperGPT: Visual inference via python execution for reasoning,

Reference 44

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:03:55.432028Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-15T15:03:54.593395Z digest=sha256:4b4da9861bc3f2aee9c4121315da354b8cdb7a2cb17fa3431871ff30911ad1c9

Observation 0a5f2e30-0404-48a2-a1c9-a8cbc821d645 · outbound

This paper cites Chameleon: Plug- and-play compositional reasoning with large language models,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation Chameleon: Plug- and-play compositional reasoning with large language models,

Reference 45

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:03:55.419995Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-15T15:03:54.596946Z digest=sha256:a05f8a6e2488521c3abfe8639925840a8b912e3f5528582492831388899a53a1

Observation bb0adc8a-f9b2-425d-908b-274ec596363f · outbound

This paper cites MM-REACT: Prompting ChatGPT for Multimodal Reasoning and Action.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation MM-REACT: Prompting ChatGPT for Multimodal Reasoning and Action

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-15T15:03:54.601092Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T15:03:54.601092Z digest=sha256:7eac3982f3b075dbdba18a385e77e63b77548fa6314a132dd286d4e67aee3917

Observation b7e4c956-5862-495f-832d-88bbaf4587e6 · outbound

This paper cites Visual sketchpad: Sketching as a visual chain of thought for multimodal language models,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation Visual sketchpad: Sketching as a visual chain of thought for multimodal language models,

Reference 47

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:03:55.408294Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-15T15:03:54.604239Z digest=sha256:0fb8ce29136b8ef7f49d44297b0025070ed0e352fd3c50742059d794796ba949

Observation 039fe8d4-6bfa-4653-aa56-f6504ca3128a · outbound

This paper cites Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-15T15:03:54.608308Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T15:03:54.608308Z digest=sha256:770f8ef81002f02941765893b316f91d4c465e0da9541f65bb9d0d3aef7f4a5a

Observation d51d1135-2c12-457c-8f96-f903be002fff · outbound

This paper cites Multimodal chain of continu- ous thought for latent-space reasoning in vision-language models,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation Multimodal chain of continu- ous thought for latent-space reasoning in vision-language models,

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-15T15:03:54.611963Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T15:03:54.611963Z digest=sha256:88e57c72f8042e924632f31751271614a338f7a1db840583084fd64993cb0dcc

Observation 11a287d2-81e2-49de-92d2-4c52baffc397 · outbound

This paper cites GRES: Generalized referring expression segmentation,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation GRES: Generalized referring expression segmentation,

Reference 50

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:03:55.396241Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-15T15:03:54.615118Z digest=sha256:aae7187dda89c75e56d370498ec4456c70a0d6ec5970767e5b4176007987e016

Observation 47842052-bb3f-4e0b-83c1-8a29e5673b6b · outbound

This paper cites Rotated multi-scale interaction network for referring remote sensing image segmentation,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation Rotated multi-scale interaction network for referring remote sensing image segmentation,

Reference 51

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:03:55.384191Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-15T15:03:54.618641Z digest=sha256:a7bd85c0542e124c51da774ee72bde14260fc4da61e40abdd4c44caf35b6895e

Observation 1620cbd2-528e-4e73-91ae-c95901437297 · outbound

This paper cites SegEarth-R1: Geospatial Pixel Reasoning via Large Language Model.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation SegEarth-R1: Geospatial Pixel Reasoning via Large Language Model

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-15T15:03:54.622033Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T15:03:54.622033Z digest=sha256:f3b6e13bc997d0321043a9123a318b1b8a7c009acf203791b6b37a98a3c98990

Observation 0b84a510-00d2-4954-b6bd-49f51a874a90 · outbound

This paper cites COCO-Stuff: Thing and stuff classes in context,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation COCO-Stuff: Thing and stuff classes in context,

Reference 53

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:03:55.373193Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-15T15:03:54.625478Z digest=sha256:14189ef696fe821f743d4e1f2a8b9038d3c20949aa1947314fffb667fde4bdaa

Observation d2717e80-0ea9-4c2e-9947-75f9d4fdbce6 · outbound

This paper cites Microsoft COCO: Common objects in context,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation Microsoft COCO: Common objects in context,

Reference 54

Resolution
unresolved
no resolver link, observed 2026-08-15T15:03:54.628758Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T15:03:54.628758Z digest=sha256:fcd1c6cd66093827bc9459e59258150ec438c68de555d018f7f2720e0cb4e67c

Observation eb93b69d-18f0-4682-9bec-984b6b5b5123 · outbound

This paper cites Universal instance perception as object discovery and retrieval,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation Universal instance perception as object discovery and retrieval,

Reference 55

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:03:55.352548Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-15T15:03:54.632035Z digest=sha256:d3f11e8d1ea42ad20cc414b44f197483efa3059713f9e2bc661a18ba02bb446e

Observation 3ec1a4bd-74fd-4935-8aa8-974b566a410c · outbound

This paper cites PolyFormer: Referring im- age segmentation as sequential polygon generation,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation PolyFormer: Referring im- age segmentation as sequential polygon generation,

Reference 56

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:03:55.342361Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-15T15:03:54.636007Z digest=sha256:fc9998d84bb45fc3c742e0db021a653f9c56d266a2ae1e5a61cee3af34149fad

Observation 725c51a9-44cd-4e61-9b12-4e53da9d4a99 · outbound

This paper cites Language-aware vision transformer for referring segmentation,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation Language-aware vision transformer for referring segmentation,

Reference 57

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:03:55.330716Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-15T15:03:54.640328Z digest=sha256:9357034a120b0de684f149df62cc7f29fe9341f4b8a174edc8b74252abe85e59

Observation 26b018bf-29de-478c-8b7d-71d677686b35 · outbound

This paper cites Open-vocabulary semantic segmentation with mask-adapted clip,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation Open-vocabulary semantic segmentation with mask-adapted clip,

Reference 58

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:03:55.320074Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-15T15:03:54.644661Z digest=sha256:05419c17fc45a3c1dbac0c7d7163a7548b121b72240dc94adee22c9e5e27e354

Observation 803c6677-c8c7-45ba-a00e-0f9ba6204390 · outbound

This paper cites NExT- Chat: An LMM for chat, detection and segmentation,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation NExT- Chat: An LMM for chat, detection and segmentation,

Reference 59

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:03:55.309625Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-15T15:03:54.648336Z digest=sha256:2df160bfe3f4efd9b640284a14fa18f7502e0749c9d92264962f35f62a5ae7d6

Observation 46fea211-ec73-42f4-af8c-c4d41d115b7f · outbound

This paper cites GeoGround: A Unified Large Vision-Language Model for Remote Sensing Visual Grounding.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation GeoGround: A Unified Large Vision-Language Model for Remote Sensing Visual Grounding

Reference 60

Resolution
unresolved
no resolver link, observed 2026-08-15T15:03:54.651396Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T15:03:54.651396Z digest=sha256:58b88cd81953b19a522bdc1e035c9153dfbc1a974d0b6f88bfdd19c817c1af86

Observation 7e48c61d-4e4a-4342-99f8-ab0fd99b6040 · outbound

This paper cites Semantic understanding of scenes through the ADE20K dataset,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation Semantic understanding of scenes through the ADE20K dataset,

Reference 61

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:03:55.299727Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-15T15:03:54.655043Z digest=sha256:45d072412c6a6ce9ae1b98070948d7dea408f27227d7181eb999501cb649bd44

Observation 181e0006-ebcc-47e4-bf79-0cb248aab9ad · outbound

This paper cites The role of context for object detection and semantic segmentation in the wild,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation The role of context for object detection and semantic segmentation in the wild,

Reference 62

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:03:55.289134Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-15T15:03:54.658153Z digest=sha256:38d27ea03d64f08f0f1e468e57334ca119b000cff4e8f84c224fdaa6c2dba875

Observation eddf5a35-7074-4569-a919-967d4eb3d5a1 · outbound

This paper cites The PASCAL visual object classes (VOC) challenge,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation The PASCAL visual object classes (VOC) challenge,

Reference 63

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:03:55.278159Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-15T15:03:54.661299Z digest=sha256:aaedb7bb9760bb95279343a52d2e74bad8930e9036735cfe1cc32fb7bd9b326b

Observation e1620c24-8c25-44af-a28b-225d4a69d47e · outbound

This paper cites ClearCLIP: Decomposing clip representa- tions for dense vision-language inference,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation ClearCLIP: Decomposing clip representa- tions for dense vision-language inference,

Reference 64

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:03:55.267908Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-15T15:03:54.664544Z digest=sha256:2442d4c0c9dd0cdb6e5ccb7cca79f99e13d0d1a4deda59d3c4342aa584f06100

Observation dc9135cc-a1c3-4133-8670-8aa8dab1b5c1 · outbound

This paper cites ProxyCLIP: Proxy attention improves clip for open-vocabulary segmentation,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation ProxyCLIP: Proxy attention improves clip for open-vocabulary segmentation,

Reference 65

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:03:55.257251Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-15T15:03:54.667767Z digest=sha256:c411a65344e8d7caf18b33f1e2f09c7214d574d9aac9e2c3c326a42234bf9838

Observation ae84c898-2067-4b56-abdb-828bdc0b91e7 · outbound

This paper cites Open-vocabulary universal image segmentation with maskclip,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation Open-vocabulary universal image segmentation with maskclip,

Reference 66

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:03:55.246133Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-15T15:03:54.670894Z digest=sha256:62769de7513a7fd7aaa3cc9053a3ddb70201b0dab340c900b98b94e068c0cb42

Observation 284bd96e-62dd-4aec-8b06-0bf807a575c3 · outbound

This paper cites GroupViT: Semantic segmenta- tion emerges from text supervision,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation GroupViT: Semantic segmenta- tion emerges from text supervision,

Reference 67

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:03:55.235335Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-15T15:03:54.674129Z digest=sha256:f1c0481826af3ef63715f26a3b4b8a7c49f9fdc63db24cccfba230bd2635f999

Observation d0702a6f-98d4-4145-aafa-76ed3cdfd46c · outbound

This paper cites SAN: Side adapter network for open-vocabulary semantic seg- mentation,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation SAN: Side adapter network for open-vocabulary semantic seg- mentation,

Reference 68

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:03:55.225448Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-15T15:03:54.677975Z digest=sha256:245e8729971552160282102a8175c57d0e0222be19f981a2747409b9e4c67533

Observation 6bfc685c-e110-4a95-aa14-55fcf932c696 · outbound

This paper cites LaSagnA: Language-based Segmentation Assistant for Complex Queries.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation LaSagnA: Language-based Segmentation Assistant for Complex Queries

Reference 69

Resolution
unresolved
no resolver link, observed 2026-08-15T15:03:54.681762Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T15:03:54.681762Z digest=sha256:4264c5fbf8f5881ddddb970ff46f30c90627c5cb6c64df69e6d25762881ca8fb

Observation b02ad1b6-b270-415a-afc2-63967b3a525d · outbound

This paper cites POPEN: Preference-based optimization and ensemble for LVLM-based reasoning segmentation,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation POPEN: Preference-based optimization and ensemble for LVLM-based reasoning segmentation,

Reference 70

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:03:55.214842Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-15T15:03:54.685764Z digest=sha256:b70fcaa67049597512dfd86f7b0765cc1e79ff6860cb66e9e78f333c88a690a5

Observation f4f4dae6-1f65-4854-9c44-ec1f3a0942bc · outbound

This paper cites MMMU: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation MMMU: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi,

Reference 71

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:03:55.202978Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-15T15:03:54.689762Z digest=sha256:3b4747163b39dfd6a3c80d0ff1973e08008356c60202668094d9d69901a9d9a8

Observation 70d01109-c09b-4ca4-aea6-09f72332c59d · outbound

This paper cites MMBench: Is your multi-modal model an all-around player?.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation MMBench: Is your multi-modal model an all-around player?

Reference 72

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:03:55.187936Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-15T15:03:54.693636Z digest=sha256:9374119bb8f6461286f668c96bea06febc2d1aa42f3e5589acce0ce745892f47

Observation 93f5a652-b3c4-4b62-a4d2-0f96a4779fce · outbound

This paper cites Are we on the right way for evaluating large vision-language models?.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation Are we on the right way for evaluating large vision-language models?

Reference 73

Resolution
unresolved
no resolver link, observed 2026-08-15T15:03:54.697655Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T15:03:54.697655Z digest=sha256:68665b93abf0356556be778a00dd161357c697e58ee8a8ff8e4c7e799b8d0a27

Observation 9def69ac-b21b-49dc-9a2f-35e2016ac5a6 · outbound

This paper cites Learn to explain: Multimodal reasoning via thought chains for science question answering,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation Learn to explain: Multimodal reasoning via thought chains for science question answering,

Reference 74

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:03:55.168942Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-15T15:03:54.701863Z digest=sha256:6f04f6a257db568dbfe9b8593d2e490dc9b6325354c4bf658d8c3b5e6430cbd6

Observation 2815211c-9384-4853-9633-3416355e1333 · outbound

This paper cites Towards VQA models that can read,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation Towards VQA models that can read,

Reference 75

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:03:55.155787Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-15T15:03:54.706323Z digest=sha256:639af88d790fa01510734f6127b8a9c2fa5349476eeb01c4a23cfd0aa91b44e4

Observation f8b30706-2dfe-42d5-9f36-854c70f92195 · outbound

This paper cites VizWiz grand challenge: Answering visual questions from blind people,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation VizWiz grand challenge: Answering visual questions from blind people,

Reference 76

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:03:55.144779Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-15T15:03:54.710735Z digest=sha256:a422a393389766fc739423ab8c88fd2cf7ab26f16dfe520743e6b53652b3b2ca

Pith citing papers

No inbound Pith citation observations are available.