Pith. sign in

Paper Citation Record · LEDGER

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation

As of 16 August 2026, this Paper Citation Record lists 76 of 76 outbound references and 0 inbound Pith citation observations for arXiv:2608.02791.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2608.02791 v1

Coverage vector

measured 76 of 76 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-15T15:03:54.710735Z

measured 76 of 76 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-16T06:30:59.297886+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

76 of 76 outbound references displayed

  • verified exact1
  • verified fuzzy52
  • unresolved23
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 04b08a1d-1618-4655-a739-2cf0e76629af · outbound

This paper cites Better, stronger, faster: Tackling the trilemma in mllm-based segmentation with simultaneous textual mask prediction,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation Better, stronger, faster: Tackling the trilemma in mllm-based segmentation with simultaneous textual mask prediction,

Reference 1

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:03:55.761672Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T15:03:54.451796Z digest=sha256:09daba01a25b118b1707c8e6e445c19bfbdc3f4e41b789a1855d947a454ab8f3

Observation b8bfe145-ca25-4b8d-8ae0-6e0548181006 · outbound

This paper cites Qwen3 Technical Report.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation Qwen3 Technical Report

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-15T15:03:54.455763Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T15:03:54.455763Z digest=sha256:8ee4adbb5250bc58b059a866d311f03886881092bb534e011b4017aedaae9cd4

Observation 3d1abe1e-a1fb-45e0-b662-4ffe1e1796eb · outbound

This paper cites LION: Empowering multimodal large language model with dual-level visual knowledge,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation LION: Empowering multimodal large language model with dual-level visual knowledge,

Reference 3

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:03:55.752270Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T15:03:54.458646Z digest=sha256:6b827593197fb922fbdd5e2ffbe576cc59aa22ca802a69c6c6b82951347d8439

Observation ca71740f-6953-4b02-9706-29476b94628c · outbound

This paper cites MLLMs know where to look: Training-free perception of small visual details with multimodal llms,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation MLLMs know where to look: Training-free perception of small visual details with multimodal llms,

Reference 4

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:03:55.742657Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T15:03:54.461511Z digest=sha256:ac000e1662cfc26d396ad822bb9141edc1b484066dd830230d644d619877f0e0

Observation fd34f1a2-1f9d-4b9a-92b8-e75336cd8852 · outbound

This paper cites Detect anything via next point prediction,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation Detect anything via next point prediction,

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-15T15:03:54.464691Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T15:03:54.464691Z digest=sha256:36425e9ce0d310b6946962e53655cc4e51f0d5bd31ff92c8f40cca663b4d60d7

Observation ee3bf2eb-43a2-496a-881a-07ff99bee524 · outbound

This paper cites InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-15T15:03:54.467561Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T15:03:54.467561Z digest=sha256:88e5eb96ca90ae107f8196c240fdab25fc38c702cdc19167758f9aed3ced1b98

Observation 43e2b31a-79ee-4d7c-a186-bdf99bf31cac · outbound

This paper cites LLaVA-OneVision: Easy Visual Task Transfer.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation LLaVA-OneVision: Easy Visual Task Transfer

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-15T15:03:54.471468Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T15:03:54.471468Z digest=sha256:40f035a296f98f1316b584e15d6aa4c7d9244872ae7bdb81991438ab72a06e0f

Observation c482a154-3187-4ee1-abb6-cc7a6053be76 · outbound

This paper cites PhD: A ChatGPT-prompted visual halluci- nation evaluation dataset,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation PhD: A ChatGPT-prompted visual halluci- nation evaluation dataset,

Reference 8

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:03:55.732220Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T15:03:54.475046Z digest=sha256:53579bf312cb94d9252f5d518b9ef5e1fb7ae709cd9def5a51860b5cc8d101eb

Observation fe07297c-e113-4a74-a93a-53d6c32697a0 · outbound

This paper cites Qwen2.5-VL Technical Report.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation Qwen2.5-VL Technical Report

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-15T15:03:54.478261Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T15:03:54.478261Z digest=sha256:a897ab8f39e7bac8985e32b65537f971b950d9dde88ffee6b046b900acabe20c

Observation 74ed9fa0-c20d-4ae6-b070-15bd8cf4e1c8 · outbound

This paper cites Segmentation as a plug-and-play capability for frozen multimodal LLMs,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation Segmentation as a plug-and-play capability for frozen multimodal LLMs,

Reference 10

Resolution
verified exact
raw_fallback, observed 2026-08-15T15:03:54.999538Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T15:03:54.481589Z digest=sha256:d71205ba56e9b9215a90709d151337d1a105269ed05057fb16c2ec54462eb838

Observation a224531b-01d7-47f8-abe9-b5079e6bed0b · outbound

This paper cites Text4Seg: Reimagining image segmentation as text generation,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation Text4Seg: Reimagining image segmentation as text generation,

Reference 11

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:03:55.721351Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T15:03:54.485332Z digest=sha256:c2c3f508288688a65cfc54632428d0644e13a70f6376d06282825160877ee82d

Observation cfd23eaa-e655-4fde-b097-85598dce54c2 · outbound

This paper cites LISA: Reasoning segmentation via large language model,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation LISA: Reasoning segmentation via large language model,

Reference 12

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:03:55.710085Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T15:03:54.488627Z digest=sha256:a6ccc69462df24a4d2b3769fd8d8b64f65db81ec4937c8d6ee545a9d2718ddfb

Observation e441a837-c859-4918-bd43-56a6b0bd4abb · outbound

This paper cites GSV A: Generalized segmentation via multimodal large language models,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation GSV A: Generalized segmentation via multimodal large language models,

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:03:55.699166Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T15:03:54.491801Z digest=sha256:c7072abf11d3a84a8b8e4d8ee26fd63474fb44d56ddf20e0b1ce4ba7919201af

Observation eb594ba4-8168-43c7-8986-3c49e5eeae95 · outbound

This paper cites PixelLM: Pixel reasoning with large multimodal model,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation PixelLM: Pixel reasoning with large multimodal model,

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:03:55.687046Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T15:03:54.495099Z digest=sha256:590f866f4a48ddfa6f913e98525888e71038358c74ef3676282874686a1f499e

Observation 7c0d53ec-299e-45d1-b124-5e19aee050d1 · outbound

This paper cites MMR: A large-scale benchmark dataset for multi-target and multi- granularity reasoning segmentation,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation MMR: A large-scale benchmark dataset for multi-target and multi- granularity reasoning segmentation,

Reference 15

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:03:55.675152Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T15:03:54.498237Z digest=sha256:e28f8c01e0a49a27ce4d1cf9d64f1428dca6d1c4d4195f385be4b4c03d9d8c5e

Observation fef7e871-c616-421b-9dec-eb69d416b313 · outbound

This paper cites Reasoning to attend: Try to understand how<SEG>token works,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation Reasoning to attend: Try to understand how<SEG>token works,

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:03:55.658171Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T15:03:54.501558Z digest=sha256:5318fce58beab84c476dea2ee3373e5284e7de4ae96b44ac307023e9c9686be1

Observation 03e114b1-1560-4466-9e71-3d6dd8b1a0d0 · outbound

This paper cites VisionLLM v2: An end-to-end generalist multimodal large language SUBMISSION 17 model for hundreds of vision-language tasks,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation VisionLLM v2: An end-to-end generalist multimodal large language SUBMISSION 17 model for hundreds of vision-language tasks,

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:03:55.647250Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T15:03:54.504748Z digest=sha256:9aaea2ea2741eec2e56332c88a07e34fd2769e6db8440351dc7555c3239b23ad

Observation a2b4c67b-43b8-4186-bbfb-521c4f802bb2 · outbound

This paper cites Seg-Zero: Reasoning-Chain Guided Segmentation via Cognitive Reinforcement.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation Seg-Zero: Reasoning-Chain Guided Segmentation via Cognitive Reinforcement

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-15T15:03:54.508438Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T15:03:54.508438Z digest=sha256:2faca50173438f64e19af6bad1ff1f54976de4d6fa016cc41fee4cc24755ba97

Observation 1cd02046-2b11-4129-b374-725484920792 · outbound

This paper cites SegAgent: Exploring pixel understanding capabilities in mllms by imitating human annotator trajectories,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation SegAgent: Exploring pixel understanding capabilities in mllms by imitating human annotator trajectories,

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:03:55.636086Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T15:03:54.512508Z digest=sha256:a14f54f0bc3dc23fa1fefb3a993acb1be57ffdac577508076913ad76bbb2cef0

Observation 406235f7-a893-424f-82dc-c6601765be84 · outbound

This paper cites Text4Seg++: Advancing image segmentation via generative language modeling,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation Text4Seg++: Advancing image segmentation via generative language modeling,

Reference 20

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:03:55.624006Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T15:03:54.515797Z digest=sha256:1e4d0d627299268a3c3ce95f6dbbe7e0fde1f733ddb6333d0defb05de8f3b0aa

Observation 0593f58f-a32d-4410-bbc3-0c92be3785c8 · outbound

This paper cites GLaMM: Pixel grounding large multimodal model,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation GLaMM: Pixel grounding large multimodal model,

Reference 21

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:03:55.610352Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T15:03:54.519060Z digest=sha256:cb8457da7cb13fc0bf94fd740c4650b836d3109fdcdf9e476cd6d53ae3f578cb

Observation 2f93bd10-bd8f-48bc-8cda-0272fd706c1d · outbound

This paper cites See say and segment: Teaching LMMs to overcome false premises,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation See say and segment: Teaching LMMs to overcome false premises,

Reference 22

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:03:55.597190Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T15:03:54.522174Z digest=sha256:1771262f33b42045d6cfc7eebf6260815a6a2b1f7014bc93c402f70cb8574bbd

Observation 6c2cd546-1986-45f4-9431-bc70bd7b7acd · outbound

This paper cites VisionLLM: Large language model is also an open-ended decoder for vision-centric tasks,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation VisionLLM: Large language model is also an open-ended decoder for vision-centric tasks,

Reference 23

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:03:55.584499Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T15:03:54.525407Z digest=sha256:5e8ce1de6150156ae9aa863b5825f8e874d5f468552765d4206780c1c3865e1b

Observation 29f44c12-a969-43fd-9612-dd62a074efcb · outbound

This paper cites ReferItGame: Referring to objects in photographs of natural scenes,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation ReferItGame: Referring to objects in photographs of natural scenes,

Reference 24

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:03:55.572467Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T15:03:54.529505Z digest=sha256:858f5ef800a77d695ef5ee2a8286b1f987c5f9cf398dc60d0289bc87496abc52

Observation 4b02c12e-dc90-4336-ac4f-24207e27f9fb · outbound

This paper cites Generation and comprehension of un- ambiguous object descriptions,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation Generation and comprehension of un- ambiguous object descriptions,

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:03:55.562135Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T15:03:54.532686Z digest=sha256:7cd2ae6309a36c0e27356172b9cbee897e7bf99b9471fa0368f20aa2d3789cfd

Observation 719a921b-2021-4c44-b8e0-e1ba6d91a1df · outbound

This paper cites Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-15T15:03:54.535460Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T15:03:54.535460Z digest=sha256:f41769487d8aa149bd9dc3c7671e64964dcb12712bc24442a2255e8bb51e9c5e

Observation d939e361-afbb-4349-97ee-e866c4f81170 · outbound

This paper cites Scaling Laws for Neural Language Models.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation Scaling Laws for Neural Language Models

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-15T15:03:54.538716Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T15:03:54.538716Z digest=sha256:9070ce36e7384a18eb4dd3033d6000d2133c745fef01d7a454e098648dad3ccb

Observation 1426642a-64c0-4a48-85f4-5549ba467a59 · outbound

This paper cites Hello GPT-4o,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation Hello GPT-4o,

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:03:55.552541Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T15:03:54.541848Z digest=sha256:ae55c8d6ad81984a4ca094113a795ccc4ff28b05f6f07eec5d247ad6dfbdde40

Observation e219408a-a3d9-46a8-9b7e-8476dfae5a2c · outbound

This paper cites Google Gemini 2.5 Pro,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation Google Gemini 2.5 Pro,

Reference 29

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:03:55.543034Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T15:03:54.544489Z digest=sha256:761cc6ba6bc2ce3bc1ddf3fdca28fa0aa10dba3ddfa54cf0ed2364f204d94c7a

Observation 912d1f00-b430-4f06-84fd-bc4c4677137f · outbound

This paper cites Empowering small VLMs to think with dynamic memorization and exploration,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation Empowering small VLMs to think with dynamic memorization and exploration,

Reference 30

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:03:55.532537Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T15:03:54.547166Z digest=sha256:9500e67229e9484cfae9538c94ba4431d072abdf56a8b67b6ef3e1b0f582848f

Observation ba301dd4-4fb2-48c0-9f4b-9cd6aa462077 · outbound

This paper cites Flamingo: a visual language model for few-shot learning,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation Flamingo: a visual language model for few-shot learning,

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-15T15:03:54.549912Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T15:03:54.549912Z digest=sha256:373f81d1eb34245fd78890663c9c828b0d0aa1a001745e056983d9b99de675cc

Observation 4ef2b056-5ca2-4e0f-b851-d7cfdeda56ed · outbound

This paper cites InstructBLIP: Towards general- purpose vision-language models with instruction tuning,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation InstructBLIP: Towards general- purpose vision-language models with instruction tuning,

Reference 32

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:03:55.515579Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T15:03:54.552627Z digest=sha256:68cec8135c8136028effb76543825c8732fce1d53e83cc22236e9a5948a1e236

Observation b1bfb3f6-1214-4997-bad2-880feadda6ea · outbound

This paper cites Visual instruc- tion tuning,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation Visual instruc- tion tuning,

Reference 33

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:03:55.503849Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T15:03:54.555846Z digest=sha256:c5878005372ee0ebc689818e1ccbbc6bc9c9bdbc92823113e51608dab3fbbde7

Observation 4bcfd626-2366-4f5a-9e93-9a24e3ad82a9 · outbound

This paper cites Improved baselines with visual instruction tuning,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation Improved baselines with visual instruction tuning,

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-15T15:03:54.559036Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T15:03:54.559036Z digest=sha256:a690685f8ae60eed0771343e7bd6a6b6843d26eb2c82cf2b5311fca79bea1f52

Observation 601a7695-856f-42b3-9a2d-7cf4149bce0b · outbound

This paper cites Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-15T15:03:54.562380Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T15:03:54.562380Z digest=sha256:eb22d0dfa0ddb9ac99512c931119b320c9f79e5b8f46c0a733fc49d27fde180b

Observation b60787d1-80fa-49d2-a7ce-2e81bbe1d8cf · outbound

This paper cites Qwen3-VL Technical Report.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation Qwen3-VL Technical Report

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-15T15:03:54.565807Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T15:03:54.565807Z digest=sha256:24f9fe6f7bd4fe71354475e0376d55fd994b6fe65fa648b9d1895a78d320ad30

Observation d7be95b9-76e9-4630-add3-b89b088f9cb8 · outbound

This paper cites Latent Visual Reasoning.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation Latent Visual Reasoning

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-15T15:03:54.569025Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T15:03:54.569025Z digest=sha256:4a2f4e8766bdbdac29d82b25fa01ad4e947fe389ddb1013f95e1e305878422c1

Observation cc610fa0-ba34-4b73-82ad-5953674b34df · outbound

This paper cites Segment anything,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation Segment anything,

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-15T15:03:54.572969Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T15:03:54.572969Z digest=sha256:8fa2587b04574e62f77086f678b13da8ee3e3672a7e409dc965b4f34b26822a8

Observation 89d0900f-e339-48d5-9708-b9d2454358b2 · outbound

This paper cites SegLLM: Multi- round reasoning segmentation with large language mod- els,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation SegLLM: Multi- round reasoning segmentation with large language mod- els,

Reference 39

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:03:55.477234Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T15:03:54.576145Z digest=sha256:cd26ca1e1a090f925ee1fe542728e5477474b0482313046ca7e230fd8dcb7783

Observation 880f5ac2-2e34-495f-ab32-5e666196e4dd · outbound

This paper cites MLLM can see? dynamic correction decoding for hallucination mitigation,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation MLLM can see? dynamic correction decoding for hallucination mitigation,

Reference 40

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:03:55.465603Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T15:03:54.579585Z digest=sha256:fd3ed15afb2c2da191c77cbd6d6d5375b804211ff3073f78230ccf9760a8f28e

Observation 0dbd1d34-3a1f-4c57-a305-322c6a077190 · outbound

This paper cites Grounding multimodal large lan- guage models to the world,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation Grounding multimodal large lan- guage models to the world,

Reference 41

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:03:55.454938Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T15:03:54.582934Z digest=sha256:90054f9ac6e43822e8155f43481c9cb51ff99b64cb1fa8bbf751f1ea692081ec

Observation 7a34b36a-3858-4006-9236-d7ef689eefbc · outbound

This paper cites Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-15T15:03:54.586131Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T15:03:54.586131Z digest=sha256:d029c0c6f3505afb05aea68d1d35723288db30b42d01c6f407b7db68f0fdefe6

Observation aa5a3832-948a-4297-8a62-0e08b2f85793 · outbound

This paper cites Perception tokens en- hance visual reasoning in multimodal language models,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation Perception tokens en- hance visual reasoning in multimodal language models,

Reference 43

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:03:55.444001Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T15:03:54.590186Z digest=sha256:78b8c910157cb27a03ef87cd7bf09c4ed3cff1edae2d2f0a1979555fd3049f97

Observation eb3ae115-811f-4f68-b83c-eef6c98af6df · outbound

This paper cites ViperGPT: Visual inference via python execution for reasoning,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation ViperGPT: Visual inference via python execution for reasoning,

Reference 44

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:03:55.432028Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T15:03:54.593395Z digest=sha256:6242267f8330f4d7421eb8aea45b48d8e2b7f80de0473e7098dff04931a6295d

Observation 0a5f2e30-0404-48a2-a1c9-a8cbc821d645 · outbound

This paper cites Chameleon: Plug- and-play compositional reasoning with large language models,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation Chameleon: Plug- and-play compositional reasoning with large language models,

Reference 45

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:03:55.419995Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T15:03:54.596946Z digest=sha256:9b4043e0c18ebf46bf50db743fd4b5146d07cc10372bcd744e7cec0ab70e8c44

Observation bb0adc8a-f9b2-425d-908b-274ec596363f · outbound

This paper cites MM-REACT: Prompting ChatGPT for Multimodal Reasoning and Action.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation MM-REACT: Prompting ChatGPT for Multimodal Reasoning and Action

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-15T15:03:54.601092Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T15:03:54.601092Z digest=sha256:a73ec452f9e8c48e389fc7b76476884ad3cd4b0976904ceb63d1b2dc148565af

Observation b7e4c956-5862-495f-832d-88bbaf4587e6 · outbound

This paper cites Visual sketchpad: Sketching as a visual chain of thought for multimodal language models,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation Visual sketchpad: Sketching as a visual chain of thought for multimodal language models,

Reference 47

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:03:55.408294Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T15:03:54.604239Z digest=sha256:251e1c3e9d1a4d2d1d61da78af4d3a9325664777519fe85d53c0fbe4663f24a1

Observation 039fe8d4-6bfa-4653-aa56-f6504ca3128a · outbound

This paper cites Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-15T15:03:54.608308Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T15:03:54.608308Z digest=sha256:a9f45b73a416a4d433c2444af55351a712e7a99438941cb5dff20af064e83782

Observation d51d1135-2c12-457c-8f96-f903be002fff · outbound

This paper cites Multimodal chain of continu- ous thought for latent-space reasoning in vision-language models,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation Multimodal chain of continu- ous thought for latent-space reasoning in vision-language models,

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-15T15:03:54.611963Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T15:03:54.611963Z digest=sha256:be868631171637bfd1d0de74276fe598c98934430d09d18518fd05e18a15b051

Observation 11a287d2-81e2-49de-92d2-4c52baffc397 · outbound

This paper cites GRES: Generalized referring expression segmentation,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation GRES: Generalized referring expression segmentation,

Reference 50

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:03:55.396241Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T15:03:54.615118Z digest=sha256:363ba82e040a4d120ff83df6d34e2e5d570d76d665a8246cb4497244e71554b1

Observation 47842052-bb3f-4e0b-83c1-8a29e5673b6b · outbound

This paper cites Rotated multi-scale interaction network for referring remote sensing image segmentation,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation Rotated multi-scale interaction network for referring remote sensing image segmentation,

Reference 51

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:03:55.384191Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T15:03:54.618641Z digest=sha256:648b81f57c034f26869c95d210ec46c25020ef9b783b3e70a00292333c430ca6

Observation 1620cbd2-528e-4e73-91ae-c95901437297 · outbound

This paper cites SegEarth-R1: Geospatial Pixel Reasoning via Large Language Model.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation SegEarth-R1: Geospatial Pixel Reasoning via Large Language Model

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-15T15:03:54.622033Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T15:03:54.622033Z digest=sha256:e50e839b8844cedc83b43cc1c77f20c0aaf7360036f1774eab24d0f907035271

Observation 0b84a510-00d2-4954-b6bd-49f51a874a90 · outbound

This paper cites COCO-Stuff: Thing and stuff classes in context,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation COCO-Stuff: Thing and stuff classes in context,

Reference 53

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:03:55.373193Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T15:03:54.625478Z digest=sha256:4430eb7711f1c0e4b76b18514e58f7d8b76bfa9daf0a6c03725f1b3493d3ca25

Observation d2717e80-0ea9-4c2e-9947-75f9d4fdbce6 · outbound

This paper cites Microsoft COCO: Common objects in context,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation Microsoft COCO: Common objects in context,

Reference 54

Resolution
unresolved
no resolver link, observed 2026-08-15T15:03:54.628758Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T15:03:54.628758Z digest=sha256:a14081f6ab94bdda1403944f1f01036ffc8292eb2a1a803321925f91a31a6494

Observation eb93b69d-18f0-4682-9bec-984b6b5b5123 · outbound

This paper cites Universal instance perception as object discovery and retrieval,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation Universal instance perception as object discovery and retrieval,

Reference 55

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:03:55.352548Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T15:03:54.632035Z digest=sha256:feed79a844e99571649ef791791f5499835648e779a89a292875bd464d55a162

Observation 3ec1a4bd-74fd-4935-8aa8-974b566a410c · outbound

This paper cites PolyFormer: Referring im- age segmentation as sequential polygon generation,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation PolyFormer: Referring im- age segmentation as sequential polygon generation,

Reference 56

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:03:55.342361Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T15:03:54.636007Z digest=sha256:a9d6492c501c0f58b722660197293f323d88c24724e4bbb8ccad5a44df5e2e05

Observation 725c51a9-44cd-4e61-9b12-4e53da9d4a99 · outbound

This paper cites Language-aware vision transformer for referring segmentation,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation Language-aware vision transformer for referring segmentation,

Reference 57

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:03:55.330716Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T15:03:54.640328Z digest=sha256:bf2ed8fda63da1cd92c98372b6159b21cd0c5e257a9ef63f005349c1b00804da

Observation 26b018bf-29de-478c-8b7d-71d677686b35 · outbound

This paper cites Open-vocabulary semantic segmentation with mask-adapted clip,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation Open-vocabulary semantic segmentation with mask-adapted clip,

Reference 58

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:03:55.320074Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T15:03:54.644661Z digest=sha256:c1bf78997985a913064be007ac2a4fb9b2dea10fa29a5c90bfa846783ae3e001

Observation 803c6677-c8c7-45ba-a00e-0f9ba6204390 · outbound

This paper cites NExT- Chat: An LMM for chat, detection and segmentation,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation NExT- Chat: An LMM for chat, detection and segmentation,

Reference 59

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:03:55.309625Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T15:03:54.648336Z digest=sha256:411a4824fd1b54c19494e9afef8db99ab3aa05c04152b283b3cb0a6cff2a9f2b

Observation 46fea211-ec73-42f4-af8c-c4d41d115b7f · outbound

This paper cites GeoGround: A Unified Large Vision-Language Model for Remote Sensing Visual Grounding.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation GeoGround: A Unified Large Vision-Language Model for Remote Sensing Visual Grounding

Reference 60

Resolution
unresolved
no resolver link, observed 2026-08-15T15:03:54.651396Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T15:03:54.651396Z digest=sha256:45f511c7b0f62590631ed74e9eab5b784d0a59a85d5a50ce1c72a3933ca8707b

Observation 7e48c61d-4e4a-4342-99f8-ab0fd99b6040 · outbound

This paper cites Semantic understanding of scenes through the ADE20K dataset,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation Semantic understanding of scenes through the ADE20K dataset,

Reference 61

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:03:55.299727Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T15:03:54.655043Z digest=sha256:639eb0a6b0bca3870441794192b1e68a186fbb431c5591419858cec968915f66

Observation 181e0006-ebcc-47e4-bf79-0cb248aab9ad · outbound

This paper cites The role of context for object detection and semantic segmentation in the wild,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation The role of context for object detection and semantic segmentation in the wild,

Reference 62

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:03:55.289134Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T15:03:54.658153Z digest=sha256:1b8c0f3101cdaf15ac9eb5b832dd9348a8bb4a7f3d98f36b0e3dd9fb2205befd

Observation eddf5a35-7074-4569-a919-967d4eb3d5a1 · outbound

This paper cites The PASCAL visual object classes (VOC) challenge,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation The PASCAL visual object classes (VOC) challenge,

Reference 63

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:03:55.278159Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T15:03:54.661299Z digest=sha256:79bd260a653b7419383fb8bcd560607a8920d7cce291e7b4b511d4f59d2d9a3a

Observation e1620c24-8c25-44af-a28b-225d4a69d47e · outbound

This paper cites ClearCLIP: Decomposing clip representa- tions for dense vision-language inference,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation ClearCLIP: Decomposing clip representa- tions for dense vision-language inference,

Reference 64

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:03:55.267908Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T15:03:54.664544Z digest=sha256:2e7f40455d0732eaa5c5634c29b24f0dbaaf729d6c9d7c3080affe3a316eb198

Observation dc9135cc-a1c3-4133-8670-8aa8dab1b5c1 · outbound

This paper cites ProxyCLIP: Proxy attention improves clip for open-vocabulary segmentation,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation ProxyCLIP: Proxy attention improves clip for open-vocabulary segmentation,

Reference 65

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:03:55.257251Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T15:03:54.667767Z digest=sha256:b8df762bce90bbbd8eb50d8aebd6afad666c49c55f4e827776c249b2eed783fb

Observation ae84c898-2067-4b56-abdb-828bdc0b91e7 · outbound

This paper cites Open-vocabulary universal image segmentation with maskclip,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation Open-vocabulary universal image segmentation with maskclip,

Reference 66

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:03:55.246133Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T15:03:54.670894Z digest=sha256:409f4c3c52b476c1f578db28f0453d29506064f2ffec7204f63f8c15306000ad

Observation 284bd96e-62dd-4aec-8b06-0bf807a575c3 · outbound

This paper cites GroupViT: Semantic segmenta- tion emerges from text supervision,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation GroupViT: Semantic segmenta- tion emerges from text supervision,

Reference 67

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:03:55.235335Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T15:03:54.674129Z digest=sha256:29ab95be95aa85613964e3f424befe0980c298a537922fbf8f853ea0c20ce277

Observation d0702a6f-98d4-4145-aafa-76ed3cdfd46c · outbound

This paper cites SAN: Side adapter network for open-vocabulary semantic seg- mentation,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation SAN: Side adapter network for open-vocabulary semantic seg- mentation,

Reference 68

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:03:55.225448Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T15:03:54.677975Z digest=sha256:5c3414cea29ebbf6df626106ec9eac0515bd17e59992af58a2a7e4d95042bfc7

Observation 6bfc685c-e110-4a95-aa14-55fcf932c696 · outbound

This paper cites LaSagnA: Language-based Segmentation Assistant for Complex Queries.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation LaSagnA: Language-based Segmentation Assistant for Complex Queries

Reference 69

Resolution
unresolved
no resolver link, observed 2026-08-15T15:03:54.681762Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T15:03:54.681762Z digest=sha256:ed9b1712c9a60c0b14ded915bbcb5284daa2f83e867f03f372a5b56f3ba9b135

Observation b02ad1b6-b270-415a-afc2-63967b3a525d · outbound

This paper cites POPEN: Preference-based optimization and ensemble for LVLM-based reasoning segmentation,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation POPEN: Preference-based optimization and ensemble for LVLM-based reasoning segmentation,

Reference 70

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:03:55.214842Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T15:03:54.685764Z digest=sha256:341d134dcd8c3d716e38e72173b772cd5b390becae665544b7c923096da81f1e

Observation f4f4dae6-1f65-4854-9c44-ec1f3a0942bc · outbound

This paper cites MMMU: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation MMMU: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi,

Reference 71

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:03:55.202978Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T15:03:54.689762Z digest=sha256:cbd800e504517dd4a98b5ae08448ca0392416231e4a807c2c63f9cd78bf7d59a

Observation 70d01109-c09b-4ca4-aea6-09f72332c59d · outbound

This paper cites MMBench: Is your multi-modal model an all-around player?.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation MMBench: Is your multi-modal model an all-around player?

Reference 72

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:03:55.187936Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T15:03:54.693636Z digest=sha256:a41bb9ec2c591d30858df5e982a0e8a3be1bc8d95f3b1f697ff4db69c061ea55

Observation 93f5a652-b3c4-4b62-a4d2-0f96a4779fce · outbound

This paper cites Are we on the right way for evaluating large vision-language models?.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation Are we on the right way for evaluating large vision-language models?

Reference 73

Resolution
unresolved
no resolver link, observed 2026-08-15T15:03:54.697655Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T15:03:54.697655Z digest=sha256:5faf8102e53db48616ee5da07529f0dfaaa757140c4046bd1b29d74f4b433073

Observation 9def69ac-b21b-49dc-9a2f-35e2016ac5a6 · outbound

This paper cites Learn to explain: Multimodal reasoning via thought chains for science question answering,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation Learn to explain: Multimodal reasoning via thought chains for science question answering,

Reference 74

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:03:55.168942Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T15:03:54.701863Z digest=sha256:73ca953690e41a8511bcb414bb6c75dc9a9a40a3d09746b81c9e4ec3fbc170da

Observation 2815211c-9384-4853-9633-3416355e1333 · outbound

This paper cites Towards VQA models that can read,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation Towards VQA models that can read,

Reference 75

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:03:55.155787Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T15:03:54.706323Z digest=sha256:b46da42519a515851b8c00089e28c58934ecdeccd7868a8ab77064584cdcd92b

Observation f8b30706-2dfe-42d5-9f36-854c70f92195 · outbound

This paper cites VizWiz grand challenge: Answering visual questions from blind people,.

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation VizWiz grand challenge: Answering visual questions from blind people,

Reference 76

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T15:03:55.144779Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T15:03:54.710735Z digest=sha256:0b295e5c47dce6d758b9b34a35d9e47e624e93bcb10467ee28730b3623adc9b7

Pith citing papers

No inbound Pith citation observations are available.