Typed states for the displayed outbound observations.
Source: paper_references, paper_reference_links, observed 2026-08-06T11:16:10.475961Z
Paper Citation Record · LEDGER
As of 7 August 2026, this Paper Citation Record lists 86 of 86 outbound references and 1 inbound Pith citation observation for arXiv:2507.22886.
A citation records a reference. It does not transfer a finding from one paper to another.
Typed states for the displayed outbound observations.
Source: paper_references, paper_reference_links, observed 2026-08-06T11:16:10.475961Z
One-hop event checks from named stored sources.
Source: scholarly_work_events, retraction_status_cache, observed 2026-08-06T06:34:29.942622+00:00
Pith citing papers itemized under the disclosed page cap.
Source: paper_references, paper_reference_links, observed 2026-05-10T15:35:37.095627Z
A source-named dated measurement, never combined with another source.
Source: arxiv_reference, observed 2026-05-11T10:11:08.927215Z
86 of 86 outbound references displayed
External citation measurements
No source-named external measurement is stored.
Observation 1ce8bf37-9ae5-49f7-b3e4-78a3253ac6ea · outbound
Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation Qwen Technical Report
Reference 1
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 2f00d2a4-c04b-4525-9a71-c51d555eb531 · outbound
Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
Reference 2
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation a5525f58-491f-4f40-93f7-0b2218537b1b · outbound
Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation One Token to Seg Them All: Language Instructed Reasoning Segmentation in Videos
Reference 3
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 022d88cb-68fc-4714-ac2f-f3c71fb547e8 · outbound
Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation METEOR: An Au- tomatic Metric for MT Evaluation with Improved Correla- tion with Human Judgments
Reference 4
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 777041a2-00ee-4a1a-9dc6-3c07deffeaeb · outbound
Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation End-to-End Referring Video Object Segmentation with Mul- timodal Transformers
Reference 5
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation e8e3eb20-6961-4062-a322-8376d74a004c · outbound
Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation Auditory Scene Analysis: The Perceptual Organization of Sound
Reference 6
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 9784a756-a69b-4dc8-8bc6-cbd6e11ed1b5 · outbound
Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation COCO- Stuff: Thing and Stuff Classes in Context
Reference 7
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation e53caa16-5819-4119-b0bd-d8051b52809f · outbound
Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation TIM: A Time Interval Ma- chine for Audio-Visual Action Recognition
Reference 8
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.
Observation c505fc3d-73be-4808-9367-b907a3ce0dc7 · outbound
Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio
Reference 9
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.
Observation 1ae1bae4-45c0-424a-8d2f-ee1031106421 · outbound
Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation VGGSound: A Large-scale Audio-Visual Dataset
Reference 10
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.
Observation 042946cb-fc4c-4e03-a6e0-73db51bb935a · outbound
Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation Detect What You Can: Detecting and Representing Objects using Holistic Models and Body Parts
Reference 11
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.
Observation 646c8340-d9cb-4d95-8eeb-802e3e114d5e · outbound
Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation Vision Transformer Adapter for Dense Predictions
Reference 12
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.
Observation 76f515e9-2c19-402f-a1c4-383e0f99abb1 · outbound
Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites
Reference 13
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 1e824bbf-bee8-4cc9-9ad0-a5e34c2278c8 · outbound
Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation Masked-attention Mask Transformer for Universal Image Segmentation
Reference 14
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.
Observation e2e4208a-25f8-4a3c-bd42-3fac05f3a85d · outbound
Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs
Reference 15
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation b10fd106-834c-4e6d-8b7b-ad7c8fdc633b · outbound
Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation Qwen2-Audio Technical Report
Reference 16
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation f6258804-80df-43ff-9a14-46e88b13db52 · outbound
Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation MeViS: A Large-scale Benchmark for Video Segmentation with Motion Expressions
Reference 17
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.
Observation 01f7c39d-536f-4319-b801-04d6ef0370b8 · outbound
Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation MOSE: A New Dataset for Video Object Segmentation in Complex Scenes
Reference 18
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.
Observation 4f1abf28-9b01-48f0-80fc-2db69cc2c347 · outbound
Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation Multimodal referring segmentation: A survey
Reference 19
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.
Observation 6c58ef9c-39ad-43f1-91f7-91a7b233dcde · outbound
Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation MOSEv2: A more challenging dataset for video object segmentation in complex scenes
Reference 20
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.
Observation a47ca59b-9d8f-4b35-bf3b-54d1f65feaf9 · outbound
Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation VITA: Towards Open-Source Interactive Omni Multimodal LLM
Reference 21
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.
Observation 48a5fa52-7c80-4b18-8b04-ac3a66fa6e90 · outbound
Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation A VSegFormer: Audio-Visual Segmentation with Transformer
Reference 22
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.
Observation 4dd43122-d005-4916-bbd3-36838b48a4d8 · outbound
Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation https://github.com/RVC- Boss/ GPT-SoVITS, 2024
Reference 23
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.
Observation 405c891e-2575-4736-bdea-30422574e22c · outbound
Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation Open- V ocabulary Audio-Visual Semantic Segmentation
Reference 24
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.
Observation 2807b96b-cd94-4504-a8de-d82e0c18893f · outbound
Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation Multi- modal Instruction Tuned LLMs with Fine-grained Visual Perception
Reference 25
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.
Observation 1371932c-7134-4480-abe1-c9c9ad800365 · outbound
Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation Decoupling Static and Hierarchical Motion Perception for Referring Video Seg- mentation
Reference 26
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.
Observation f6c70001-9a2d-426c-ad4f-06a8182e72a6 · outbound
Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation A Generalized Framework for Video Instance Segmentation
Reference 27
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.
Observation cd2dc9d9-8f31-40c9-a458-3c397f3283c0 · outbound
Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation Deep clustering: Discriminative embeddings for segmentation and separation
Reference 28
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.
Observation db461c65-20e1-4067-a559-4ffe04388662 · outbound
Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation LoRA: Low-Rank Adaptation of Large Language Models
Reference 29
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.
Observation d1af3745-296f-45f2-8d5f-9cc30daa77ac · outbound
Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation Egocentric Audio-Visual Object Localization
Reference 30
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.
Observation 50a7f8a0-b7c0-4f1b-9ca8-a92f7895044c · outbound
Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation Video Object Segmentation with Language Referring Expressions
Reference 31
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.
Observation 672b7acd-ee7b-4197-8a0b-e39f025dd6dd · outbound
Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation Segment Anything
Reference 32
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.
Observation e8dc9a84-77ca-4455-8bb8-8e76388a25f0 · outbound
Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation LISA: Reasoning Segmen- tation via Large Language Model
Reference 33
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.
Observation 64d9a684-9cda-4be5-9d2a-d1b0722f00db · outbound
Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation TVQA: Localized, Compositional Video Question Answer- ing
Reference 34
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.
Observation f176f74b-fda8-43ac-901b-0ec06487a5e0 · outbound
Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation Learning to Answer Questions in Dynamic Audio-Visual Scenarios
Reference 35
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.
Observation f8a8afd9-e3f0-4389-9471-37c213797fff · outbound
Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation Boosting Audio Visual Question Answering via Key Semantic-Aware Cues
Reference 36
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.
Observation fcccefce-30db-4420-a1eb-d1a5452bf3e4 · outbound
Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation Do Audio-Visual Segmentation Models Truly Segment Sounding Objects? arXiv, 2025
Reference 37
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.
Observation 645602e0-6408-4407-97dc-4093b00fe8fb · outbound
Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation Robust Referring Video Object Segmentation with Cyclic Structural Consensus
Reference 38
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.
Observation c8b02ec2-3a3d-4696-8be3-73d21c9be3ea · outbound
Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation Baichuan-Omni Technical Report
Reference 39
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation d5aae2dc-9bb8-440b-9bc7-5ff61ddce81d · outbound
Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation Losh: Long-short text joint prediction network for referring video object segmentation
Reference 40
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.
Observation 50923f62-0614-498b-9011-7e18564c6710 · outbound
Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation GRES: Generalized Referring Expression Segmentation
Reference 41
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.
Observation 891931f1-a7d3-4608-bc87-9c6f7b102264 · outbound
Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation Primitivenet: decomposing the global constraints for referring segmenta- tion
Reference 42
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.
Observation bdfc6c6f-d5ba-4b18-93c0-8dfbcddcee92 · outbound
Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation Visual Instruction Tuning
Reference 43
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.
Observation 1590031a-698e-41ca-b72f-fa229f64fbbc · outbound
Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation Improved Baselines with Visual Instruction Tuning
Reference 44
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.
Observation 10ab099c-43fb-47a7-a078-5903e288deae · outbound
Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation ConvBench: A Multi-Turn Conversation Evaluation Benchmark with Hierarchical Ablation Capability for Large Vision-Language Models
Reference 45
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.
Observation 8abb241e-01d6-4491-9e08-383ddf8654f1 · outbound
Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Sep- aration
Reference 46
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.
Observation 015e1808-5f00-4085-98c3-22a9a3013810 · outbound
Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation Stepping Stones: A Progressive Training Strategy for Audio- Visual Semantic Segmentation
Reference 47
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.
Observation 9a25fee9-c7ce-46fd-a42f-0e562430d94a · outbound
Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation Generation and Comprehension of Unambiguous Object Descriptions
Reference 48
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.
Observation 0501c317-ebcf-452a-b993-8c1f8f8b4d2c · outbound
Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation V-Net: Fully Convolutional Neural Networks for V olumetric Medical Image Segmentation
Reference 49
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.
Observation 6cbd765e-9f01-4245-a1ce-0c1c298c72f3 · outbound
Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation https://platform.openai.com/docs/ guides/text-to-speech, 2023
Reference 50
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.
Observation 82d8109d-93ff-4236-b5d7-e40bc2dcf588 · outbound
Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation https://openai.com/index/hello- gpt-4o, 2024
Reference 51
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.
Observation 6a185d90-b484-4179-baa4-a6d681f6e7b2 · outbound
Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation Wnet: Audio-Guided Video Object Segmentation via Wavelet-Based Cross-Modal Denoising Networks
Reference 52
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.
Observation 1b467605-e0aa-40c9-bc9c-023ef0f3f312 · outbound
Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation DetGPT: Detect What You Need via Reasoning
Reference 53
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.
Observation cbcbf9cf-d2f6-449e-bbdc-68cfc1239e0c · outbound
Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation Robust Speech Recognition via Large-Scale Weak Supervision
Reference 54
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.
Observation c563c37b-4b53-45a7-be18-589aece25f6f · outbound
Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation PACO: Parts and Attributes of Common Objects
Reference 55
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.
Observation 6e4bfd0c-8c92-4dff-ba5d-033188d7a457 · outbound
Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation SAM 2: Segment Anything in Images and Videos
Reference 56
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 00c96345-f537-42d2-996d-8d48ef230711 · outbound
Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation URVOS: Unified Referring Video Object Segmentation Network with a Large-Scale Benchmark
Reference 57
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.
Observation ec9d5370-ca5d-47a2-a75d-17e77bc45517 · outbound
Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation video-SALMONN: Speech-Enhanced Audio-Visual Large Language Models
Reference 58
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.
Observation 43f66742-91dd-46ec-8af0-56562b948142 · outbound
Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation Auto- ACD: A Large-scale Dataset for Audio-Language Represen- tation Learning
Reference 59
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.
Observation e9f020c3-53c3-4b7e-9352-6abb95a70ee2 · outbound
Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation Unveiling and Mitigating Bias in Audio Visual Segmentation
Reference 60
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.
Observation 10441679-27b3-40d4-ae73-4bb067d5a7d8 · outbound
Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation SALMONN: Towards Generic Hearing Abilities for Large Language Models
Reference 61
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.
Observation d62a2be0-8151-4f94-8b91-b354b07c882c · outbound
Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation Audio-Visual Event Localization in Unconstrained Videos
Reference 62
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.
Observation 2d7d6602-7a14-4756-bee0-279c1d915fb5 · outbound
Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution
Reference 63
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 9dc3b0b3-a9e6-4331-bf5a-a7eaa1d6b5cb · outbound
Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation Audio-Visual Grounding Referring Ex- pression for Robotic Manipulation
Reference 64
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.
Observation 244a95f7-f82a-40e5-9e11-73152644fc18 · outbound
Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation Prompting Segmentation with Sound Is Generalizable Audio-Visual Source Localizer
Reference 66
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.
Observation 977b99c5-f402-4b6c-a997-dce4e653e001 · outbound
Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation Can Textual Semantics Mitigate Sounding Object Segmentation Preference? In Eur
Reference 67
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.
Observation 631e99e6-604d-4d89-ad36-31efa91f39f7 · outbound
Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation Ref-A VS: Refer and Segment Objects in Audio-Visual Scenes
Reference 68
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.
Observation 04473527-a83e-40a6-811e-0b61852742e8 · outbound
Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation Language as Queries for Referring Video Object Segmentation
Reference 69
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.
Observation 777ad773-26d4-453f-8f81-38b7847d8705 · outbound
Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation VISA: Reasoning Video Object Segmentation via Large Language Models
Reference 70
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.
Observation 8116845e-6924-4180-b5be-c901cef114e4 · outbound
Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation Referred by Multi-Modality: A Unified Temporal Transformer for Video Object Segmentation
Reference 71
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.
Observation 46080188-6cf1-486a-8db9-15479764098e · outbound
Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation A VQA: A Dataset for Audio-Visual Question Answering on Videos
Reference 72
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.
Observation d1978e52-dd29-4c52-b280-80f4a309769b · outbound
Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation LA VT: Language-Aware Vision Transformer for Referring Image Segmentation
Reference 73
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.
Observation 95031c31-a3e3-417d-93f3-0937d2a67d77 · outbound
Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation Isda: Position-aware instance segmentation with deformable attention
Reference 74
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.
Observation 585b8fae-a251-4094-b1d6-05e743ac25d6 · outbound
Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation CTVIS: Consistent Training for Online Video Instance Segmentation
Reference 75
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.
Observation 4478e543-28aa-49f9-8f7f-66ef2796a7c2 · outbound
Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation MMT-Bench: A Comprehensive Multimodal Benchmark for Evaluating Large Vision-Language Models Towards Multitask AGI
Reference 76
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.
Observation 4abbf53c-1812-4652-8e2e-20332cfcfee0 · outbound
Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation MOVE: Motion-guided few-shot video object segmentation
Reference 77
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.
Observation e239833f-6bb0-4853-bbd8-114595adcdeb · outbound
Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation Modeling Context in Referring Expressions
Reference 78
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.
Observation 3f0d94cf-bbe8-4685-8d81-ca5875f7e677 · outbound
Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation MOTR: End-to-End Multiple-Object Tracking with Transformer
Reference 79
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.
Observation ae1f22c0-d178-4c3b-ad7c-2f9fcd04f24e · outbound
Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding
Reference 80
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.
Observation 60db074e-da48-4dee-ac7e-11891f91c7ef · outbound
Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation LLaMA-Adapter: Efficient Fine-tuning of Large Language Models with Zero- initialized Attention
Reference 81
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.
Observation a24455e6-9922-4a95-9d94-7a0c5ac81fa1 · outbound
Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation GPT4RoI: Instruction Tuning Large Language Model on Region-of-Interest
Reference 82
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 3dd6e515-9ec8-43cd-987f-fa1c1d08a13f · outbound
Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation DVIS: Decoupled Video Instance Segmentation Framework
Reference 83
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.
Observation f35ef5b4-7b2b-4406-9312-0d74b021a834 · outbound
Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation ViLLa: Video Reasoning Segmentation with Large Language Model
Reference 84
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 77a47579-e561-4dec-99a8-67aeadf588f5 · outbound
Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation Scene Parsing through ADE20K Dataset
Reference 85
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.
Observation b4440455-5ce6-4e3d-bcb1-fdbf7fc961df · outbound
Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation Audio-Visual Segmentation
Reference 86
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.
Observation 68aa03c1-fccc-480d-9709-0703fb587fc1 · outbound
Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation Tracking with Human-Intent Reasoning
Reference 87
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.
Observation f4afe86d-fbd3-4785-a992-0802dc92b695 · inbound
LMMs Meet Object-Centric Vision: Understanding, Segmentation, Editing and Generation Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation
Reference 210
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.