Pith. sign in

Paper Citation Record · LEDGER

Revisiting Audio-Visual Segmentation with Vision-Centric Transformer

As of 9 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 0 inbound Pith citation observations for arXiv:2506.23623.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2506.23623 v1

Coverage vector

measured 44 of 44 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-06T21:41:36.060867Z

measured 44 of 44 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-09T06:31:02.800959+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

44 of 44 outbound references displayed

  • verified exact0
  • verified fuzzy36
  • unresolved8
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation aa8f3d36-a08a-421c-8fdf-47fd3b0c4810 · outbound

This paper cites YouTube-8M: A Large-Scale Video Classification Benchmark.

Revisiting Audio-Visual Segmentation with Vision-Centric Transformer YouTube-8M: A Large-Scale Video Classification Benchmark

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-06T21:41:31.482657Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T21:41:31.482657Z digest=sha256:d9dd5f30e6b4304c5887aecc1f3a5ce4a0ff0d38f54850af5398c0b7d35ce90f

Observation 23cd1ae3-f838-4f6e-bfd7-6a2f85723205 · outbound

This paper cites Look, listen and learn.

Revisiting Audio-Visual Segmentation with Vision-Centric Transformer Look, listen and learn

Reference 2

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:41:42.024585Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-06T21:41:31.586701Z digest=sha256:59a267629db6d384090372246e70c33e2f5959c1c2f2c33bfcfbc93e85625fb5

Observation b1e50aeb-48e1-43bd-bf45-e4008fa20df0 · outbound

This paper cites Objects that sound.

Revisiting Audio-Visual Segmentation with Vision-Centric Transformer Objects that sound

Reference 3

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:41:41.837097Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-06T21:41:31.716244Z digest=sha256:eb4a075fc1d1979551c22da1e46e0a8f1801b11bf848ef752aab7d6c8670207b

Observation 09f6cf4b-f046-4e8f-82c2-bc55882d4daa · outbound

This paper cites End-to- end object detection with transformers.

Revisiting Audio-Visual Segmentation with Vision-Centric Transformer End-to- end object detection with transformers

Reference 4

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:41:41.586720Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-06T21:41:31.826333Z digest=sha256:f7a9be6cf940e6745abe3bdca0e2a9657991d17ed114c0ab6d1cc09939ace5d1

Observation e5201e53-e6e6-48ff-ad7b-cea907d754ce · outbound

This paper cites Unraveling in- stance associations: A closer look for audio-visual segmen- tation.

Revisiting Audio-Visual Segmentation with Vision-Centric Transformer Unraveling in- stance associations: A closer look for audio-visual segmen- tation

Reference 5

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:41:41.337696Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-06T21:41:31.913803Z digest=sha256:f43dbaed0968b40692b995995514c8857125ac9f801d3faf6300298c1d59033e

Observation dc189158-aeb2-4d76-a8cc-187179750181 · outbound

This paper cites Cpm: Class-conditional prompting ma- chine for audio-visual segmentation.

Revisiting Audio-Visual Segmentation with Vision-Centric Transformer Cpm: Class-conditional prompting ma- chine for audio-visual segmentation

Reference 6

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:41:41.167594Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-06T21:41:32.030508Z digest=sha256:a6cbd9c6f27fcfd9bec0b8efad34ff87df279d01f2a2066b969bbee3f0a9e741

Observation efcd098a-21a3-40c1-975d-f9d168260952 · outbound

This paper cites Masked-attention mask transformer for universal image segmentation.

Revisiting Audio-Visual Segmentation with Vision-Centric Transformer Masked-attention mask transformer for universal image segmentation

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-06T21:41:32.108899Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T21:41:32.108899Z digest=sha256:6cc95056688b7bd73da69ee09c4fa54fc74adfafcd644b5f18d80c1d73de57f5

Observation 29abd25d-36ff-4733-a9bb-ffe5ea9ffba4 · outbound

This paper cites Imagenet: A large-scale hierarchical image database.

Revisiting Audio-Visual Segmentation with Vision-Centric Transformer Imagenet: A large-scale hierarchical image database

Reference 8

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:41:41.074072Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-06T21:41:32.261318Z digest=sha256:8a2dc2aa9cf30aa79910d753ccb19181c19b9f4498831b31a4fd1f07411d85e2

Observation 7b0c203d-9e91-49f0-b601-91f4e7141e6a · outbound

This paper cites Avsegformer: Audio-visual segmentation with trans- former.

Revisiting Audio-Visual Segmentation with Vision-Centric Transformer Avsegformer: Audio-visual segmentation with trans- former

Reference 9

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:41:40.912430Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-06T21:41:32.343379Z digest=sha256:8fe8cfc23aebcb819fa06e1f3fd3c0bdea5869a6b114f81d9dcd6afbabfe4c22

Observation e420913e-a1d9-40cc-af95-7490e3fdee29 · outbound

This paper cites Improving audio-visual segmentation with bidirectional generation.

Revisiting Audio-Visual Segmentation with Vision-Centric Transformer Improving audio-visual segmentation with bidirectional generation

Reference 10

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:41:40.748513Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-06T21:41:32.443820Z digest=sha256:82a4c16b5f5d80c96d34cc2b91beb04a9f4d8222687d81ef6e907fc4219c8449

Observation 7361d6a7-0cd5-4279-9834-3c7393f42224 · outbound

This paper cites Deep residual learning for image recognition.

Revisiting Audio-Visual Segmentation with Vision-Centric Transformer Deep residual learning for image recognition

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-06T21:41:32.506980Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T21:41:32.506980Z digest=sha256:a9ae168439c29621a4218a340246ee1afd874c18d2c69305d97f93b18b9661ec

Observation ac069957-c7ae-472b-89a3-ad52f747f997 · outbound

This paper cites Cnn ar- chitectures for large-scale audio classification.

Revisiting Audio-Visual Segmentation with Vision-Centric Transformer Cnn ar- chitectures for large-scale audio classification

Reference 12

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:41:40.594891Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-06T21:41:32.603576Z digest=sha256:775722894378c734279c4e98bbacd44db531c2e19b4e502c0cbaf0267504fed6

Observation 8c3f7eca-2434-46e9-aab8-232ffd9aca7b · outbound

This paper cites Discriminative sounding objects localization via self-supervised audiovisual match- ing.

Revisiting Audio-Visual Segmentation with Vision-Centric Transformer Discriminative sounding objects localization via self-supervised audiovisual match- ing

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:41:40.463805Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-06T21:41:32.718372Z digest=sha256:4cd5e4947ad6df2bac921972a89e6e7e334a92bcd9bc4f86877f15e5aa08f5b0

Observation c82fe159-1178-473d-aedb-5bb85bc7d67f · outbound

This paper cites Mix and local- ize: Localizing sound sources in mixtures.

Revisiting Audio-Visual Segmentation with Vision-Centric Transformer Mix and local- ize: Localizing sound sources in mixtures

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:41:40.333852Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-06T21:41:32.869256Z digest=sha256:3891246ed6af51486ad62d0b1754adc587a57b9876973c7fc810262016b999e9

Observation 40b57b97-ca7c-4cee-a191-ed46c83c5091 · outbound

This paper cites Discovering sound- ing objects by audio queries for audio visual segmentation.

Revisiting Audio-Visual Segmentation with Vision-Centric Transformer Discovering sound- ing objects by audio queries for audio visual segmentation

Reference 15

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:41:40.186153Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-06T21:41:32.959886Z digest=sha256:107dc393bd5429126a3d5a20e2a1a698e834e864089fefda4f2482d2f505fd91

Observation d25fb5fe-93bb-4656-9b93-1d1cff10c754 · outbound

This paper cites Unleashing the temporal-spatial reasoning capacity of gpt for training-free audio and language referenced video object segmentation.

Revisiting Audio-Visual Segmentation with Vision-Centric Transformer Unleashing the temporal-spatial reasoning capacity of gpt for training-free audio and language referenced video object segmentation

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:41:40.040705Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-06T21:41:33.072492Z digest=sha256:20abe6abcdf3621792059b62520d94fcdc754a15acb3a8062d04c085538dfe79

Observation ee624052-5cc3-4b98-9a52-18deccb58ea6 · outbound

This paper cites Categorical Reparameterization with Gumbel-Softmax.

Revisiting Audio-Visual Segmentation with Vision-Centric Transformer Categorical Reparameterization with Gumbel-Softmax

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-06T21:41:33.179277Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T21:41:33.179277Z digest=sha256:b3442f50f73d7b61a523635f217c3552d7a54934d3794a12f294d9edef7d0868

Observation 41ad0a72-2ffe-45a9-aa0f-8e4e1e4ddf6f · outbound

This paper cites Learning to visually localize sound sources from mixtures without prior source knowledge.

Revisiting Audio-Visual Segmentation with Vision-Centric Transformer Learning to visually localize sound sources from mixtures without prior source knowledge

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:41:39.885616Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-06T21:41:33.309142Z digest=sha256:b577eb02baa6cf89aa9e162ea6a0003bd6a86dc3fa9c34ba475edc8b4d14f34f

Observation e0850671-1124-4d09-9b43-ad461b3e9f85 · outbound

This paper cites Segment and recognize anything at any granularity.

Revisiting Audio-Visual Segmentation with Vision-Centric Transformer Segment and recognize anything at any granularity

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:41:39.711224Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-06T21:41:33.391819Z digest=sha256:547398e4d59ef6d52e6366593cfb7eddb46e9361b8b6c11d3e694b271fa274a7

Observation 557eaabc-3bc0-4ac5-b9b6-64bc4c705ff8 · outbound

This paper cites Selm: Selective mechanism based audio-visual segmentation.

Revisiting Audio-Visual Segmentation with Vision-Centric Transformer Selm: Selective mechanism based audio-visual segmentation

Reference 20

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:41:39.412029Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-06T21:41:33.454380Z digest=sha256:3ff7330d3641e5c1ce7efcbccec93fefd2be151c72a2496f81d8689e8ab25b1c

Observation 594137aa-e7b9-45a3-b15e-c931e8c2cb97 · outbound

This paper cites Catr: Combinatorial-dependence audio-queried transformer for audio-visual video segmentation.

Revisiting Audio-Visual Segmentation with Vision-Centric Transformer Catr: Combinatorial-dependence audio-queried transformer for audio-visual video segmentation

Reference 21

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:41:39.107211Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-06T21:41:33.511966Z digest=sha256:47802c92b47bd8d730118a62c1708e0f00327c48af64c0d19cc351a453f7bca6

Observation bc2fa17b-80a6-4743-8d1d-ba532f346af0 · outbound

This paper cites Qdformer: Towards robust audiovisual segmentation in complex environments with quantization-based semantic decomposition.

Revisiting Audio-Visual Segmentation with Vision-Centric Transformer Qdformer: Towards robust audiovisual segmentation in complex environments with quantization-based semantic decomposition

Reference 22

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:41:38.879380Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-06T21:41:33.616815Z digest=sha256:0c70fa9942008caf8bfebd649733590225acca9107f9afb51d6cc028b3ff436c

Observation 99edfce9-9f0a-4e00-8f3a-90cd10fa66f3 · outbound

This paper cites Audio-visual seg- mentation by exploring cross-modal mutual semantics.

Revisiting Audio-Visual Segmentation with Vision-Centric Transformer Audio-visual seg- mentation by exploring cross-modal mutual semantics

Reference 23

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:41:38.688281Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-06T21:41:33.689305Z digest=sha256:2426919be6179c531d7a970ab709de4336b24f5aed507a1446ff411f0784d6fd

Observation 5fd01971-599b-4e35-8b0d-6118fd06e6f5 · outbound

This paper cites Bavs: bootstrapping audio- visual segmentation by integrating foundation knowledge.

Revisiting Audio-Visual Segmentation with Vision-Centric Transformer Bavs: bootstrapping audio- visual segmentation by integrating foundation knowledge

Reference 24

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:41:38.542899Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-06T21:41:33.782512Z digest=sha256:8bf55f26a2ec3f83da876cb6ee760b599c0fe5b8b9865aba32a4ee4edde2ae21

Observation 5594549c-6997-45d0-be52-b6ec97324966 · outbound

This paper cites Audio-visual segmentation via unlabeled frame exploitation.

Revisiting Audio-Visual Segmentation with Vision-Centric Transformer Audio-visual segmentation via unlabeled frame exploitation

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:41:38.423120Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-06T21:41:33.936683Z digest=sha256:72e2d56372832970978ac239bfcde3da8dfd7b47ff2c527540cb469114c15721

Observation 64d8d45c-f16c-46e5-adc9-45f0bd51b49b · outbound

This paper cites Swin transformer: Hierarchical vision transformer using shifted windows.

Revisiting Audio-Visual Segmentation with Vision-Centric Transformer Swin transformer: Hierarchical vision transformer using shifted windows

Reference 26

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:41:38.281255Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-06T21:41:34.086780Z digest=sha256:0d1caf09d4bc086da6698114626a6df4ae907ea57e20f69e2eef0f8b90391abd

Observation f4a473fa-928b-4c7b-9581-f898b61efaf2 · outbound

This paper cites Step- ping stones: A progressive training strategy for audio-visual semantic segmentation.

Revisiting Audio-Visual Segmentation with Vision-Centric Transformer Step- ping stones: A progressive training strategy for audio-visual semantic segmentation

Reference 27

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:41:38.056471Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-06T21:41:34.199767Z digest=sha256:cff9221cedfb6943fd061c16d7a3513139600784fd7e1c90465e7e0360e6a00c

Observation 93a05f2a-da34-4a01-a35e-c31f1cd5d779 · outbound

This paper cites The Concrete Distribution: A Continuous Relaxation of Discrete Random Variables.

Revisiting Audio-Visual Segmentation with Vision-Centric Transformer The Concrete Distribution: A Continuous Relaxation of Discrete Random Variables

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-06T21:41:34.318918Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T21:41:34.318918Z digest=sha256:02a4ace52f439a34623daff9896362401701ae1872afb0a131f309c14ed0b8d1

Observation 4a683ffc-aa9d-49a0-b4b7-9f8a1414b584 · outbound

This paper cites Multimodal variational auto-encoder based audio-visual segmentation.

Revisiting Audio-Visual Segmentation with Vision-Centric Transformer Multimodal variational auto-encoder based audio-visual segmentation

Reference 29

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:41:37.924346Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-06T21:41:34.439115Z digest=sha256:0cd37cb4454547df18d7918139676f3a366ff8fb071c0657eb79494df84a4a4a

Observation c896ac0a-91cd-4d05-8e86-02e4e2a07110 · outbound

This paper cites V-net: Fully convolutional neural networks for volumetric medical image segmentation.

Revisiting Audio-Visual Segmentation with Vision-Centric Transformer V-net: Fully convolutional neural networks for volumetric medical image segmentation

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-06T21:41:34.565020Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T21:41:34.565020Z digest=sha256:70f5e26a504e2763d2fad89af1413adf31d2db63573efa264512fbc5dcd3d9e0

Observation 12acaf33-1cc4-4f26-bc45-2b3916bb233d · outbound

This paper cites Localizing visual sounds the easy way.

Revisiting Audio-Visual Segmentation with Vision-Centric Transformer Localizing visual sounds the easy way

Reference 31

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:41:37.770885Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-06T21:41:34.644918Z digest=sha256:990120a16c63a384031f707f17a93c04ed8fbeef2b863e80dd1fa8fb4814a25f

Observation 61e08455-777a-485e-922f-b50865cd6976 · outbound

This paper cites ImageNet-21K Pretraining for the Masses.

Revisiting Audio-Visual Segmentation with Vision-Centric Transformer ImageNet-21K Pretraining for the Masses

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-06T21:41:34.691781Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T21:41:34.691781Z digest=sha256:97a6867c6e2f5cb67af0bac67ab69b2b6679a5c8505eedbf7da5d6aa36a44b4a

Observation 6e212d0b-4b98-4770-9859-b7f7d524c2a8 · outbound

This paper cites Learning to localize sound source in visual scenes.

Revisiting Audio-Visual Segmentation with Vision-Centric Transformer Learning to localize sound source in visual scenes

Reference 33

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:41:37.584961Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-06T21:41:34.805399Z digest=sha256:5d2ee25b652dca88c2635b897d4f2a07e7ae96c2d6a56a8618a7f966f5160702

Observation 8558b1c3-c7cd-4b42-a45b-986f175d4a75 · outbound

This paper cites Unveiling and mitigating bias in audio visual segmentation.

Revisiting Audio-Visual Segmentation with Vision-Centric Transformer Unveiling and mitigating bias in audio visual segmentation

Reference 34

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:41:37.449932Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-06T21:41:34.928705Z digest=sha256:718144e139aea26abfcef92be863627260f7930e05eb9fab005f682cd9ff04b3

Observation 4b9407e4-f987-47c8-bfa1-3e9993290f55 · outbound

This paper cites Attention is all you need.

Revisiting Audio-Visual Segmentation with Vision-Centric Transformer Attention is all you need

Reference 35

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:41:37.325303Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-06T21:41:35.049495Z digest=sha256:d71ba42651c33112ea97ce802e114cbee4993f9759f0b64cca19c3b1ce667bfb

Observation 4e5570ef-adf9-4359-b489-04f566873b41 · outbound

This paper cites Pvt v2: Improved baselines with pyramid vision transformer.

Revisiting Audio-Visual Segmentation with Vision-Centric Transformer Pvt v2: Improved baselines with pyramid vision transformer

Reference 36

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:41:37.140744Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-06T21:41:35.197478Z digest=sha256:b12c975af5a0d181e1aeac94f6d47ec821cf76486467d46653e1a0f2a2aa48bb

Observation 68b63946-3b18-4703-a312-e51b8b6b3182 · outbound

This paper cites Prompting segmentation with sound is gen- eralizable audio-visual source localizer.

Revisiting Audio-Visual Segmentation with Vision-Centric Transformer Prompting segmentation with sound is gen- eralizable audio-visual source localizer

Reference 37

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:41:37.040398Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-06T21:41:35.345607Z digest=sha256:ab3d3d86bbd742676b7d94493f43d9b548262a4138e24eab3983ddda289ccb04

Observation 654e324a-4466-4d0d-ba48-662b261e815e · outbound

This paper cites Can textual semantics mitigate sounding object segmentation preference? In ECCV, 2024.

Revisiting Audio-Visual Segmentation with Vision-Centric Transformer Can textual semantics mitigate sounding object segmentation preference? In ECCV, 2024

Reference 38

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:41:36.949566Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-06T21:41:35.461145Z digest=sha256:ce2d35542cadecebf9bb74b811eeb725c2de1154d642e76a3a3024b94050622f

Observation 1a3152aa-e2d3-4363-a01a-37eeae646bef · outbound

This paper cites Language as queries for referring video object segmen- tation.

Revisiting Audio-Visual Segmentation with Vision-Centric Transformer Language as queries for referring video object segmen- tation

Reference 39

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:41:36.839445Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-06T21:41:35.561559Z digest=sha256:7703b2e07a9942c5f83afe20d5a280666eea4017f16223619ba93b1a5939aa42

Observation 694d6013-9516-4e6b-aefd-7e19eb6e14d7 · outbound

This paper cites Groupvit: Semantic segmentation emerges from text supervision.

Revisiting Audio-Visual Segmentation with Vision-Centric Transformer Groupvit: Semantic segmentation emerges from text supervision

Reference 40

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:41:36.722606Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-06T21:41:35.688895Z digest=sha256:509bdb2206b2c634b716a870c2e1db3677d0769813c7a0423f351829b1637d03

Observation 7b97016a-c9d5-4421-b092-c2d49bdb3fca · outbound

This paper cites Cooperation does matter: Exploring multi-order bilateral relations for audio- visual segmentation.

Revisiting Audio-Visual Segmentation with Vision-Centric Transformer Cooperation does matter: Exploring multi-order bilateral relations for audio- visual segmentation

Reference 41

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:41:36.625618Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-06T21:41:35.826823Z digest=sha256:33b56aeef11e9f9662e1a7c6803f79e92b490aad3735eb2cc665030ba43a4461

Observation 8f542558-3947-4313-aae6-06267c83d111 · outbound

This paper cites DINO: DETR with Improved DeNoising Anchor Boxes for End-to-End Object Detection.

Revisiting Audio-Visual Segmentation with Vision-Centric Transformer DINO: DETR with Improved DeNoising Anchor Boxes for End-to-End Object Detection

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-06T21:41:35.888288Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T21:41:35.888288Z digest=sha256:f9643f67e72c766a557b928279a96f7cbc317689bed3934be9e1a6a21d5019d3

Observation ae275b49-d7fd-433b-bef5-0c9faecb429b · outbound

This paper cites Audio–visual segmentation.

Revisiting Audio-Visual Segmentation with Vision-Centric Transformer Audio–visual segmentation

Reference 43

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:41:36.468244Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-06T21:41:35.944156Z digest=sha256:ac41b270caf07990663714bdcbffa48b39624e8f9e17ba1957886d878adfea27

Observation 0970f7ae-fe0a-4f3b-9879-55ca2b4724c6 · outbound

This paper cites Audio-visual segmentation with semantics.

Revisiting Audio-Visual Segmentation with Vision-Centric Transformer Audio-visual segmentation with semantics

Reference 44

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:41:36.314198Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-06T21:41:36.060867Z digest=sha256:9971a89b6cafaf6515f83b79fba7eb6ac731d78bcb8f1b8d5b2fcf79aaa96d5b

Pith citing papers

No inbound Pith citation observations are available.