Typed states for the displayed outbound observations.
Source: paper_references, paper_reference_links, observed 2026-08-02T19:39:52.897328Z
Paper Citation Record · LEDGER
As of 7 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 0 inbound Pith citation observations for arXiv:2603.01530.
A citation records a reference. It does not transfer a finding from one paper to another.
Typed states for the displayed outbound observations.
Source: paper_references, paper_reference_links, observed 2026-08-02T19:39:52.897328Z
One-hop event checks from named stored sources.
Source: scholarly_work_events, retraction_status_cache, observed 2026-08-07T06:34:17.273281+00:00
Pith citing papers itemized under the disclosed page cap.
Source: paper_references, paper_reference_links
A source-named dated measurement, never combined with another source.
Source: cited_works
57 of 57 outbound references displayed
External citation measurements
No source-named external measurement is stored.
Observation 7e745d9b-7458-4b8b-bbe7-c2f906a187bf · outbound
CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction Late audio-visual fusion for in-the-wild speaker diarization,
Reference 1
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 63a9d8fc-3871-4b88-9369-966523c65264 · outbound
CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction Predict-and-update network: Audio-visual speech recognition inspired by human speech perception,
Reference 2
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation cf4cf079-4ba3-4aa5-88d6-1ce30a822961 · outbound
CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction Audio-visual cross- attention network for robotic speaker tracking,
Reference 3
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 53e1d0f9-1ca6-4203-9034-30adf9fb679f · outbound
CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction My lips are concealed: Audio-visual speech enhancement through obstructions,
Reference 4
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 987c4fe5-f154-4815-bf84-06d766542a17 · outbound
CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction Multimodal attention fusion for target speaker extraction,
Reference 5
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation bad0a1cd-ae40-4ee0-b7c3-8891513ad009 · outbound
CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction Time-domain audio-visual speech separation on low quality videos,
Reference 6
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 1bc86261-7476-4377-9659-3a978ba39533 · outbound
CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction A two-stage audio-visual speech separation method without visual signals for testing and tuples loss with dynamic margin,
Reference 7
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation d505beb3-6b6d-4c24-a05d-f3c6fb0c9083 · outbound
CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction Ravss: Robust audio- visual speech separation in multi-speaker scenarios with missing visual cues,
Reference 8
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 9fdabcf9-e31b-4906-97fe-bfc6b61e1ab9 · outbound
CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction Multi-modal multi-correlation learning for audio-visual speech separation,
Reference 9
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 8568c310-aa1a-4828-827b-73181b449ef7 · outbound
CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction Visualvoice: Audio-visual speech separa- tion with cross-modal consistency,
Reference 10
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation d5ce327e-36a9-4e13-bac5-9532e4eee839 · outbound
CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction Explaining face-voice matching decisions: The contribution of mouth movements, stimulus effects and response biases,
Reference 11
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 9bc51f8a-9fb8-49dd-b95a-b842d2d15a59 · outbound
CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction Rethinking the visual cues in audio-visual speaker extraction,
Reference 12
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation f1cd3764-6ff2-4e55-bd54-65183bec8189 · outbound
CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction Muse: Multi-modal target speaker extraction with visual cues,
Reference 13
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation e85590b2-679c-4c45-849d-ca11468bc116 · outbound
CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction Hearing lips and seeing voices,
Reference 14
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 82f601e2-676a-44f0-a97b-9ed29faa003a · outbound
CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction The effect of speechreading on masked detection thresh- olds for filtered speech,
Reference 15
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 85a12557-dfd5-4976-a272-f45ea94cdfbd · outbound
CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction Neural target speech extraction: An overview,
Reference 16
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation a04400b8-a94e-4b62-9326-6d13188619c0 · outbound
CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction Multi-cue guided semi-supervised learning toward target speaker separation in real environments,
Reference 17
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 0e4e957a-21e2-49a6-b2d8-f4e8c1e28713 · outbound
CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction Multi- level speaker representation for target speaker extraction,
Reference 18
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 88058dec-30e4-45d3-add3-c9134998d60e · outbound
CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction Usef-tse: Universal speaker embedding free target speaker extraction,
Reference 19
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 4f2b76a7-4c7e-4336-bb74-c2254bf92e91 · outbound
CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction Contextual speech extraction: Leveraging textual history as an implicit cue for target speech extraction,
Reference 20
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 380459a4-3d15-4e84-88b7-4e652e6ac1cf · outbound
CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction Conceptbeam: Concept driven target speech extraction,
Reference 21
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 09c71ba3-7a9c-46af-b636-f08cbbeefda8 · outbound
CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction SenSE: Semantic-Aware High-Fidelity Universal Speech Enhancement
Reference 22
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 1943fd70-11df-4ce3-82f5-4ec69984d198 · outbound
CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction Av-crossnet: An audiovisual complex spectral mapping network for speech separation by leveraging narrow-and cross-band modeling,
Reference 23
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 0e469bc5-a982-4c66-8de4-f280c8144b95 · outbound
CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction Audio-visual speech separation and dereverberation with a two-stage multimodal network,
Reference 24
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation cfef3ce0-3b85-4080-be40-26b12408f5de · outbound
CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction Spatialnet: Extensively learning spatial information for multichannel joint speech separation, denoising and dereverberation,
Reference 25
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 04a2a2f6-a6b0-4183-8185-b3d3a328c608 · outbound
CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction Fasnet: Low- latency adaptive beamforming for multi-microphone audio processing,
Reference 26
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 660cbdaa-f9f3-47ac-99ba-357a0294e03c · outbound
CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction Multi-modal multi-channel target speech separation,
Reference 27
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 0e4f0049-db7f-4fe2-b9c2-759f3fc98d65 · outbound
CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction An overview of deep-learning-based audio-visual speech en- hancement and separation,
Reference 28
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 6ac8057b-44e4-40b1-a379-571d7678c9d6 · outbound
CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction Unified audio visual cues for target speaker extraction,
Reference 29
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 7e7e147e-96ba-4759-a544-6ae1f7d213e7 · outbound
CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction MoMuSE: Momentum Multi-modal Target Speaker Extraction for Real-time Scenarios with Impaired Visual Cues
Reference 30
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation a093622f-23ed-4eee-b9d4-df82da779cc2 · outbound
CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions
Reference 31
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 9236990d-7209-4cd7-bfe7-6c87dcfc5928 · outbound
CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction Tf-gridnet: Making time-frequency domain models great again for monaural speaker separation,
Reference 32
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 7691e0c9-511a-47ff-8a85-d36e2f90fdbc · outbound
CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction Separate in the Speech Chain: Cross-Modal Conditional Audio-Visual Target Speech Extraction
Reference 33
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 02546d07-92d4-4255-a078-45e13b8b6517 · outbound
CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction ClearerVoice-Studio: Bridging Advanced Speech Processing Research and Practical Deployment
Reference 34
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 6f81324b-2b19-405e-8ff6-4eefc7fed8ef · outbound
CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction Av-sepformer: Cross-attention sepformer for audio-visual target speaker extraction,
Reference 35
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 42cae12f-b223-4ce4-aed9-ad366c7f16b2 · outbound
CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction Deep residual learning for image recognition,
Reference 36
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 147f996f-0f6c-44d0-8946-9b8264e2aba8 · outbound
CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction Audio-visual target speaker extraction with selective auditory attention,
Reference 37
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 9e040b87-7754-4ebd-ab87-558186acd7c4 · outbound
CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction Pitch range variations improve cognitive processing of audio messages,
Reference 38
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 83d5ffcf-441a-4334-9951-63ea1fc05a65 · outbound
CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction Intonation and speaker identification,
Reference 39
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation a3c7590b-37bd-4fd8-b8f2-99b6028d3f0e · outbound
CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction Dual-path rnn: efficient long sequence modeling for time-domain single-channel speech separation,
Reference 40
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 3bde35da-e50b-4f1e-a4a4-b0cea45ceb1b · outbound
CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction Time domain audio visual speech separation,
Reference 41
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 861f072b-09f5-4af3-b854-a775d81c64cd · outbound
CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction Learning audio- visual speech representation by masked multimodal cluster prediction,
Reference 42
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 2ec3e718-24ea-4b47-a486-cf2ee07409a7 · outbound
CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction Rethinking the inception architecture for computer vision,
Reference 43
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 99af4452-84f4-4a29-8fc8-7208625e9b3d · outbound
CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction Sdr–half-baked or well done?
Reference 44
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 2e4cbf8c-bce6-4d7c-8181-af5e0fd61cd4 · outbound
CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction Audio-Visual Speech Separation in Noisy Environments with a Lightweight Iterative Model,
Reference 45
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 3c3d8a28-7000-4038-adf8-e588e3a7538f · outbound
CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction An audio-visual speech separation model inspired by cortico-thalamo-cortical circuits,
Reference 46
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 514335a0-d76a-4404-8576-ecdf84ed0ece · outbound
CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction Iianet: an intra-and inter-modality attention network for audio-visual speech separation,
Reference 47
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation b78ba67f-4f44-4135-abdf-d3d62d824dd6 · outbound
CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction Deep audio-visual speech recognition,
Reference 48
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation a667534c-8589-45d5-9bf7-6a3ec0025dae · outbound
CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction VoxCeleb2: Deep Speaker Recognition
Reference 49
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation de8584db-4a6a-46fa-ba23-6aa2417334f6 · outbound
CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction Looking into your speech: Learning cross-modal affinity for audio-visual speech separation,
Reference 50
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation a7256a29-e690-49c8-b956-a3dd7f0a2d5b · outbound
CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction Watch or listen: Robust audio- visual speech recognition with visual corruption modeling and reliability scoring,
Reference 51
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation b334d924-65e3-47f9-b207-5d84923d7c9f · outbound
CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction Restoring speaking lips from occlusion for audio-visual speech recognition,
Reference 52
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation dd4a8bae-a187-420a-a7a4-4568218dfee1 · outbound
CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction Delving into high-quality synthetic face occlusion segmentation datasets,
Reference 53
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation e34e8283-d8b2-4aab-9303-c6a80775876a · outbound
CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction Data2vec: A general framework for self-supervised learning in speech, vision and language,
Reference 54
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 82b83497-9b72-49fa-b5a1-0ebe40e3426a · outbound
CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction Adam: A Method for Stochastic Optimization
Reference 55
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation cd1737d7-935f-4925-954b-b90a960cda81 · outbound
CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction Long short-term memory,
Reference 56
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 0edb5e94-dfa7-49ff-8040-5d7d0f070bfc · outbound
CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction How many phonemes does the english language have,
Reference 57
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
No inbound Pith citation observations are available.