Pith. sign in

Paper Citation Record · LEDGER

MoMuSE: Momentum Multi-modal Target Speaker Extraction for Real-time Scenarios with Impaired Visual Cues

As of 17 August 2026, this Paper Citation Record lists 32 of 32 outbound references and 1 inbound Pith citation observation for arXiv:2412.08247.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2412.08247 v2

Coverage vector

measured 32 of 32 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-11T18:07:26.693764Z

measured 33 of 33 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-17T06:30:58.91139+00:00

measured 1 of 1 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-02T19:39:50.132135Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

32 of 32 outbound references displayed

  • verified exact0
  • verified fuzzy31
  • unresolved1
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation b60bfc47-188e-41e2-8494-d905c436ce73 · outbound

This paper cites Visualvoice: Audio-visual speech separation with cross-modal consistency,.

MoMuSE: Momentum Multi-modal Target Speaker Extraction for Real-time Scenarios with Impaired Visual Cues Visualvoice: Audio-visual speech separation with cross-modal consistency,

Reference 1

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T18:07:26.961544Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-11T18:07:26.606488Z digest=sha256:9dad5a2bd00ca130c36aef8e0939424b4927dedc9fac49fde366779e5fd84ef6

Observation 493573c8-9508-4054-8131-58dfa4ef8dbe · outbound

This paper cites Audio-visual active speaker extraction for sparsely overlapped multi- talker speech,.

MoMuSE: Momentum Multi-modal Target Speaker Extraction for Real-time Scenarios with Impaired Visual Cues Audio-visual active speaker extraction for sparsely overlapped multi- talker speech,

Reference 2

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T18:07:26.954218Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-11T18:07:26.610084Z digest=sha256:12c3e30df2645a49d28b0e7a6d3e18c6311131503186dff789a46ec4557539d7

Observation 8fab99be-6f86-4073-bdfe-d8918a0ed70e · outbound

This paper cites Audio-visual target speaker extraction with selective auditory attention,.

MoMuSE: Momentum Multi-modal Target Speaker Extraction for Real-time Scenarios with Impaired Visual Cues Audio-visual target speaker extraction with selective auditory attention,

Reference 3

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T18:07:26.947012Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-11T18:07:26.613046Z digest=sha256:936ff13f0c4bb8835272de81f8fc5b646156d0efe6a3a523e8ac5cebc3372b6b

Observation 98d403b8-9a39-47f5-a643-c6e87d83afcf · outbound

This paper cites A robust audio-visual speech enhancement model,.

MoMuSE: Momentum Multi-modal Target Speaker Extraction for Real-time Scenarios with Impaired Visual Cues A robust audio-visual speech enhancement model,

Reference 4

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T18:07:26.939497Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-11T18:07:26.616929Z digest=sha256:c813979dd56d0ac6d42a8dad87bf1ac18a3ba067a6c41d8132964eba07c3b3a2

Observation eceddd33-faaa-449e-9799-8664a5f13015 · outbound

This paper cites Audiovisual speaker separation with full- and sub-band modeling in the time-frequency domain,.

MoMuSE: Momentum Multi-modal Target Speaker Extraction for Real-time Scenarios with Impaired Visual Cues Audiovisual speaker separation with full- and sub-band modeling in the time-frequency domain,

Reference 5

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T18:07:26.931996Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-11T18:07:26.620194Z digest=sha256:38c8c3c1641646d4fb1a5d2a60a8aa37541e6ce7193ba8794f6f9e6ccd2fb8e9

Observation 681def39-4c94-4964-b58a-cb98c2752a09 · outbound

This paper cites My Lips Are Concealed: Audio-Visual Speech Enhancement Through Ob- structions,.

MoMuSE: Momentum Multi-modal Target Speaker Extraction for Real-time Scenarios with Impaired Visual Cues My Lips Are Concealed: Audio-Visual Speech Enhancement Through Ob- structions,

Reference 6

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T18:07:26.924396Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-11T18:07:26.623480Z digest=sha256:b912e30d8dcab2e7f43ee893b2c79dd6d1f55e5f8e7029f20cb7d77e1926fbcb

Observation 5fca883b-ea00-4f68-8d8b-29a062e35db9 · outbound

This paper cites Switching variational auto-encoders for noise-agnostic audio-visual speech enhancement,.

MoMuSE: Momentum Multi-modal Target Speaker Extraction for Real-time Scenarios with Impaired Visual Cues Switching variational auto-encoders for noise-agnostic audio-visual speech enhancement,

Reference 7

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T18:07:26.916992Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-11T18:07:26.627052Z digest=sha256:f513d2bd5ad7b1ba93efbe4936c10ffb2eda16acbff1b3ebc8a7d2e9b72d0762

Observation 28d5a172-97c6-4f7d-8108-ac760709df12 · outbound

This paper cites Robust unsupervised audio-visual speech enhancement using a mixture of variational au- toencoders,.

MoMuSE: Momentum Multi-modal Target Speaker Extraction for Real-time Scenarios with Impaired Visual Cues Robust unsupervised audio-visual speech enhancement using a mixture of variational au- toencoders,

Reference 8

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T18:07:26.909405Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-11T18:07:26.629884Z digest=sha256:7e69fb2b36aa3c63c8c66ae74904e7692168a27455a0e79c976fb52a552755d4

Observation 1a23a504-5856-4281-b145-0165c2030650 · outbound

This paper cites Time-domain audio-visual speech separation on low quality videos,.

MoMuSE: Momentum Multi-modal Target Speaker Extraction for Real-time Scenarios with Impaired Visual Cues Time-domain audio-visual speech separation on low quality videos,

Reference 9

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T18:07:26.901623Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-11T18:07:26.632529Z digest=sha256:a6f33975afa1aac171e7525559fa8cd7044d6b2d740c44a3f8d44585cdbc8af6

Observation 745e7521-9262-4e13-9e69-315ad84c62bf · outbound

This paper cites Imag- inenet: Target speaker extraction with intermittent visual cue through embedding inpainting,.

MoMuSE: Momentum Multi-modal Target Speaker Extraction for Real-time Scenarios with Impaired Visual Cues Imag- inenet: Target speaker extraction with intermittent visual cue through embedding inpainting,

Reference 10

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T18:07:26.894500Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-11T18:07:26.635379Z digest=sha256:a1b4242cb8e5adb23422bed3996a979f65b650ea45d36960e41b56c42b486f9f

Observation d46e866a-3d73-4726-9d37-a8e8cd34563a · outbound

This paper cites Multimodal attention fusion for target speaker extraction,.

MoMuSE: Momentum Multi-modal Target Speaker Extraction for Real-time Scenarios with Impaired Visual Cues Multimodal attention fusion for target speaker extraction,

Reference 11

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T18:07:26.887271Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-11T18:07:26.638254Z digest=sha256:e21533a9b05791884c47c8d79f91d29f721fee783f75ed47fa194cce0414fee0

Observation 8ab7c55d-3f6e-4602-a11a-6f43d5e24c07 · outbound

This paper cites Multimodal speakerbeam: Single channel target speech extraction with audio-visual speaker clues.,.

MoMuSE: Momentum Multi-modal Target Speaker Extraction for Real-time Scenarios with Impaired Visual Cues Multimodal speakerbeam: Single channel target speech extraction with audio-visual speaker clues.,

Reference 12

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T18:07:26.879926Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-11T18:07:26.640913Z digest=sha256:369025da2a9b49600d933456bbc867f8415ea9de61fabca347ed347f7ce3cc78

Observation bb45d666-1c42-4dcc-ab39-5f07327e5f39 · outbound

This paper cites A two-stage audio-visual speech separation method without visual signals for testing and tuples loss with dynamic margin,.

MoMuSE: Momentum Multi-modal Target Speaker Extraction for Real-time Scenarios with Impaired Visual Cues A two-stage audio-visual speech separation method without visual signals for testing and tuples loss with dynamic margin,

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T18:07:26.872741Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-11T18:07:26.643724Z digest=sha256:77c50df83a7232d9e19344022ee9f23bad4c8f350d1eeff236e4293c64547b3c

Observation 314dd23d-c148-4bbe-a1ee-0f31e42e6c0f · outbound

This paper cites Iterative autoregression: a novel trick to improve your low-latency speech enhancement model,.

MoMuSE: Momentum Multi-modal Target Speaker Extraction for Real-time Scenarios with Impaired Visual Cues Iterative autoregression: a novel trick to improve your low-latency speech enhancement model,

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T18:07:26.865163Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-11T18:07:26.646342Z digest=sha256:4ea13397108d33e599bf2a71b0e0f8b9343dd3a2892962e3c0ec2baf04074b3d

Observation 47145855-1901-4412-b07b-b3bfce7f5f03 · outbound

This paper cites An online speaker-aware speech separation approach based on time- domain representation,.

MoMuSE: Momentum Multi-modal Target Speaker Extraction for Real-time Scenarios with Impaired Visual Cues An online speaker-aware speech separation approach based on time- domain representation,

Reference 15

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T18:07:26.857751Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-11T18:07:26.649085Z digest=sha256:1bdd51a0e0f91309a495938553ae8312cde1383be9a6859ba715d74e9a646e25

Observation 0f2a94b7-8ea7-4b0f-b9d7-7af202be27ea · outbound

This paper cites Source- aware context network for single-channel multi-speaker speech separa- tion,.

MoMuSE: Momentum Multi-modal Target Speaker Extraction for Real-time Scenarios with Impaired Visual Cues Source- aware context network for single-channel multi-speaker speech separa- tion,

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T18:07:26.849937Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-11T18:07:26.651721Z digest=sha256:25455d70e277d04d398719f02dd05241493063da45fba61386d819d640d7b9d5

Observation ec5f85cf-e046-4f85-8ef8-66629bee6d61 · outbound

This paper cites Listening and grouping: an online autoregressive approach for monaural speech separation,.

MoMuSE: Momentum Multi-modal Target Speaker Extraction for Real-time Scenarios with Impaired Visual Cues Listening and grouping: an online autoregressive approach for monaural speech separation,

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T18:07:26.841560Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-11T18:07:26.654271Z digest=sha256:dc682f094b3d04a38b474f816dddd9d50f567a05ed3f387304b5da4379e434c7

Observation b1bccb2e-54ce-4264-9de5-74809139d0d7 · outbound

This paper cites Paris: Pseudo-autoregressive siamese training for online speech separation,.

MoMuSE: Momentum Multi-modal Target Speaker Extraction for Real-time Scenarios with Impaired Visual Cues Paris: Pseudo-autoregressive siamese training for online speech separation,

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T18:07:26.833390Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-11T18:07:26.656974Z digest=sha256:4a6e74f36896a84f59491af4a2f9b619a8f5ae19afcf388909f4641789b30a14

Observation d17dac2e-4a72-4569-b03e-cdeb744017df · outbound

This paper cites Robust Speaker Extraction Network Based on Iterative Refined Adaptation,.

MoMuSE: Momentum Multi-modal Target Speaker Extraction for Real-time Scenarios with Impaired Visual Cues Robust Speaker Extraction Network Based on Iterative Refined Adaptation,

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T18:07:26.824977Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-11T18:07:26.659592Z digest=sha256:7e50b260c20996dad480cdaaf4c2f4e0d92b54ce7feebada94d39d86d33cd7d0

Observation a95549d0-c92d-4918-bb80-334bfeaf513a · outbound

This paper cites Neuroheed: Neuro-steered speaker extraction using eeg signals,.

MoMuSE: Momentum Multi-modal Target Speaker Extraction for Real-time Scenarios with Impaired Visual Cues Neuroheed: Neuro-steered speaker extraction using eeg signals,

Reference 20

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T18:07:26.816571Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-11T18:07:26.662421Z digest=sha256:61fdacd346edfbf5d97d9b6ac5efc74865f5a3091d603d18151d0b75897ff8d3

Observation e4874120-3ef5-46d4-b66a-2159e8564f0b · outbound

This paper cites Attentive training: A new training framework for speech enhancement,.

MoMuSE: Momentum Multi-modal Target Speaker Extraction for Real-time Scenarios with Impaired Visual Cues Attentive training: A new training framework for speech enhancement,

Reference 21

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T18:07:26.808548Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-11T18:07:26.665206Z digest=sha256:df98ec81eeae7a9867325dddbf0cff88f3ca6dc29416e0ec2b1bf3244936bc7c

Observation cd17a2ad-6615-4985-9a61-2be2ec3dfdbf · outbound

This paper cites Coarse-to-fine target speaker extraction based on contextual information exploitation,.

MoMuSE: Momentum Multi-modal Target Speaker Extraction for Real-time Scenarios with Impaired Visual Cues Coarse-to-fine target speaker extraction based on contextual information exploitation,

Reference 22

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T18:07:26.800290Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-11T18:07:26.667853Z digest=sha256:d09cd26f9a8a2a47d9c8ba2d5e4239a0ffb5af680e863db392c5443829abb9fe

Observation d81af2e2-c5db-4139-add9-95ec3078936b · outbound

This paper cites Wesep: A scalable and flexible toolkit towards generalizable target speaker extraction,.

MoMuSE: Momentum Multi-modal Target Speaker Extraction for Real-time Scenarios with Impaired Visual Cues Wesep: A scalable and flexible toolkit towards generalizable target speaker extraction,

Reference 23

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T18:07:26.792638Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-11T18:07:26.670668Z digest=sha256:0c5e304550093b920f6c05a38e99d24e32e2575f17f31b037c508065371053ad

Observation bf9af09e-4c66-4939-9b8d-aab8a78dce54 · outbound

This paper cites Multi-level speaker representation for target speaker extraction,.

MoMuSE: Momentum Multi-modal Target Speaker Extraction for Real-time Scenarios with Impaired Visual Cues Multi-level speaker representation for target speaker extraction,

Reference 24

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T18:07:26.784687Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-11T18:07:26.673336Z digest=sha256:e3f67d6f52343e065b2daef8a656c9616fc068dc774aa5c98c0a4f1503932b7f

Observation 4630f28c-b9f7-4ea0-bff0-09a8de741d06 · outbound

This paper cites Muse: Multi- modal target speaker extraction with visual cues,.

MoMuSE: Momentum Multi-modal Target Speaker Extraction for Real-time Scenarios with Impaired Visual Cues Muse: Multi- modal target speaker extraction with visual cues,

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T18:07:26.776104Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-11T18:07:26.676032Z digest=sha256:7a5bae78ec792e8493aa8a41e8928b6724a052392cffed3ba69bb50d65ba4da4

Observation ec1ef8fc-614b-4c50-9bb1-616fba8d1305 · outbound

This paper cites Neural machine translation by jointly learning to align and translate,.

MoMuSE: Momentum Multi-modal Target Speaker Extraction for Real-time Scenarios with Impaired Visual Cues Neural machine translation by jointly learning to align and translate,

Reference 26

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T18:07:26.766925Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-11T18:07:26.678636Z digest=sha256:5f75de1ac049a69c0b9cab5773fa73e784ae2fef35d599fd15e5f32dc13a5fa0

Observation 05ce3e2c-a246-4126-8ab4-dc1c88bfbacb · outbound

This paper cites Conv-tasnet: Surpassing ideal time– frequency magnitude masking for speech separation,.

MoMuSE: Momentum Multi-modal Target Speaker Extraction for Real-time Scenarios with Impaired Visual Cues Conv-tasnet: Surpassing ideal time– frequency magnitude masking for speech separation,

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-11T18:07:26.681147Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:07:26.681147Z digest=sha256:c484cb07c8ae99b9945aea82fed8ff347458de1ffebb4efa28142e3465996bf2

Observation c8c41f28-b5c4-4d8a-a58a-5dee04d51837 · outbound

This paper cites V oxCeleb2: Deep Speaker Recognition,.

MoMuSE: Momentum Multi-modal Target Speaker Extraction for Real-time Scenarios with Impaired Visual Cues V oxCeleb2: Deep Speaker Recognition,

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T18:07:26.752080Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-11T18:07:26.683759Z digest=sha256:83a64cf75b51547f3de904d0519981ee1bb33b089237d82af4e76e92c580b0e2

Observation 93976f9a-6887-44f5-8f1f-6fe93fcf26f6 · outbound

This paper cites Performance measurement in blind audio source separation,.

MoMuSE: Momentum Multi-modal Target Speaker Extraction for Real-time Scenarios with Impaired Visual Cues Performance measurement in blind audio source separation,

Reference 29

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T18:07:26.742011Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-11T18:07:26.686342Z digest=sha256:925e4b478da6b3ada53e102351a4f54c4a0ae922b4750f69ebf9aefe061a4375

Observation fa09f51a-b794-4a5c-a919-5d6ff0eaee98 · outbound

This paper cites Perceptual evaluation of speech quality (pesq)-a new method for speech quality assessment of telephone networks and codecs,.

MoMuSE: Momentum Multi-modal Target Speaker Extraction for Real-time Scenarios with Impaired Visual Cues Perceptual evaluation of speech quality (pesq)-a new method for speech quality assessment of telephone networks and codecs,

Reference 30

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T18:07:26.733214Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-11T18:07:26.688787Z digest=sha256:01eb1d5605d984cca6fa90bd4cff476ac36107f7166bfe1113c72483ec02378d

Observation b512a36e-86bf-4eda-8d64-2a98e86a5d1a · outbound

This paper cites An algorithm for intelligibility prediction of time–frequency weighted noisy speech,.

MoMuSE: Momentum Multi-modal Target Speaker Extraction for Real-time Scenarios with Impaired Visual Cues An algorithm for intelligibility prediction of time–frequency weighted noisy speech,

Reference 31

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T18:07:26.724616Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-11T18:07:26.691292Z digest=sha256:014dfc84a2ec9ba2bc066dbfc31b3359e06ce16b05e565087fc993630a9fd9bd

Observation af79fb60-7def-4cf6-9a0b-720b3fe33706 · outbound

This paper cites FaceFilter: Audio-Visual Speech Separation Using Still Images,.

MoMuSE: Momentum Multi-modal Target Speaker Extraction for Real-time Scenarios with Impaired Visual Cues FaceFilter: Audio-Visual Speech Separation Using Still Images,

Reference 32

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T18:07:26.716346Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-11T18:07:26.693764Z digest=sha256:37f7db6461202e779847905754d2f8cf0867b41d0367e32bb9c6dda8287c6e2e

Pith citing papers

Observation 7e7e147e-96ba-4759-a544-6ae1f7d213e7 · inbound

CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction cites this paper.

CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction MoMuSE: Momentum Multi-modal Target Speaker Extraction for Real-time Scenarios with Impaired Visual Cues

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-02T19:39:50.132135Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T19:39:50.132135Z digest=sha256:6b410b066d9c3c500437cb0fd7b258f9dca990584a084131fe79229615263e11