Pith. sign in

Paper Citation Record · LEDGER

mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition

As of 18 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 1 inbound Pith citation observation for arXiv:2502.01547.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2502.01547 v3

Coverage vector

measured 51 of 51 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-09T15:03:07.926870Z

measured 52 of 52 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-18T06:34:40.430872+00:00

measured 1 of 1 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-16T00:02:14.608210Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: pith, observed 2026-08-16T00:02:14.902604Z

Reference resolution

51 of 51 outbound references displayed

  • verified exact1
  • verified fuzzy44
  • unresolved5
  • parse uncertain0
  • malformed identifier1
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 36e66a6d-34ba-4b8e-8440-2d59a16c0f13 · outbound

This paper cites Robust speech recognition via large-scale weak super- vision,.

mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition Robust speech recognition via large-scale weak super- vision,

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-09T15:03:07.620446Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T15:03:07.620446Z digest=sha256:2411ef2f3f7981adc98957637766e2dc36e41e0766e030f1093cbdafff0a02b8

Observation d763d471-8483-4c04-af38-66ca2efec5ff · outbound

This paper cites Less is more: Accurate speech recognition & translation without web-scale data,.

mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition Less is more: Accurate speech recognition & translation without web-scale data,

Reference 2

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T15:03:09.074872Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-09T15:03:07.629110Z digest=sha256:50cf36af2e9f2bf4c2f8ce0bf483c2373a7409ecde8656b9886b4d3e9cfd8504

Observation e46d493a-d02d-4e7e-8e52-584060f119c8 · outbound

This paper cites Comparison of Multilingual Self-Supervised and Weakly-Supervised Speech Pre- Training for Adaptation to Unseen Languages,.

mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition Comparison of Multilingual Self-Supervised and Weakly-Supervised Speech Pre- Training for Adaptation to Unseen Languages,

Reference 3

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T15:03:09.047753Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-09T15:03:07.636547Z digest=sha256:e209f52c75a6a9f97a5feb7c64f5a084079d1d355a6ca5dc0f6cc3d206842691

Observation 8394274d-6913-418b-985b-3c572fdcc44a · outbound

This paper cites Ml-superb: Multilingual speech universal performance benchmark,.

mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition Ml-superb: Multilingual speech universal performance benchmark,

Reference 4

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T15:03:09.023398Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-09T15:03:07.644961Z digest=sha256:ce03e740291cf23cc987cf499a9975f7d3b2548cf5be8402ff10fc6c2539703d

Observation a221308b-4bbd-4d46-a4e3-583e078458d9 · outbound

This paper cites Whisper-AT: Noise- Robust Automatic Speech Recognizers are Also Strong General Audio Event Taggers,.

mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition Whisper-AT: Noise- Robust Automatic Speech Recognizers are Also Strong General Audio Event Taggers,

Reference 5

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T15:03:09.002119Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-09T15:03:07.657611Z digest=sha256:13837739d892006e5d1d58f3db95f99a7416455603fc4413395987ff1f62ecd5

Observation df002455-96f9-4915-bb9d-748b31932171 · outbound

This paper cites Large language models are efficient learners of noise-robust speech recognition,.

mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition Large language models are efficient learners of noise-robust speech recognition,

Reference 6

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T15:03:08.979409Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-09T15:03:07.667794Z digest=sha256:2ca5482785cf665c4cefd8c0a9a93bc1416016492083aefab3eb500dd21fbd38

Observation 8e11d26f-00db-4d7e-b871-6cf861d0359c · outbound

This paper cites Deep audio-visual speech recognition,.

mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition Deep audio-visual speech recognition,

Reference 7

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T15:03:08.956927Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-09T15:03:07.676676Z digest=sha256:1148c010d716b92b5c0e3194f18cb7c7526111dc99cd990151303c293ee3185e

Observation 3b4d0265-477c-4caa-b0d7-c12c2e6eb71c · outbound

This paper cites Audio-visual speech recognition with a hybrid ctc/attention architec- ture,.

mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition Audio-visual speech recognition with a hybrid ctc/attention architec- ture,

Reference 8

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T15:03:08.934075Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-09T15:03:07.682749Z digest=sha256:e72c2d49d6a7e2131d8d7d52ca619c9a7461613b38a999c35d15008676d9f0bb

Observation 44cac0ed-1028-4b4a-ba1a-f9a3878a805e · outbound

This paper cites End-to-end audiovisual speech recognition,.

mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition End-to-end audiovisual speech recognition,

Reference 9

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T15:03:08.910426Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-09T15:03:07.689021Z digest=sha256:e3b41ee2b3047a49efb4eb63907a31852f19f5a51a68d0b791984c5cbea55b4b

Observation 02e3376b-7db0-4457-8a1c-c810671286a4 · outbound

This paper cites Discriminative multi-modality speech recognition,.

mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition Discriminative multi-modality speech recognition,

Reference 10

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T15:03:08.880621Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-09T15:03:07.694641Z digest=sha256:1b53b822046a77e5bb140f91a017cdb2d0281793a552472a8de0b977dce46b60

Observation 61138ab9-eb69-4a70-8cb4-7faa9da03991 · outbound

This paper cites End-to-end audio-visual speech recognition with conformers,.

mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition End-to-end audio-visual speech recognition with conformers,

Reference 11

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T15:03:08.858722Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-09T15:03:07.699642Z digest=sha256:dcd62251d9921b0dee565e2f07e6b272face3a0eefea69a124f30b363a8970db

Observation 4e509d71-fbdb-400e-82f7-49eae079021c · outbound

This paper cites Transformer-Based Video Front- Ends for Audio-Visual Speech Recognition for Single and Muti-Person Video,.

mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition Transformer-Based Video Front- Ends for Audio-Visual Speech Recognition for Single and Muti-Person Video,

Reference 12

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T15:03:08.835897Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-09T15:03:07.705490Z digest=sha256:cde0d4b04e299d5149038b92049b537ef39059261783178edce3bd8817d938f9

Observation e8e6dce5-ce6a-450e-b873-b615a666b54a · outbound

This paper cites Robust Self-Supervised Audio- Visual Speech Recognition,.

mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition Robust Self-Supervised Audio- Visual Speech Recognition,

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T15:03:08.811281Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-09T15:03:07.711584Z digest=sha256:ab6555eae9c90669e4ff03095dc0ccc6faba67cd02a15529cfa72d1df1268168

Observation e8a21a7c-fd7e-46df-ad2b-005c0ef57b1f · outbound

This paper cites Auto-avsr: Audio-visual speech recognition with automatic labels,.

mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition Auto-avsr: Audio-visual speech recognition with automatic labels,

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T15:03:08.785801Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-09T15:03:07.717159Z digest=sha256:4637fd2d87cf1eadc7119e0b8d368f383df284644c557604c9ad3fccab293246

Observation 12d95f06-cb2d-4367-813e-ef6a257bb358 · outbound

This paper cites Audio-visual efficient conformer for robust speech recognition,.

mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition Audio-visual efficient conformer for robust speech recognition,

Reference 15

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T15:03:08.762189Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-09T15:03:07.722811Z digest=sha256:af44fef8c89eb4469139084f7623ec4ca0b0fab21b0c6ad868b9b9d4d82dea4f

Observation 2244be9d-215d-4123-8dd1-3bdf48305918 · outbound

This paper cites Large Language Models are Strong Audio-Visual Speech Recognition Learners.

mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition Large Language Models are Strong Audio-Visual Speech Recognition Learners

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-09T15:03:07.727809Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T15:03:07.727809Z digest=sha256:c05d7f922817966cfd4ab4ca587e22ca7b9a543c615c6e810c8f54ea8fb8957e

Observation c2bc02ab-d9e4-47a3-b4ed-64447ba14f70 · outbound

This paper cites Whisper-flamingo: Integrating visual features into whisper for audio-visual speech recognition and translation,.

mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition Whisper-flamingo: Integrating visual features into whisper for audio-visual speech recognition and translation,

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T15:03:08.739525Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-09T15:03:07.733675Z digest=sha256:3fb87df145b4bcb04805eabf93200f3fba8f9fd22cc8847c16acd335d6864cc4

Observation 7309830d-ebb4-4beb-821d-6dddeb9ad7f2 · outbound

This paper cites Learning audio- visual speech representation by masked multimodal cluster prediction,.

mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition Learning audio- visual speech representation by masked multimodal cluster prediction,

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T15:03:08.716579Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-09T15:03:07.738870Z digest=sha256:e0174ef8daadfa7916803195a80eb666c732c583e3db99c4f21e9c6f555ce0dc

Observation 546fd007-8919-4b06-997f-967cde156f6e · outbound

This paper cites Efficient training for multilingual visual speech recognition: Pre-training with discretized visual speech representation,.

mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition Efficient training for multilingual visual speech recognition: Pre-training with discretized visual speech representation,

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T15:03:08.688221Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-09T15:03:07.744642Z digest=sha256:a1ed5c431d625c570d6ae79a803eecdaa7a514e9ace8c2e6edfa36b6b1a94adb

Observation 08b9fe21-b622-4a98-b96a-a5814f0f093f · outbound

This paper cites Muavic: A multilingual audio-visual corpus for robust speech recogni- tion and robust speech-to-text translation,.

mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition Muavic: A multilingual audio-visual corpus for robust speech recogni- tion and robust speech-to-text translation,

Reference 20

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T15:03:08.663357Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-09T15:03:07.750519Z digest=sha256:3d095eaa0eed5b14a98b73ef389bb9237a14fd64368f74572f0fb88b4980edb4

Observation 8fb9f648-784a-4b41-b679-2c46496d415e · outbound

This paper cites Flamingo: a visual language model for few-shot learning,.

mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition Flamingo: a visual language model for few-shot learning,

Reference 21

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T15:03:08.642378Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-09T15:03:07.756377Z digest=sha256:190b28c1bf65f9bf4f817c4d86717d8b7cee61b41573cbbd6bfa2edf74bb042e

Observation bb6baf1d-9960-4900-a057-09b9762b7737 · outbound

This paper cites Improving neural networks by preventing co-adaptation of feature detectors.

mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition Improving neural networks by preventing co-adaptation of feature detectors

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-09T15:03:07.762763Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T15:03:07.762763Z digest=sha256:0165ed93a013eeb92efbdf3df67758818ed3dc895d9c063579d7258ae1e1e2a1

Observation 8380c3a9-2e3c-4e3d-963e-c2e1c6015377 · outbound

This paper cites Moddrop: adaptive multi-modal gesture recognition,.

mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition Moddrop: adaptive multi-modal gesture recognition,

Reference 23

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T15:03:08.616275Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-09T15:03:07.770554Z digest=sha256:196ef29dbfa50b4a60487fe70555290fd5e782e8df03bdbc44c4b8783c2a9766

Observation e0bd4aa6-222b-45eb-becd-281d14617ff0 · outbound

This paper cites Recurrent neural network transducer for audio-visual speech recognition,.

mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition Recurrent neural network transducer for audio-visual speech recognition,

Reference 24

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T15:03:08.595548Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-09T15:03:07.779518Z digest=sha256:f4e5ea0b9201a3f23984894bd16d4600b65e3d3fcf949701f1bea6e4814116b2

Observation 29593e31-0d24-4cd0-99a4-bf8e0787951f · outbound

This paper cites u-hubert: Unified mixed-modal speech pretrain- ing and zero-shot transfer to unlabeled modality,.

mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition u-hubert: Unified mixed-modal speech pretrain- ing and zero-shot transfer to unlabeled modality,

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T15:03:08.575596Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-09T15:03:07.785015Z digest=sha256:211313bcf5a3fcbacfb7078cad4a372b0343ef757c2e5ae8eb7e1e7800a63e39

Observation d465ae67-070a-484e-a53a-296fb165f05a · outbound

This paper cites Av-data2vec: Self- supervised learning of audio-visual speech representations with contex- tualized target representations,.

mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition Av-data2vec: Self- supervised learning of audio-visual speech representations with contex- tualized target representations,

Reference 26

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T15:03:08.556376Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-09T15:03:07.791481Z digest=sha256:ac59729562fc5e8261ded8cad576bd08e511ee7f2dc6e9db416d0706d3c00989

Observation c74a130c-812f-4f37-85b5-88e9aaf7124f · outbound

This paper cites Av-cpl: Continu- ous pseudo-labeling for audio-visual speech recognition,.

mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition Av-cpl: Continu- ous pseudo-labeling for audio-visual speech recognition,

Reference 27

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T15:03:08.536349Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-09T15:03:07.799529Z digest=sha256:426adf6c7e1bf2eafff2df6c8fec4b44d2db1e46076f728cb41691b88956b049

Observation c6b910bf-beed-4376-92a6-424d0d8bf13a · outbound

This paper cites Attention is all you need,.

mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition Attention is all you need,

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-09T15:03:07.805145Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T15:03:07.805145Z digest=sha256:912f3b8c1f7c86d85f837d0e141b94becb0e94950d35f1dd242bde1b1372a04a

Observation aea984b1-97d7-4c3e-ab50-fc385ea22aac · outbound

This paper cites Reducing transformer depth on demand with structured dropout,.

mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition Reducing transformer depth on demand with structured dropout,

Reference 29

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T15:03:08.497117Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-09T15:03:07.810903Z digest=sha256:ff91de5a297f74e8fad9f68abaace7a51f97307eb24ca2380c90ad56dee4a50b

Observation 8d036736-1800-4ead-a958-6487c6c89f7d · outbound

This paper cites Lrs3-ted: a large-scale dataset for visual speech recognition,.

mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition Lrs3-ted: a large-scale dataset for visual speech recognition,

Reference 30

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T15:03:08.474571Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-09T15:03:07.816149Z digest=sha256:8807287b9948e2b0867e5132f483c8f574b9bdc5c7c402d569e5ce065b9b717b

Observation c2b1e04f-f708-4d92-aefe-d2c845d46035 · outbound

This paper cites The multilingual tedx corpus for speech recognition and translation,.

mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition The multilingual tedx corpus for speech recognition and translation,

Reference 31

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T15:03:08.449981Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-09T15:03:07.821291Z digest=sha256:a00b20061b2a14fafb80878715b3b1efc8897611663de521855647c5e32db205

Observation 385b4df5-66e6-4df6-a230-e3185c1c5f51 · outbound

This paper cites Jointly learning visual and auditory speech representations from raw data,.

mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition Jointly learning visual and auditory speech representations from raw data,

Reference 32

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T15:03:08.424558Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-09T15:03:07.826062Z digest=sha256:ff2bba3516126ed878763c96e41c377186ade7ec953e57184202591ebfeeb45a

Observation 8dbf6df7-8964-413f-b51a-8f046c7e1a1c · outbound

This paper cites Braven: Improving self-supervised pre-training for visual and auditory speech recognition,.

mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition Braven: Improving self-supervised pre-training for visual and auditory speech recognition,

Reference 33

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T15:03:08.404730Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-09T15:03:07.830909Z digest=sha256:2acedde2559fe68f4f4fe6b771055763f077ba6ccd8a8a6583d47adba680a48a

Observation 14b41418-4d9d-49d2-b8a6-04cb133fa1d6 · outbound

This paper cites Unified speech recognition: A single model for auditory, visual, and audiovisual inputs,.

mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition Unified speech recognition: A single model for auditory, visual, and audiovisual inputs,

Reference 34

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T15:03:08.385428Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-09T15:03:07.836000Z digest=sha256:5fd85c67103bec8474cd79d15c635ea7b503142015019683006baf9e8a162299

Observation b97927d3-ede5-4728-9966-51d92880e896 · outbound

This paper cites Visual speech recognition for multiple languages in the wild,.

mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition Visual speech recognition for multiple languages in the wild,

Reference 35

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T15:03:08.364237Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-09T15:03:07.841096Z digest=sha256:5191a1d6d9a9d44bd3a330ed1f216c750f253c032aa3bad39c0cfb3c7b25ca3f

Observation e6bccbc4-25ff-42af-8208-12533f65f5e8 · outbound

This paper cites Learning cross-lingual visual speech representations,.

mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition Learning cross-lingual visual speech representations,

Reference 36

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T15:03:08.343886Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-09T15:03:07.845998Z digest=sha256:31cb09e8fb76ada9f8dd1f01479eef2a2860d698dc4941932e24db456529445a

Observation 7110a677-aff4-4f0e-9b62-3da95a3a408e · outbound

This paper cites Lip reading for low-resource languages by learning and combining general speech knowledge and language-specific knowledge,.

mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition Lip reading for low-resource languages by learning and combining general speech knowledge and language-specific knowledge,

Reference 37

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T15:03:08.323356Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-09T15:03:07.851287Z digest=sha256:6b34ed2c9de0b3603adffd99239252ef49bb1fd39b09952533c27435dd21f038

Observation 63b682dd-ec3e-4a89-aa90-7fd72ce28d3b · outbound

This paper cites Visual speech recognition for languages with limited labeled data using automatic labels from whisper,.

mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition Visual speech recognition for languages with limited labeled data using automatic labels from whisper,

Reference 38

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T15:03:08.297953Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-09T15:03:07.857549Z digest=sha256:ae5aca84960ab0c648b13b7988db2002e3963447ef83bd4164afda1f0c41cf49

Observation a7dce9ac-2401-4d27-8966-c86f8d680b07 · outbound

This paper cites Dlib-ml: A machine learning toolkit,.

mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition Dlib-ml: A machine learning toolkit,

Reference 39

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T15:03:08.278214Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-09T15:03:07.863346Z digest=sha256:9785bec787390ebeb087865a0d6a84351f3672648b263228c96cf5081b823c03

Observation 48fe8379-40b4-4ab5-92de-393c514e34db · outbound

This paper cites Lipreading using temporal convolutional networks,.

mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition Lipreading using temporal convolutional networks,

Reference 40

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T15:03:08.257725Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-09T15:03:07.868585Z digest=sha256:aca9da8b3658629ac28096c6a7d1e7169c40cd325acc9395b047b14117a18255

Observation eea94984-04c7-42ce-a740-939e941c3201 · outbound

This paper cites Pytorch: An imperative style, high-performance deep learning library,.

mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition Pytorch: An imperative style, high-performance deep learning library,

Reference 41

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T15:03:08.238738Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-09T15:03:07.873809Z digest=sha256:ac7b5f20e8cb2990f052bcb52d90efc4b79bb32a203261af13264966ad12121b

Observation 1b00122c-32b2-4b3e-9bae-659036c7d26b · outbound

This paper cites PyTorch Lightning,.

mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition PyTorch Lightning,

Reference 42

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T15:03:08.219576Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-09T15:03:07.879462Z digest=sha256:573be6bc3d7746fa94b8e99cc255b225a292603da636c029e3a8c32f8d37ba2d

Observation df6723af-8ffa-4c3d-9ca8-38dec7a295c3 · outbound

This paper cites Decoupled weight decay regularization,.

mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition Decoupled weight decay regularization,

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-09T15:03:07.884994Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T15:03:07.884994Z digest=sha256:c8b2698a0706dc72e1c319a2259d282b43db44137114d848d01787ae64322ede

Observation 250fce94-1a33-4c98-9acf-8c22242b245f · outbound

This paper cites Musan: A music, speech, and noise corpus,.

mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition Musan: A music, speech, and noise corpus,

Reference 44

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T15:03:08.187582Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-09T15:03:07.890473Z digest=sha256:ebdbed658b77a258ca70d226a554acf4b916501897744679eff3c76daae54d8b

Observation 761cd799-449e-4c39-a88f-be137e13379a · outbound

This paper cites Xlavs-r: Cross-lingual audio-visual speech representation learning for noise-robust speech perception,.

mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition Xlavs-r: Cross-lingual audio-visual speech representation learning for noise-robust speech perception,

Reference 45

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T15:03:08.165845Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-09T15:03:07.895754Z digest=sha256:a6c8d5981343bc9087a156939ad009bc4f40bc17bbaae83c5781b3acd78c21f9

Observation 093781f0-359e-49ae-be0a-06a28840dfe0 · outbound

This paper cites Intuitive multilingual audio-visual speech recognition with a single-trained model,.

mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition Intuitive multilingual audio-visual speech recognition with a single-trained model,

Reference 46

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T15:03:08.144083Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-09T15:03:07.900929Z digest=sha256:ff00e71ddae782ab899c253b09748d4b168066b62f600901824d4f434e52a476

Observation 4b7ad998-8934-4a4d-9567-022f9efe3597 · outbound

This paper cites Multilingual audio-visual speech recognition with hybrid ctc/rnn-t fast conformer,.

mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition Multilingual audio-visual speech recognition with hybrid ctc/rnn-t fast conformer,

Reference 47

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T15:03:08.123563Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-09T15:03:07.906262Z digest=sha256:7809f56b40a7eab6ef4261874f70e012757cedb88de0e4be244c36e8743800bf

Observation bbc9f116-afe0-4ff3-bec7-3cade1e228ba · outbound

This paper cites Parameter-efficient cross-language transfer learning for a language- modular audiovisual speech recognition,.

mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition Parameter-efficient cross-language transfer learning for a language- modular audiovisual speech recognition,

Reference 48

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T15:03:08.099565Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-09T15:03:07.911410Z digest=sha256:530e153f0373118e4da9d42c3b2ce1bdaf85940526953ebd8d0982cb16fe438f

Observation 4404c09d-99be-479d-be85-4e0fa608f3ef · outbound

This paper cites Tailored Design of Audio-Visual Speech Recognition Models using Branchformers.

mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition Tailored Design of Audio-Visual Speech Recognition Models using Branchformers

Reference 49

Resolution
verified exact
local_arxiv, observed 2026-08-09T15:03:08.009407Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-09T15:03:07.916668Z digest=sha256:867456b152807861e60a01028fbc7509171245d60e8d01f89a9b1f41aaed1159

Observation ee80a905-f169-4e1c-af44-3f8f51b53760 · outbound

This paper cites Interleaved audio/audiovisual transfer learning for av- asr in low-resourced languages,.

mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition Interleaved audio/audiovisual transfer learning for av- asr in low-resourced languages,

Reference 50

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T15:03:08.077680Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-09T15:03:07.922193Z digest=sha256:87d70787a083240a47555f74e68d425d35ed0be9fc470c34ba77d2e760812049

Observation ec092975-4e34-4db7-9888-f6f1929deaf8 · outbound

This paper cites XLS-R: Self-supervised Cross-lingual Speech Representation Learning at Scale.

mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition XLS-R: Self-supervised Cross-lingual Speech Representation Learning at Scale

Reference 51

Resolution
malformed identifier
no resolver link, observed 2026-08-09T15:03:07.926870Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T15:03:07.926870Z digest=sha256:3cb06ea1c5356ce62295e6e05240773b83b5745ab7b7d48c081bb804543d7c15

Pith citing papers

Observation 31658b4e-5454-4c42-a0c0-c56795cce0fb · inbound

CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization cites this paper.

CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition

Reference 7

Resolution
verified exact
local_arxiv, observed 2026-08-16T00:02:14.909462Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-16T00:02:14.608210Z digest=sha256:f5f317a27d7518355f3220013201051a3b4502bcd6e054ed5dcec5146ac5e4ed