Pith. sign in

Paper Citation Record · LEDGER

mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition

As of 18 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 1 inbound Pith citation observation for arXiv:2502.01547.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2502.01547 v3

Coverage vector

measured 51 of 51 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-09T15:03:07.926870Z

measured 52 of 52 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-17T06:30:58.91139+00:00

measured 1 of 1 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-16T00:02:14.608210Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: pith, observed 2026-08-16T00:02:14.902604Z

Reference resolution

51 of 51 outbound references displayed

  • verified exact1
  • verified fuzzy44
  • unresolved5
  • parse uncertain0
  • malformed identifier1
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 36e66a6d-34ba-4b8e-8440-2d59a16c0f13 · outbound

This paper cites Robust speech recognition via large-scale weak super- vision,.

mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition Robust speech recognition via large-scale weak super- vision,

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-09T15:03:07.620446Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T15:03:07.620446Z digest=sha256:2411ef2f3f7981adc98957637766e2dc36e41e0766e030f1093cbdafff0a02b8

Observation d763d471-8483-4c04-af38-66ca2efec5ff · outbound

This paper cites Less is more: Accurate speech recognition & translation without web-scale data,.

mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition Less is more: Accurate speech recognition & translation without web-scale data,

Reference 2

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T15:03:09.074872Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-09T15:03:07.629110Z digest=sha256:ed79ef66d17b75f637641cd360a9da676781e585d300e6d22a2f93ee0a1620be

Observation e46d493a-d02d-4e7e-8e52-584060f119c8 · outbound

This paper cites Comparison of Multilingual Self-Supervised and Weakly-Supervised Speech Pre- Training for Adaptation to Unseen Languages,.

mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition Comparison of Multilingual Self-Supervised and Weakly-Supervised Speech Pre- Training for Adaptation to Unseen Languages,

Reference 3

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T15:03:09.047753Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-09T15:03:07.636547Z digest=sha256:f9131613808542396f579978598c676e81545c94281fe2e118685dea2c101269

Observation 8394274d-6913-418b-985b-3c572fdcc44a · outbound

This paper cites Ml-superb: Multilingual speech universal performance benchmark,.

mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition Ml-superb: Multilingual speech universal performance benchmark,

Reference 4

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T15:03:09.023398Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-09T15:03:07.644961Z digest=sha256:a0b8e5424a61872b99046ce70f132c117ba965db197cdd599527df36f93a6877

Observation a221308b-4bbd-4d46-a4e3-583e078458d9 · outbound

This paper cites Whisper-AT: Noise- Robust Automatic Speech Recognizers are Also Strong General Audio Event Taggers,.

mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition Whisper-AT: Noise- Robust Automatic Speech Recognizers are Also Strong General Audio Event Taggers,

Reference 5

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T15:03:09.002119Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-09T15:03:07.657611Z digest=sha256:1a8db13903a790fc9eb9fcd5bd27a58342cc55535fde68d612fd3e76a3fc804d

Observation df002455-96f9-4915-bb9d-748b31932171 · outbound

This paper cites Large language models are efficient learners of noise-robust speech recognition,.

mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition Large language models are efficient learners of noise-robust speech recognition,

Reference 6

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T15:03:08.979409Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-09T15:03:07.667794Z digest=sha256:a081dc6c01cace2d1b1d9e6ad63b8802f6a3279967e11eecbde4bbf1dfa00eb3

Observation 8e11d26f-00db-4d7e-b871-6cf861d0359c · outbound

This paper cites Deep audio-visual speech recognition,.

mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition Deep audio-visual speech recognition,

Reference 7

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T15:03:08.956927Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-09T15:03:07.676676Z digest=sha256:cab9cbb4ea977d2c411d9b2c0f9951e347bfb07449089d291777d5a0d43188a3

Observation 3b4d0265-477c-4caa-b0d7-c12c2e6eb71c · outbound

This paper cites Audio-visual speech recognition with a hybrid ctc/attention architec- ture,.

mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition Audio-visual speech recognition with a hybrid ctc/attention architec- ture,

Reference 8

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T15:03:08.934075Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-09T15:03:07.682749Z digest=sha256:47bbada450615748fadb5e078530f7eed16c24286f6595d314519a240fe08d31

Observation 44cac0ed-1028-4b4a-ba1a-f9a3878a805e · outbound

This paper cites End-to-end audiovisual speech recognition,.

mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition End-to-end audiovisual speech recognition,

Reference 9

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T15:03:08.910426Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-09T15:03:07.689021Z digest=sha256:3bf6fab44a6c2ac354829556756751a2df7fdd3efa9b77253a42c39d3bbf8cfe

Observation 02e3376b-7db0-4457-8a1c-c810671286a4 · outbound

This paper cites Discriminative multi-modality speech recognition,.

mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition Discriminative multi-modality speech recognition,

Reference 10

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T15:03:08.880621Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-09T15:03:07.694641Z digest=sha256:8651ddbbdeb435a707946962bb517b3783c2bb79ecc0a2511c4b3bc40e498d3f

Observation 61138ab9-eb69-4a70-8cb4-7faa9da03991 · outbound

This paper cites End-to-end audio-visual speech recognition with conformers,.

mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition End-to-end audio-visual speech recognition with conformers,

Reference 11

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T15:03:08.858722Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-09T15:03:07.699642Z digest=sha256:a6bede202c9c4201795457f682a4e05be94a3614a2c49cd980d33807611859c2

Observation 4e509d71-fbdb-400e-82f7-49eae079021c · outbound

This paper cites Transformer-Based Video Front- Ends for Audio-Visual Speech Recognition for Single and Muti-Person Video,.

mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition Transformer-Based Video Front- Ends for Audio-Visual Speech Recognition for Single and Muti-Person Video,

Reference 12

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T15:03:08.835897Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-09T15:03:07.705490Z digest=sha256:9abc684e57fe34ba37af36a09f92cd2ea8905bfd7e569cbc0bd4e3cdebf33455

Observation e8e6dce5-ce6a-450e-b873-b615a666b54a · outbound

This paper cites Robust Self-Supervised Audio- Visual Speech Recognition,.

mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition Robust Self-Supervised Audio- Visual Speech Recognition,

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T15:03:08.811281Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-09T15:03:07.711584Z digest=sha256:b7e9219a4e5d87d71415a590e090c714500079f03ce3375693ae3d730f58f118

Observation e8a21a7c-fd7e-46df-ad2b-005c0ef57b1f · outbound

This paper cites Auto-avsr: Audio-visual speech recognition with automatic labels,.

mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition Auto-avsr: Audio-visual speech recognition with automatic labels,

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T15:03:08.785801Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-09T15:03:07.717159Z digest=sha256:42589cf778e2b687d333351929d2ce8fe6fbdd4f7909f3236b7e9afd5886d6f6

Observation 12d95f06-cb2d-4367-813e-ef6a257bb358 · outbound

This paper cites Audio-visual efficient conformer for robust speech recognition,.

mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition Audio-visual efficient conformer for robust speech recognition,

Reference 15

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T15:03:08.762189Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-09T15:03:07.722811Z digest=sha256:05f01a9b3d09b41f92f5041d8252d2839b611f47fbc94046d7fb2d9677b79c46

Observation 2244be9d-215d-4123-8dd1-3bdf48305918 · outbound

This paper cites Large Language Models are Strong Audio-Visual Speech Recognition Learners.

mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition Large Language Models are Strong Audio-Visual Speech Recognition Learners

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-09T15:03:07.727809Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T15:03:07.727809Z digest=sha256:c05d7f922817966cfd4ab4ca587e22ca7b9a543c615c6e810c8f54ea8fb8957e

Observation c2bc02ab-d9e4-47a3-b4ed-64447ba14f70 · outbound

This paper cites Whisper-flamingo: Integrating visual features into whisper for audio-visual speech recognition and translation,.

mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition Whisper-flamingo: Integrating visual features into whisper for audio-visual speech recognition and translation,

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T15:03:08.739525Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-09T15:03:07.733675Z digest=sha256:3a5b3fb3f807b5421633140e5ab56b067c808956091bf02d525a529425e5bfdb

Observation 7309830d-ebb4-4beb-821d-6dddeb9ad7f2 · outbound

This paper cites Learning audio- visual speech representation by masked multimodal cluster prediction,.

mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition Learning audio- visual speech representation by masked multimodal cluster prediction,

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T15:03:08.716579Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-09T15:03:07.738870Z digest=sha256:0be9bee69056f899ba6d05999a3e00eac108abe790d72d26a592b0df694e3abe

Observation 546fd007-8919-4b06-997f-967cde156f6e · outbound

This paper cites Efficient training for multilingual visual speech recognition: Pre-training with discretized visual speech representation,.

mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition Efficient training for multilingual visual speech recognition: Pre-training with discretized visual speech representation,

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T15:03:08.688221Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-09T15:03:07.744642Z digest=sha256:7874ca6cb25a4d3b6cac52f5910e40bd8ad9789ee73ccefd95eaa20f4533807b

Observation 08b9fe21-b622-4a98-b96a-a5814f0f093f · outbound

This paper cites Muavic: A multilingual audio-visual corpus for robust speech recogni- tion and robust speech-to-text translation,.

mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition Muavic: A multilingual audio-visual corpus for robust speech recogni- tion and robust speech-to-text translation,

Reference 20

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T15:03:08.663357Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-09T15:03:07.750519Z digest=sha256:d0cc621e7cf69464a756773bf9a71ccc06c68adfcc1d6333b61733f6747eed91

Observation 8fb9f648-784a-4b41-b679-2c46496d415e · outbound

This paper cites Flamingo: a visual language model for few-shot learning,.

mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition Flamingo: a visual language model for few-shot learning,

Reference 21

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T15:03:08.642378Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-09T15:03:07.756377Z digest=sha256:2c1c93b48489bc18765adfbf2d922ea416f766e187dcba5631090d6a83135d6a

Observation bb6baf1d-9960-4900-a057-09b9762b7737 · outbound

This paper cites Improving neural networks by preventing co-adaptation of feature detectors.

mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition Improving neural networks by preventing co-adaptation of feature detectors

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-09T15:03:07.762763Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T15:03:07.762763Z digest=sha256:0165ed93a013eeb92efbdf3df67758818ed3dc895d9c063579d7258ae1e1e2a1

Observation 8380c3a9-2e3c-4e3d-963e-c2e1c6015377 · outbound

This paper cites Moddrop: adaptive multi-modal gesture recognition,.

mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition Moddrop: adaptive multi-modal gesture recognition,

Reference 23

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T15:03:08.616275Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-09T15:03:07.770554Z digest=sha256:4dcc26647ca423f40a8047fe1c101957022f5f66bf752761f52d509aef0c48d7

Observation e0bd4aa6-222b-45eb-becd-281d14617ff0 · outbound

This paper cites Recurrent neural network transducer for audio-visual speech recognition,.

mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition Recurrent neural network transducer for audio-visual speech recognition,

Reference 24

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T15:03:08.595548Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-09T15:03:07.779518Z digest=sha256:684a5d391b698b966f16554c8bced9a29262ab993a77950ea1354565ca3d9d6a

Observation 29593e31-0d24-4cd0-99a4-bf8e0787951f · outbound

This paper cites u-hubert: Unified mixed-modal speech pretrain- ing and zero-shot transfer to unlabeled modality,.

mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition u-hubert: Unified mixed-modal speech pretrain- ing and zero-shot transfer to unlabeled modality,

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T15:03:08.575596Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-09T15:03:07.785015Z digest=sha256:7d4159797aaa650310ae6677cb76478e2c0a88f70a1a9a5b6b87e6ec887a273f

Observation d465ae67-070a-484e-a53a-296fb165f05a · outbound

This paper cites Av-data2vec: Self- supervised learning of audio-visual speech representations with contex- tualized target representations,.

mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition Av-data2vec: Self- supervised learning of audio-visual speech representations with contex- tualized target representations,

Reference 26

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T15:03:08.556376Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-09T15:03:07.791481Z digest=sha256:ecf319f47535907478f35d5ffd1ff1b06bfea1e005963c49d83c6d02348e4e9f

Observation c74a130c-812f-4f37-85b5-88e9aaf7124f · outbound

This paper cites Av-cpl: Continu- ous pseudo-labeling for audio-visual speech recognition,.

mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition Av-cpl: Continu- ous pseudo-labeling for audio-visual speech recognition,

Reference 27

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T15:03:08.536349Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-09T15:03:07.799529Z digest=sha256:df29035603212d10a28386047bd8cfc6e409580b3d3aa2a220608baedca5e96e

Observation c6b910bf-beed-4376-92a6-424d0d8bf13a · outbound

This paper cites Attention is all you need,.

mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition Attention is all you need,

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-09T15:03:07.805145Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T15:03:07.805145Z digest=sha256:912f3b8c1f7c86d85f837d0e141b94becb0e94950d35f1dd242bde1b1372a04a

Observation aea984b1-97d7-4c3e-ab50-fc385ea22aac · outbound

This paper cites Reducing transformer depth on demand with structured dropout,.

mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition Reducing transformer depth on demand with structured dropout,

Reference 29

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T15:03:08.497117Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-09T15:03:07.810903Z digest=sha256:11fd1488cb7df29df7f10748ded9dd87cf82d940ce9a4b76e8b234e48501da28

Observation 8d036736-1800-4ead-a958-6487c6c89f7d · outbound

This paper cites Lrs3-ted: a large-scale dataset for visual speech recognition,.

mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition Lrs3-ted: a large-scale dataset for visual speech recognition,

Reference 30

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T15:03:08.474571Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-09T15:03:07.816149Z digest=sha256:6143953fb537bc9ccc98b5566dc7ec6e7c85dbdaefdb5447798375bd7d6045bd

Observation c2b1e04f-f708-4d92-aefe-d2c845d46035 · outbound

This paper cites The multilingual tedx corpus for speech recognition and translation,.

mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition The multilingual tedx corpus for speech recognition and translation,

Reference 31

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T15:03:08.449981Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-09T15:03:07.821291Z digest=sha256:3e313378f7e44e0e8bd4b7e77728b9f302bdc40e70b028521ab13fb9ee8ddf3c

Observation 385b4df5-66e6-4df6-a230-e3185c1c5f51 · outbound

This paper cites Jointly learning visual and auditory speech representations from raw data,.

mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition Jointly learning visual and auditory speech representations from raw data,

Reference 32

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T15:03:08.424558Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-09T15:03:07.826062Z digest=sha256:9e9641e12558a596b8748c779f1f9526333c780a58b5bc310128f430c413f3ef

Observation 8dbf6df7-8964-413f-b51a-8f046c7e1a1c · outbound

This paper cites Braven: Improving self-supervised pre-training for visual and auditory speech recognition,.

mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition Braven: Improving self-supervised pre-training for visual and auditory speech recognition,

Reference 33

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T15:03:08.404730Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-09T15:03:07.830909Z digest=sha256:812c092102fe2dc027d11e3c5afd5989f1e1cb4ff85cffd19f4c582341f03f70

Observation 14b41418-4d9d-49d2-b8a6-04cb133fa1d6 · outbound

This paper cites Unified speech recognition: A single model for auditory, visual, and audiovisual inputs,.

mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition Unified speech recognition: A single model for auditory, visual, and audiovisual inputs,

Reference 34

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T15:03:08.385428Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-09T15:03:07.836000Z digest=sha256:09853b898a81d5b2685fa7279d2455c4cc2a86e0f262b482a8018fad2324db5a

Observation b97927d3-ede5-4728-9966-51d92880e896 · outbound

This paper cites Visual speech recognition for multiple languages in the wild,.

mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition Visual speech recognition for multiple languages in the wild,

Reference 35

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T15:03:08.364237Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-09T15:03:07.841096Z digest=sha256:63ff8012652b25b4ecc95f0c66ff0ee432271436dfbeb963ed2f8d7f72768b55

Observation e6bccbc4-25ff-42af-8208-12533f65f5e8 · outbound

This paper cites Learning cross-lingual visual speech representations,.

mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition Learning cross-lingual visual speech representations,

Reference 36

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T15:03:08.343886Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-09T15:03:07.845998Z digest=sha256:6a469ee5afaee8d111853f42e63b22f42067302f8f6f92bf874a00ba009514d5

Observation 7110a677-aff4-4f0e-9b62-3da95a3a408e · outbound

This paper cites Lip reading for low-resource languages by learning and combining general speech knowledge and language-specific knowledge,.

mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition Lip reading for low-resource languages by learning and combining general speech knowledge and language-specific knowledge,

Reference 37

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T15:03:08.323356Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-09T15:03:07.851287Z digest=sha256:6b1acdcecc7a62b68a6745f75a148057fec2e746948ccc846f58fda6b58d2daa

Observation 63b682dd-ec3e-4a89-aa90-7fd72ce28d3b · outbound

This paper cites Visual speech recognition for languages with limited labeled data using automatic labels from whisper,.

mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition Visual speech recognition for languages with limited labeled data using automatic labels from whisper,

Reference 38

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T15:03:08.297953Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-09T15:03:07.857549Z digest=sha256:6d043c50935216204f59cd18000778396e0003ed3c5a8a71a00254d54ba35edb

Observation a7dce9ac-2401-4d27-8966-c86f8d680b07 · outbound

This paper cites Dlib-ml: A machine learning toolkit,.

mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition Dlib-ml: A machine learning toolkit,

Reference 39

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T15:03:08.278214Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-09T15:03:07.863346Z digest=sha256:c189ba33674643fbf0ca800313cf690878ff77871e4b2b0e34ca0014ad790c30

Observation 48fe8379-40b4-4ab5-92de-393c514e34db · outbound

This paper cites Lipreading using temporal convolutional networks,.

mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition Lipreading using temporal convolutional networks,

Reference 40

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T15:03:08.257725Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-09T15:03:07.868585Z digest=sha256:28e8ca182c447cb2ad4ad8a2a7956f06fc9b2d0d6fbffe84c9e1d4089159e0ac

Observation eea94984-04c7-42ce-a740-939e941c3201 · outbound

This paper cites Pytorch: An imperative style, high-performance deep learning library,.

mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition Pytorch: An imperative style, high-performance deep learning library,

Reference 41

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T15:03:08.238738Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-09T15:03:07.873809Z digest=sha256:70be388c50d1338c2e779670073f903face5a4112b3cdab5d132e7098cf7e0fd

Observation 1b00122c-32b2-4b3e-9bae-659036c7d26b · outbound

This paper cites PyTorch Lightning,.

mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition PyTorch Lightning,

Reference 42

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T15:03:08.219576Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-09T15:03:07.879462Z digest=sha256:9fbf83ae3e9c2e87be0c392b7617d88bb3d554db7511466944675d4dd69677a9

Observation df6723af-8ffa-4c3d-9ca8-38dec7a295c3 · outbound

This paper cites Decoupled weight decay regularization,.

mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition Decoupled weight decay regularization,

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-09T15:03:07.884994Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T15:03:07.884994Z digest=sha256:c8b2698a0706dc72e1c319a2259d282b43db44137114d848d01787ae64322ede

Observation 250fce94-1a33-4c98-9acf-8c22242b245f · outbound

This paper cites Musan: A music, speech, and noise corpus,.

mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition Musan: A music, speech, and noise corpus,

Reference 44

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T15:03:08.187582Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-09T15:03:07.890473Z digest=sha256:c8ef04865c998d50cfa7534f17a14bab1757ba38dca27be29d3405a925cb9917

Observation 761cd799-449e-4c39-a88f-be137e13379a · outbound

This paper cites Xlavs-r: Cross-lingual audio-visual speech representation learning for noise-robust speech perception,.

mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition Xlavs-r: Cross-lingual audio-visual speech representation learning for noise-robust speech perception,

Reference 45

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T15:03:08.165845Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-09T15:03:07.895754Z digest=sha256:565369e4d708cfcabcbed0b14e77b6c1bfc1a45fdde7df30d9f65215f011c54b

Observation 093781f0-359e-49ae-be0a-06a28840dfe0 · outbound

This paper cites Intuitive multilingual audio-visual speech recognition with a single-trained model,.

mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition Intuitive multilingual audio-visual speech recognition with a single-trained model,

Reference 46

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T15:03:08.144083Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-09T15:03:07.900929Z digest=sha256:28100781b99cd35f7fdf402c40aaf13f8177c75e8e1ec7a5000d7d6f9333ac8f

Observation 4b7ad998-8934-4a4d-9567-022f9efe3597 · outbound

This paper cites Multilingual audio-visual speech recognition with hybrid ctc/rnn-t fast conformer,.

mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition Multilingual audio-visual speech recognition with hybrid ctc/rnn-t fast conformer,

Reference 47

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T15:03:08.123563Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-09T15:03:07.906262Z digest=sha256:e6baa0b3884480159244b503644827dc78be9ed5e936bab27655c02ea13032e2

Observation bbc9f116-afe0-4ff3-bec7-3cade1e228ba · outbound

This paper cites Parameter-efficient cross-language transfer learning for a language- modular audiovisual speech recognition,.

mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition Parameter-efficient cross-language transfer learning for a language- modular audiovisual speech recognition,

Reference 48

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T15:03:08.099565Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-09T15:03:07.911410Z digest=sha256:fbe8c12f1237d695947d6f47ffb7a852694191f9acb5d3e6429fc612b19ef47f

Observation 4404c09d-99be-479d-be85-4e0fa608f3ef · outbound

This paper cites Tailored Design of Audio-Visual Speech Recognition Models using Branchformers.

mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition Tailored Design of Audio-Visual Speech Recognition Models using Branchformers

Reference 49

Resolution
verified exact
local_arxiv, observed 2026-08-09T15:03:08.009407Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-09T15:03:07.916668Z digest=sha256:ef3c4880b4936eb193ec495ed6abb57ec208c6445ad4aa05ef3cb934152abb52

Observation ee80a905-f169-4e1c-af44-3f8f51b53760 · outbound

This paper cites Interleaved audio/audiovisual transfer learning for av- asr in low-resourced languages,.

mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition Interleaved audio/audiovisual transfer learning for av- asr in low-resourced languages,

Reference 50

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T15:03:08.077680Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-09T15:03:07.922193Z digest=sha256:af0acd235b1d02e316ffc2c94a564a47eaf0feb475b764b66eebb92e2cf53fe3

Observation ec092975-4e34-4db7-9888-f6f1929deaf8 · outbound

This paper cites XLS-R: Self-supervised Cross-lingual Speech Representation Learning at Scale.

mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition XLS-R: Self-supervised Cross-lingual Speech Representation Learning at Scale

Reference 51

Resolution
malformed identifier
no resolver link, observed 2026-08-09T15:03:07.926870Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T15:03:07.926870Z digest=sha256:3cb06ea1c5356ce62295e6e05240773b83b5745ab7b7d48c081bb804543d7c15

Pith citing papers

Observation 31658b4e-5454-4c42-a0c0-c56795cce0fb · inbound

CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization cites this paper.

CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition

Reference 7

Resolution
verified exact
local_arxiv, observed 2026-08-16T00:02:14.909462Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-16T00:02:14.608210Z digest=sha256:c0834c72221e8ab5aefb99d32ed61e669f0f981e7004ed531cdc2c1eaad38c93