{"as_of":"2026-08-09T05:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0e70dade38eba11f14865255615e3c2b91f8f8b48bc4a64aacbd4a61400587f7","coverage":[{"denominator":84,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":84,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T12:46:12.269019Z","state":"measured"},{"denominator":85,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":85,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:39:34.111978Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T15:39:34.251185Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"cited_work":{"arxiv_id":"2502.10447","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.10447","snapshot_observed_at":"2026-08-07T15:39:34.251185Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","venue":"eess.AS","work_id":"ac49cdf8-dc2d-4103-aa07-c6e714ba7f87","year":2025},"citing_paper":{"arxiv_id":"2505.14336","last_updated":"2025-05-21T14:22:18Z","snapshot_observed_at":"2026-08-07T15:34:08.821122Z","submitted_at":"2025-05-20T13:20:55Z","title":"Scaling and Enhancing LLM-based AVSR: A Sparse Mixture of Projectors Approach","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T15:39:34.111978Z"},"links":{"cited_paper":"/paper/2502.10447","citing_paper":"/paper/2505.14336"},"observation_digest":"sha256:d8a28786ec7695525573b7561b3bb5f3c6a89e37abcc7d1ba80dedc6d01ad30d","observation_id":"10189419-0fe1-4ad1-9f36-c209cea88af3","resolution":{"observed_at":"2026-08-07T15:39:34.345367Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.10447/citation-record","integrity":"/paper/2502.10447/integrity","json":"/paper/2502.10447/citation-record.json","paper":"/paper/2502.10447"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:11.941722Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:11.941722Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:50b5b5162a4b290201d7638ef74951ecf50d66c50d087f22bddff5d79f281a7f","observation_id":"cb00bbcc-96c2-42e8-b779-f4adb89613c5","resolution":{"observed_at":"2026-08-08T12:46:11.941722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-08T12:46:11.947979Z","title":"L., Almeida, D., Altenschmidt, J., Altman, S., Anadkat, S., et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:11.947979Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:8dc731710206e2e4c88f70699b152469a5c0f0c73732b6f31ec2a156d0e4c1fb","observation_id":"f8a90e81-c9e9-459c-87f8-006a926ba1dc","resolution":{"observed_at":"2026-08-08T12:46:11.947979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:11.952950Z","title":"S., Senior, A., Vinyals, O., and Zisserman, A","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:11.952950Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:5b58f932a3a7befb76dccf0bfcbeafa9fd980c3867d3eec373646f24c0254624","observation_id":"78d4d530-6232-44cd-a438-e5cf4c89d29e","resolution":{"observed_at":"2026-08-08T12:46:11.952950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.00496","last_updated":"2018-10-28T14:29:46Z","snapshot_observed_at":"2026-07-06T06:58:51.877372Z","submitted_at":"2018-09-03T08:38:34Z","title":"LRS3-TED: a large-scale dataset for visual speech recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.00496","snapshot_observed_at":"2026-08-08T12:46:11.957891Z","title":"S., and Zisserman, A","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:11.957891Z"},"links":{"cited_paper":"/paper/1809.00496","citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:99b04d3db7f5d75b56c4cb76eb3b7af76d1ac75f5e828b156268addc3b3c0bad","observation_id":"09235db7-3652-4033-92ad-731095d6de81","resolution":{"observed_at":"2026-08-08T12:46:11.957891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:11.963258Z","title":"Gqa: Training generalized multi-query transformer models from multi-head checkpoints","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:11.963258Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:37c5bf31f22259b2fa58130174c7f38583cc1c8af4eef6961f7435788076c356","observation_id":"2e695b4c-6200-41a6-b137-6a12fb193dd7","resolution":{"observed_at":"2026-08-08T12:46:11.963258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:11.967831Z","title":"Muavic: A multilingual audio-visual corpus for robust speech recognition and robust speech-to-text translation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:11.967831Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:b6ba37b88dbbb9b5de62e0531c30cc5ceba833caf54f861708f2608b56ebcbec","observation_id":"6caeebfe-07b7-4133-9379-0b036559bba2","resolution":{"observed_at":"2026-08-08T12:46:11.967831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:13.101878Z","title":"Xls-r: Self-supervised cross-lingual speech representation learning at scale","venue":null,"work_id":"6437ef85-fb91-40a7-b241-8ec84f6f3fc5","year":2022},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:11.972414Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:838f621c6bde0b8d697b9f4c5b4aabfb6e801bb3db65c504ae2bcc8260d691fc","observation_id":"0d56858b-ac09-4ac0-ad31-d73f45facc6c","resolution":{"observed_at":"2026-08-08T12:46:13.105633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:11.977100Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech representations","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:11.977100Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:7545245a2e3ac17ca0f345e233591837dce443a774740cb0d8cafb250eb81140","observation_id":"3dbff9a2-7450-40d3-b556-096fbdcda2bd","resolution":{"observed_at":"2026-08-08T12:46:11.977100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.11596","last_updated":"2023-10-25T03:52:07Z","snapshot_observed_at":"2026-07-06T16:09:09.018523Z","submitted_at":"2023-08-22T17:44:18Z","title":"SeamlessM4T: Massively Multilingual & Multimodal Machine Translation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.11596","snapshot_observed_at":"2026-08-08T12:46:11.981186Z","title":"C., Dale, D., Dong, N., Duquenne, P.-A., Elsahar, H., Gong, H., Heffernan, K., Hoffman, J., et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:11.981186Z"},"links":{"cited_paper":"/paper/2308.11596","citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:42c89243ec8dcdec3e240762938d1b48f70bd06d6eee8fae1ccc4bb34b444d20","observation_id":"62f50549-e5f2-4082-84c2-aa4a81d73ecb","resolution":{"observed_at":"2026-08-08T12:46:11.981186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:13.086289Z","title":"and Timofte, R","venue":null,"work_id":"ebca1bb1-8d12-4976-a7e5-9ce3d2a57173","year":2023},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:11.985691Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:eed68773db22aceeff3ef44225c4dcb5d2487ce50e1c7223a211beeef7e75a29","observation_id":"a4b7e83e-c38c-4e3a-8a4a-ccc9451e40c4","resolution":{"observed_at":"2026-08-08T12:46:13.089504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12319","last_updated":"2025-03-07T09:30:16Z","snapshot_observed_at":"2026-08-07T00:42:32.268631Z","submitted_at":"2024-09-18T21:17:27Z","title":"Large Language Models are Strong Audio-Visual Speech Recognition Learners","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12319","snapshot_observed_at":"2026-08-08T12:46:11.989857Z","title":"Large language models are strong audio-visual speech recognition learners","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:11.989857Z"},"links":{"cited_paper":"/paper/2409.12319","citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:f9a9fa40d3835e7a5ff8032ebdb191c1f232872f4162879c94275a21118e3f9e","observation_id":"9d21efac-daea-48f0-a0b4-23f51b2e50e2","resolution":{"observed_at":"2026-08-08T12:46:11.989857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:13.076721Z","title":null,"venue":null,"work_id":"0884f55e-620d-4aa8-aa70-a72976ebb041","year":2023},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:11.994730Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:45df802e31b961629742cfb053f70fa5ecc05b0ee62b329a0d2686e0e0a49f49","observation_id":"cd483a05-4471-44fb-91fb-0d045342d569","resolution":{"observed_at":"2026-08-08T12:46:13.080054Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:13.066642Z","title":"Wavlm: Large-scale self-supervised pre-training for full stack speech processing","venue":null,"work_id":"557ed543-99fe-4d41-b49d-550462184acf","year":2022},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:11.998955Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:136e80ec6c6f7330aab8203c4be949f75687541a25382784055c4c9a738088da","observation_id":"94c28bb5-c138-44f7-9c7c-6d1910553bdd","resolution":{"observed_at":"2026-08-08T12:46:13.070272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:13.056664Z","title":"Mixtures of experts for audio-visual learning","venue":null,"work_id":"e79d15b7-1a4e-47a3-9c32-21291c5ee0bb","year":2024},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.003079Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:eb4dac6d607f2b493e3d9b822fb1eba30e2a70765c099ccd56890ce8a7eebbdd","observation_id":"0313e3cd-1a74-4706-b120-33ba3729349d","resolution":{"observed_at":"2026-08-08T12:46:13.060255Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:13.046622Z","title":"Self-supervised learning with random-projection quantizer for speech recognition","venue":null,"work_id":"13c59efc-982b-42ad-83c5-227f2a5d079e","year":2022},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.007423Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:f9094d07ccaa09df2461524d3c93e70f4e2719ccca4ec705ca44468c94172b3d","observation_id":"d3bee3c5-68f5-4dab-b490-218a46cd56b7","resolution":{"observed_at":"2026-08-08T12:46:13.050389Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:13.037045Z","title":"J., Kim, M., and Ro, Y","venue":null,"work_id":"afb00f31-944e-43e3-b744-83800cd25d7a","year":2024},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.011353Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:f0e18b11e09dc78ff790811a96192ffc8e7567bc7a5699add10ba62bb1da5497","observation_id":"8b5cf09a-2a9a-4c10-b50a-b937abbd56ee","resolution":{"observed_at":"2026-08-08T12:46:13.040422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:13.026701Z","title":"S., Nagrani, A., and Zisserman, A","venue":null,"work_id":"bd78cdf8-4789-4d2b-970a-4db0f3968a65","year":2018},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.015208Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:71e4ee05cfea2696c699105ddd319e842e0ff37bab5dfca58a77ebf609928c07","observation_id":"10622f6a-273b-455e-9a13-874523981cac","resolution":{"observed_at":"2026-08-08T12:46:13.030425Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:13.015717Z","title":"Unified scaling laws for routed language models","venue":null,"work_id":"e7dba224-2614-4fc4-9a87-60db94b52672","year":2022},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.019021Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:226c1d447f3fac7ebaa7fdcdb32e0e061a721ca1c7753e6627aec331b6b15d51","observation_id":"5e64d104-7cd0-4ae7-8d51-06a432a874d7","resolution":{"observed_at":"2026-08-08T12:46:13.019361Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:13.005038Z","title":"Stablemoe: Stable routing strategy for mixture of experts","venue":null,"work_id":"ba7847ca-2912-431f-b4a5-492e85885c4b","year":2022},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.022925Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:d87fef225dbf6de582603ab67ae8eb2a981ac67ff136cda8b04426d67b5e7646","observation_id":"5dd41cc2-e5c3-4328-aee0-e1070ad4bbc5","resolution":{"observed_at":"2026-08-08T12:46:13.008786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.994288Z","title":"A study of dropout-induced modality bias on robustness to missing video frames for audio-visual speech recognition","venue":null,"work_id":"4eca3ee2-f7e2-4f57-8fef-d24426900093","year":2024},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.027308Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:e689dbaf3a47cedce438aa0207554002762f82df5cfb62f9eaf0177747d48ac0","observation_id":"0405de2f-f8a3-485f-94b7-c584ad2fa1ec","resolution":{"observed_at":"2026-08-08T12:46:12.998388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.983954Z","title":"and Luettin, J","venue":null,"work_id":"44d77559-51c0-4a51-a63a-910954d1f182","year":2000},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.031328Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:78e7790f7c975dd184a1a69e06a148d545f51e9c91d55c2565b8f9f9d37e732a","observation_id":"5fa66c23-3834-481f-b695-ae71b99e2503","resolution":{"observed_at":"2026-08-08T12:46:12.987504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.973572Z","title":"W., and Matt, P","venue":null,"work_id":"d9b6c46a-1cfd-4a93-bd59-f29784b4a03a","year":2021},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.035295Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:684445dd042131ce0765f62bf76c090db9ca050c04ca7d6017a8cefa1e99a8d9","observation_id":"54992c07-7d83-4e18-8e1b-8fd801d9fcd0","resolution":{"observed_at":"2026-08-08T12:46:12.977185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.039182Z","title":"Switch transformers: Scaling to trillion parameter models with simple and efficient sparsity","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.039182Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:10e78ad1a512a0bcc93e09685686c0f414155e558da85ea928e4bab82fe03a59","observation_id":"eb738fe9-acd8-45a5-8078-6693ed7466bd","resolution":{"observed_at":"2026-08-08T12:46:12.039182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.956144Z","title":"Boosting speech recognition robustness to modality-distortion with contrast-augmented prompts","venue":null,"work_id":"fe6e6e11-f5e1-419c-a1a3-0248e0655162","year":2024},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.043299Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:fd0346e968dbae37033ec95ca36c4cfac9969b8555e62346ba028f21c0d6e226","observation_id":"b727f062-e417-4fa9-9016-14e32e64f9ff","resolution":{"observed_at":"2026-08-08T12:46:12.959944Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.945931Z","title":"Conformer: Convolution-augmented transformer for speech recognition","venue":null,"work_id":"27306669-9611-49f6-afd4-1f59f70d75da","year":2020},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.047254Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:39ed4f25e5bd7cd53cc6ebd16e056d0a6c0edf359112eeb71a1442b339a6130c","observation_id":"96a8fece-b9ff-4f10-ac66-9350ea481c97","resolution":{"observed_at":"2026-08-08T12:46:12.949631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-08T12:46:12.051209Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.051209Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:3de3f2b55420ee24ee3056ecda75fff38e4782f0e23465047d30321525e7cddb","observation_id":"0386b6f4-63c0-4444-8e36-a72ec75d3e59","resolution":{"observed_at":"2026-08-08T12:46:12.051209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.934702Z","title":"Jointly learning visual and auditory speech representations from raw data","venue":null,"work_id":"121aa5e4-6639-4239-8663-a4fa38ef8ed7","year":2023},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.055256Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:65baf7ab8b047865071f8f9d45b33d4bb0b46ecf9ee64040122c4f85ff6e1562","observation_id":"6f54ce98-8b96-4709-a4c5-b81514cd5cea","resolution":{"observed_at":"2026-08-08T12:46:12.938761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.923772Z","title":"Braven: Improving self-supervised pre-training for visual and auditory speech recognition","venue":null,"work_id":"93fdfc9e-3c2b-498a-826b-be08cb890140","year":2024},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.059701Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:9bfd2989d63bd1f48605cb55fe625f37be83ca313ffb7b8bacde6c01dd8b6342","observation_id":"55a73f4d-4585-42da-9190-fea994ad50c4","resolution":{"observed_at":"2026-08-08T12:46:12.927405Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.913560Z","title":"XLAVS - R : Cross-lingual audio-visual speech representation learning for noise-robust speech perception","venue":null,"work_id":"6933b799-0118-4429-82c9-b195c9886339","year":2024},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.063242Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:b3cc241a94991088f35d529752965cb041dce7925bc1ca816c0a61db12ee5ceb","observation_id":"d65721a7-5e49-4b3c-9e82-243a295f819e","resolution":{"observed_at":"2026-08-08T12:46:12.917268Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.903301Z","title":null,"venue":null,"work_id":"5ca453fb-0be5-4ca7-b6ac-6d9b4540700c","year":2022},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.067010Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:0f1abaf8b946c5b12c8c48a3169ddbc0447b5f31563d889e0c174c565f366352","observation_id":"9c4f2e9f-e739-4545-a79d-fa40926bb734","resolution":{"observed_at":"2026-08-08T12:46:12.906730Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.893157Z","title":null,"venue":null,"work_id":"b9225993-61ef-4e82-97a6-29341071ff9d","year":2023},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.071089Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:807e3bf118ecef42504a350317603b528310fe18edfdabb9e86d52727b829cb2","observation_id":"1dd6c8d1-c13f-468b-987a-f6e4568ca8da","resolution":{"observed_at":"2026-08-08T12:46:12.896616Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.882680Z","title":"and Shi, B","venue":null,"work_id":"8a3f47a3-0d8e-4ecf-bfad-42dda7661744","year":2022},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.074951Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:425783c35880fc0b4d8de500d4d16390a2c5473cd2fe3339b2bd98b215fe313c","observation_id":"3875f7e9-9ea6-48d8-bd22-2b184af8a91f","resolution":{"observed_at":"2026-08-08T12:46:12.886581Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.078580Z","title":"H., Lakhotia, K., Salakhutdinov, R., and Mohamed, A","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.078580Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:47d10ef0f2ceb3fd7b86e2e9981ea125d93cea9d02420cef7b4174f5e7e2a3e2","observation_id":"ac8f7845-fe02-42d2-83cf-0fa56b0f684d","resolution":{"observed_at":"2026-08-08T12:46:12.078580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.866416Z","title":"N., Zhang, Y., and Beaufays, F","venue":null,"work_id":"3f29a441-ce40-4176-9673-8760d9e7fb5c","year":2023},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.082306Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:f392d7dececd5ef52c1c8f0964177d58f8e07a4441cbdc6895cca3f94b8769ca","observation_id":"6f6de3fe-b46c-4d9f-9d0c-4bcc01d00591","resolution":{"observed_at":"2026-08-08T12:46:12.869924Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.856215Z","title":null,"venue":null,"work_id":"78dc415d-7e06-4612-9ea5-cd001138ba5f","year":2023},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.085973Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:8a19117a7a6075f95150414645d7ee32bef865286d45383c089286183d5d9a16","observation_id":"976eb8dc-4005-4619-8d18-2970d5df3951","resolution":{"observed_at":"2026-08-08T12:46:12.859640Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.846148Z","title":null,"venue":null,"work_id":"645f824d-50ee-4c9d-9316-500da556fa18","year":2023},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.089684Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:1022eb379872dd33a8a3d0b397f6f3ed20c4228dfe32e5614b530c2b46aebed4","observation_id":"8bddd93f-c46e-47c0-93bc-95c37467a604","resolution":{"observed_at":"2026-08-08T12:46:12.849510Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.836205Z","title":null,"venue":null,"work_id":"5bc2a227-991a-42c8-9af8-c515fcf8ffc3","year":2023},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.093433Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:9f9fd9f5ed37836ada5ffb186cfe3196e3134c42556212d3261976b4ecfa7ab9","observation_id":"3cc7802d-eaff-464b-b122-a172b1f036fb","resolution":{"observed_at":"2026-08-08T12:46:12.839686Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.097176Z","title":"A., Jordan, M","venue":null,"work_id":null,"year":1991},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.097176Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:237c566382a6b8f35c1e840ff3a59675671f865dc226f9454b1274ab20ada3bb","observation_id":"83791601-00d5-48e6-b597-166a6fcf1351","resolution":{"observed_at":"2026-08-08T12:46:12.097176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-08T06:16:25.839566Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-08T12:46:12.100811Z","title":"Q., Sablayrolles, A., Roux, A., Mensch, A., Savary, B., Bamford, C., Chaplot, D","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.100811Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:21517341edcdec8a247c0c529ea7dc39ee656101c97e0701ff35a701d65560be","observation_id":"9c769899-7176-4dfd-a205-9ec91ae2553b","resolution":{"observed_at":"2026-08-08T12:46:12.100811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.820824Z","title":null,"venue":null,"work_id":"08d323dd-d149-4701-a8a1-76a3734d8af2","year":1994},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.104768Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:7bc1fc30241e98ff8c073d8efb56a338fd5adbef8bf7b963e55bfe0fb828c6b0","observation_id":"1b155f64-0f2f-48f0-9979-835e89202665","resolution":{"observed_at":"2026-08-08T12:46:12.824050Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-08T12:46:12.108410Z","title":"B., Chess, B., Child, R., Gray, S., Radford, A., Wu, J., and Amodei, D","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.108410Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:3e7d5807fab069edf14626c4205914d3ff679898d30dae65e5895a8dc2b22dbd","observation_id":"3c730175-c11c-4cf6-8f99-b4b2550e4145","resolution":{"observed_at":"2026-08-08T12:46:12.108410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.810597Z","title":"Learning video temporal dynamics with cross-modal attention for robust audio-visual speech recognition","venue":null,"work_id":"813caa11-fa7c-47e7-be52-b6e05b466978","year":2024},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.112122Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:150ecbaf0091d639e6abd8adb8c14ffe8bbbe5e76e5a35acbfdb5b2f18327d1d","observation_id":"f9ba568c-e35b-46a9-a66d-5c63c2c32c62","resolution":{"observed_at":"2026-08-08T12:46:12.814744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.800681Z","title":"Multi-task corrupted prediction for learning robust audio-visual speech representation","venue":null,"work_id":"9ff1bb00-b662-4a15-96c9-4b6822b4ad59","year":2025},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.115892Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:7806dbe72443cd822e1e7d1f39af2bb0d31c5862d114eaed08ecc68631d732f9","observation_id":"eb92f129-9c51-4e93-9443-b911ae612b24","resolution":{"observed_at":"2026-08-08T12:46:12.804393Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-08T12:46:12.119735Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.119735Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:0509d5e1ac159171ab629f523b115c1152e69d01ec6f2b21ee83cc2ae735a278","observation_id":"e50f65bf-d38b-4a7a-95f0-414b568881b1","resolution":{"observed_at":"2026-08-08T12:46:12.119735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.790602Z","title":"Moai: Mixture of all intelligence for large language and vision models","venue":null,"work_id":"0fb1ad58-e12a-4155-adb5-6fb87654d75b","year":2025},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.123375Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:03c356141e8e75ea17f1bc3801a1c68c2329f3c4c18769604d2cd21c77e0167f","observation_id":"9d557243-3fe3-4ea7-a398-006108a0781c","resolution":{"observed_at":"2026-08-08T12:46:12.794162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.779411Z","title":"\\ GS \\ hard: Scaling giant models with conditional computation and automatic sharding","venue":null,"work_id":"ae0bdc10-c414-4fdc-aa71-76cfd3b091b0","year":2021},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.127007Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:3bf846b859920e87ebf69d4d9c320f94b476b5a00a407c43a785ac71faad7d9d","observation_id":"ba99a6f1-d267-4102-9903-c77f037e8c06","resolution":{"observed_at":"2026-08-08T12:46:12.783255Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.769127Z","title":"Unified cross-modal attention: Robust audio-visual speech recognition and beyond","venue":null,"work_id":"abbb2e0f-5175-413f-8829-f61421fa1446","year":1941},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.130698Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:f6435da26820e553e7dda3e273e799122cfcc6e35fd9735bcd93c85dca6d81a2","observation_id":"3ad298ad-4c4a-4eb7-b2e3-256862aa31fd","resolution":{"observed_at":"2026-08-08T12:46:12.772919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.758454Z","title":"Pace: Unified multi-modal dialogue pre-training with progressive and compositional experts","venue":null,"work_id":"ca9da1cc-1616-4972-a0c0-91e96e5195b8","year":2023},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.134232Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:fc8dd463bd72c557868c29b4df9f9df6dece51a614ed94fad784f359349456a4","observation_id":"982ffbce-c590-48c5-981d-0ec2a7725ecf","resolution":{"observed_at":"2026-08-08T12:46:12.762175Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11273","last_updated":"2024-05-18T12:16:01Z","snapshot_observed_at":"2026-08-03T11:46:26.153374Z","submitted_at":"2024-05-18T12:16:01Z","title":"Uni-MoE: Scaling Unified Multimodal LLMs with Mixture of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.11273","snapshot_observed_at":"2026-08-08T12:46:12.137924Z","title":"Uni-moe: Scaling unified multimodal llms with mixture of experts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.137924Z"},"links":{"cited_paper":"/paper/2405.11273","citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:f87d768dec7c2a742ce97e93cc01a2cb5c96e4f5ed43c9ce28ec11af50078a67","observation_id":"7ee4fd34-f493-45cf-93ec-be559e2e05e9","resolution":{"observed_at":"2026-08-08T12:46:12.137924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.747102Z","title":"Av-data2vec: Self-supervised learning of audio-visual speech representations with contextualized target representations","venue":null,"work_id":"4159aee6-7a34-4deb-b0c4-e8e4ab389009","year":2023},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.141733Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:c42e55c06d9a426433735d13cb4fb5a805f95f96ae3596a0661ae9c7c53cba5b","observation_id":"2e1e6b9f-0e75-4527-98d2-32b203226ecd","resolution":{"observed_at":"2026-08-08T12:46:12.750980Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.15947","last_updated":"2024-12-23T08:05:14Z","snapshot_observed_at":"2026-08-06T02:31:58.372974Z","submitted_at":"2024-01-29T08:13:40Z","title":"MoE-LLaVA: Mixture of Experts for Large Vision-Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.15947","snapshot_observed_at":"2026-08-08T12:46:12.145504Z","title":"Moe-llava: Mixture of experts for large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.145504Z"},"links":{"cited_paper":"/paper/2401.15947","citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:0ef90be324ea6b8979a7d6c8f9b49191a65886d6db582932e7c813035826b4af","observation_id":"4d5394ea-e862-476a-9d68-7db199733b31","resolution":{"observed_at":"2026-08-08T12:46:12.145504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.736879Z","title":"W., and Pantic, M","venue":null,"work_id":"d85a7e63-6142-4a38-a3dc-9ba8d1a233fd","year":2021},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.149611Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:174da275b123a278cdf0980779731dbba867b587f742fc022a91f3be6103aaa5","observation_id":"76554e89-2cc7-415b-9f11-c51a54917429","resolution":{"observed_at":"2026-08-08T12:46:12.740438Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.726150Z","title":"End-to-end audio-visual speech recognition with conformers","venue":null,"work_id":"53194c80-d777-45dd-acbd-f20828e21144","year":2021},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.153350Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:4778471c8417b4201851167cf4ffdbed3f0e9275ef58f0193de29c5e72cccc90","observation_id":"decb22d6-5180-42cb-b35a-4c68ea23fd0b","resolution":{"observed_at":"2026-08-08T12:46:12.730261Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.715060Z","title":"Auto-avsr: Audio-visual speech recognition with automatic labels","venue":null,"work_id":"425af32e-3e00-4664-9aac-54b4ba8e1ca6","year":2023},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.156880Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:318e37a145503f4137870447067d4906d5ceb7af2d751e6b5330e106b7079fc5","observation_id":"b6e30b98-4524-45fd-ba64-55921ab1de61","resolution":{"observed_at":"2026-08-08T12:46:12.719069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.704126Z","title":"Recurrent neural network transducer for audio-visual speech recognition","venue":null,"work_id":"f461c1ff-9f53-4c2b-b1d1-26faaca1f5e0","year":2019},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.160528Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:c2127e274f0aa0f88bc182dbcc5ddab85a76b3a0ab615c2ddda01ed745f85d19","observation_id":"7a4dd371-89e0-49d0-8b75-82ee9dfb957c","resolution":{"observed_at":"2026-08-08T12:46:12.707947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.693081Z","title":"Mm1: methods, analysis and insights from multimodal llm pre-training","venue":null,"work_id":"175f7534-e7da-48ad-be26-f8e3a1788eec","year":2025},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.164169Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:b79fd099c2a644d8cb7699a97423534cf0d30bf6eff539b67f634f64a3bb9f27","observation_id":"40f518dc-ba49-4251-969c-5dbce41495e0","resolution":{"observed_at":"2026-08-08T12:46:12.696792Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.682308Z","title":"Multimodal contrastive learning with limoe: the language-image mixture of experts","venue":null,"work_id":"45777144-c50b-48fd-a706-be0ca53a96c7","year":2022},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.167622Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:02a1623760819da88456ae230bce85764c8c336b9f73cfadc8b3d0f50590a472","observation_id":"736a4236-703c-4be2-8c3b-53dfb9d93e9c","resolution":{"observed_at":"2026-08-08T12:46:12.686160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.672089Z","title":"G., and Ogata, T","venue":null,"work_id":"a7cc28c9-10eb-4616-b997-7ec82de8d138","year":2015},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.171272Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:236ca08d1f5ada624e535e43cb7608e11620a5dfcb7b151c8e7cdb61b6be24e8","observation_id":"262ab514-50ef-47a2-abb3-201a5b8f83c8","resolution":{"observed_at":"2026-08-08T12:46:12.675558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.661378Z","title":"Leveraging unimodal self-supervised learning for multimodal audio-visual speech recognition","venue":null,"work_id":"70573e34-a2df-47b6-b22a-24acd21d076c","year":2022},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.174871Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:cf7b9e13b8ff285de23dd082f1241826c780b41795a56c1f5c49560627cc8138","observation_id":"a554eb4e-ae2a-4261-95fa-43ec6a0329ce","resolution":{"observed_at":"2026-08-08T12:46:12.665127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.179726Z","title":"Bleu: a method for automatic evaluation of machine translation","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.179726Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:282d01bd1d6cc4386ebe72bb929e50e7c237b686795adcdbdbbb800de4b28c95","observation_id":"3a623aaa-0e13-431f-8564-fb3387ff6617","resolution":{"observed_at":"2026-08-08T12:46:12.179726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.645017Z","title":"A call for clarity in reporting bleu scores","venue":null,"work_id":"e7c40e3c-ba6e-4ed6-81d3-8c140d6a51be","year":2018},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.183249Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:4c21b4fd92b24f3e2f5573b996bf06429adbaa520f953310ae4af4b52321cd85","observation_id":"7c91ae05-3531-44c0-99b7-4a1e6ee84503","resolution":{"observed_at":"2026-08-08T12:46:12.648936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.634688Z","title":"Lipsound2: Self-supervised pre-training for lip-to-speech reconstruction and lip reading","venue":null,"work_id":"bf482a2d-7d9a-4b47-b720-ca5ad4e9848a","year":2022},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.186969Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:bbf8045ae415faccd50d132adbbed5c261b4a2d3c4269c10c854ff86bbedee74","observation_id":"faf4f2ff-e926-49b8-9ebe-e85bfd014e25","resolution":{"observed_at":"2026-08-08T12:46:12.638468Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.190741Z","title":"W., Xu, T., Brockman, G., McLeavey, C., and Sutskever, I","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.190741Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:2299960a97c451038f51c60767d82fe38cecccc559fa0c007d1fc196a06cf73a","observation_id":"1b11b7af-4db4-4e2b-92e6-e9953ef6fad7","resolution":{"observed_at":"2026-08-08T12:46:12.190741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.618392Z","title":"Learning from the master: Distilling cross-modal advanced knowledge for lip reading","venue":null,"work_id":"cb7233c8-b9d8-4ad3-a7b6-1013d433501f","year":2021},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.194385Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:a118d87cf7f1cd2b7f5644cd3d509322a74b887eecf7d12b3973f9f9ee206b0f","observation_id":"9e558eeb-03d6-4dde-9b12-1e0885aa2506","resolution":{"observed_at":"2026-08-08T12:46:12.622031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.607839Z","title":"wav2vec: Unsupervised pre-training for speech recognition","venue":null,"work_id":"0c5e8f5f-17dd-46f1-be73-567124897a72","year":2019},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.197809Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:537181fe98b22916bbd12413d01eb2e598c1d8150997d5f662465095b2227e01","observation_id":"e5f9b8f4-3539-49df-ba88-92dbcfee486b","resolution":{"observed_at":"2026-08-08T12:46:12.611683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.596869Z","title":"H., Nagrani, A., and Schmid, C","venue":null,"work_id":"26ca37fa-47b3-498b-9da8-3ace837b860d","year":2023},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.201418Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:93fba0fcf67e460f9f8a93b7efe38028ac4a50eda77ae5ea2e223b4656272e4e","observation_id":"e6fe91de-707b-404d-b25d-68d2f3a1f931","resolution":{"observed_at":"2026-08-08T12:46:12.600769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.586067Z","title":"Outrageously large neural networks: The sparsely-gated mixture-of-experts layer","venue":null,"work_id":"0629b808-8efb-4e86-b4c4-db5b2afbd493","year":2017},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.204937Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:16a1bb9d6c30ffc7d17ac5e19382b7b0d33c050a656071a0250a2fee8c5feefa","observation_id":"93c99fbf-3002-4c1e-bd85-c855be4c7cd0","resolution":{"observed_at":"2026-08-08T12:46:12.589682Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.575572Z","title":"Scaling vision-language models with sparse mixture of experts","venue":null,"work_id":"b8fdb693-23f7-4dbb-8bca-43cf70944b22","year":2023},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.208750Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:4a51f1afd163c4b502289d60df426d3069016d1180ef80a50570cd6d42474faa","observation_id":"698d2898-de93-452b-a09a-31664d927a91","resolution":{"observed_at":"2026-08-08T12:46:12.579332Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.563085Z","title":"Learning audio-visual speech representation by masked multimodal cluster prediction","venue":null,"work_id":"8a2b637d-3e4c-421e-aaef-149e9f0d27cb","year":2022},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.212277Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:985e3a32843ecf6623101e148d3656885a6293bc565560f50a8212e4782de8d5","observation_id":"761244b3-694b-40ea-b43e-498b303e25b9","resolution":{"observed_at":"2026-08-08T12:46:12.567388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.552649Z","title":"Robust self-supervised audio-visual speech recognition","venue":null,"work_id":"42850ad5-6f79-4686-8263-d96f0370d66e","year":2022},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.215914Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:1bf49c10c7d5d7344a9ee19b4b2f12e9bbffd22413663cef554155f49ff75e63","observation_id":"6455672e-f8dc-4faa-beec-aee8ca7f209d","resolution":{"observed_at":"2026-08-08T12:46:12.556400Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1510.08484","last_updated":"2015-10-28T20:59:04Z","snapshot_observed_at":"2026-07-06T04:34:36.474437Z","submitted_at":"2015-10-28T20:59:04Z","title":"MUSAN: A Music, Speech, and Noise Corpus","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1510.08484","snapshot_observed_at":"2026-08-08T12:46:12.219928Z","title":"Musan: A music, speech, and noise corpus","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.219928Z"},"links":{"cited_paper":"/paper/1510.08484","citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:8fc71638f096d345708d5111126b7cefa4a74e41d69ae06b6b75d7156cfa75e5","observation_id":"e469726c-a996-4160-b4cf-4052afa9dfe9","resolution":{"observed_at":"2026-08-08T12:46:12.219928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.223984Z","title":"The diverse environments multi-channel acoustic noise database (demand): A database of multichannel environmental noise recordings","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.223984Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:dd6d25f075e8ec19227384b5bed62916cc86e894c4270718b011c334ab501cfb","observation_id":"ea26ca4a-a117-4a82-87d1-9e3eb8a279eb","resolution":{"observed_at":"2026-08-08T12:46:12.223984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.227915Z","title":"N., Kaiser, ., and Polosukhin, I","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.227915Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:d95f02bbe176eb6c56e783f522e6b017dcf26f23621edbc6f2509e0bb0eb6c8d","observation_id":"70e6dd0a-b44f-498d-b5c3-5266d235f667","resolution":{"observed_at":"2026-08-08T12:46:12.227915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.530637Z","title":"T., and Li, H","venue":null,"work_id":"179d2738-77c9-4e6a-b90a-b94c49c01127","year":2024},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.231696Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:bfcfa3187750b4c773613cf9df9a6fbe195b1d60e03e12ae1b864c9fda5a2693","observation_id":"683256ca-aa77-47d4-9a5f-4f8c754714e0","resolution":{"observed_at":"2026-08-08T12:46:12.534091Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.520395Z","title":"Language-routing mixture of experts for multilingual and code-switching speech recognition","venue":null,"work_id":"0bc287d8-ad31-4f41-bb91-5b161573fcb1","year":2023},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.235459Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:40ea58c90a77037b0e3a2ae90d17042aebc9cd388cab28c7e1fde1af3882a7db","observation_id":"1e95febc-e8b0-4589-b53d-916f1e2398be","resolution":{"observed_at":"2026-08-08T12:46:12.524068Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.510167Z","title":"R., and Hayashi, T","venue":null,"work_id":"b0f59742-c4c9-4daf-a924-3783450ba091","year":2017},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.239453Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:ca6cecd7c1910d250c03bfd02e10111479464b58dd369920841dab537668eb27","observation_id":"555f1a1d-5da3-4299-9a20-b307e07dc4fe","resolution":{"observed_at":"2026-08-08T12:46:12.513677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.500112Z","title":"Robust audiovisual speech recognition models with mixture-of-experts","venue":null,"work_id":"45e05cd7-0ff8-4273-b703-560d6d70b9b7","year":2024},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.243307Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:61eb5594cd401d49b1343461aaef320c495e41b29acc3e6372fa5c4ea34a22d2","observation_id":"962a535d-9a14-443b-9c67-34f771193ca1","resolution":{"observed_at":"2026-08-08T12:46:12.503834Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.486561Z","title":"Speechmoe: Scaling to large acoustic models with dynamic routing mixture of experts","venue":null,"work_id":"55029c6b-5162-45c9-81f1-de47c92c0b5e","year":2021},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.246899Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:9b236567503a71238b85e8311f4dc4e4700f999d43af97023355b74c6415a3d7","observation_id":"3584682c-30ff-4622-9c96-728984916f11","resolution":{"observed_at":"2026-08-08T12:46:12.492396Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.472877Z","title":"Speechmoe2: Mixture-of-experts model with improved routing","venue":null,"work_id":"56f037e2-a013-4664-ad08-8f9818561aff","year":2022},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.250437Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:e0f41b46071dd739b784b824e5c7437b6344dc61870d3e89c255328ec7a48d63","observation_id":"d8f1c0d4-9dd2-4fcb-81c8-501a463e55d6","resolution":{"observed_at":"2026-08-08T12:46:12.477707Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.460686Z","title":"Visual hallucination elevates speech recognition","venue":null,"work_id":"b6e4adab-29d1-443a-96de-30cdfd0cb92e","year":2024},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.253960Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:ae415843a1f66b949e788d5531b9e93b3b7288bdfd667589027b913a18081d59","observation_id":"08b33f54-e9a5-4b79-b0ed-562a83643f94","resolution":{"observed_at":"2026-08-08T12:46:12.464533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.448870Z","title":"Self-supervised audio-visual speech representations learning by multimodal self-distillation","venue":null,"work_id":"28c340d5-9c3d-4615-b32f-261309a40667","year":2023},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.257656Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:935d5342c4ef5f9efe854ee6a3607b9c3aa769e275993a87a8c4603107da0853","observation_id":"5b13026c-fa99-4c0d-970f-b9f68f4aff78","resolution":{"observed_at":"2026-08-08T12:46:12.453215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.435144Z","title":"Uni-perceiver-moe: Learning sparse generalist models with conditional moes","venue":null,"work_id":"50bcfac2-156b-4a78-8eb1-38a7372e295c","year":2022},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.261199Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:9e1c4e98d6b94aeb8650a7f3efbba552358e3185d5f710a8fa7b7aa7b9006fe0","observation_id":"3515f5d7-0b53-4273-bafd-96cd12610c8b","resolution":{"observed_at":"2026-08-08T12:46:12.440286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.417656Z","title":"Vatlm: Visual-audio-text pre-training with unified masked prediction for speech representation learning","venue":null,"work_id":"74907657-5bf6-4dc8-940b-6d79088635b5","year":2023},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.264765Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:8ad1712edecc9bae7be4c8829d552bcaedb21eb401abda5ce1bb8a0bf1689f78","observation_id":"0a2625e8-12f8-4dad-8059-86cde6accefa","resolution":{"observed_at":"2026-08-08T12:46:12.425112Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-08-08T12:46:12.269019Z","title":"St-moe: Designing stable and transferable sparse expert models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.269019Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:d6dc5c91be047e02fefa60e2e5f1d103511c257e2493d8832de1d4c3c157770f","observation_id":"b3cea8a1-ca54-4a16-b6fc-d1420e753587","resolution":{"observed_at":"2026-08-08T12:46:12.269019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","latest_version":2,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition"},"reference_resolution":{"displayed":84,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":0,"verified_fuzzy":53},"total_outbound_references":84},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 84 of 84 outbound references and 1 inbound Pith citation observation for arXiv:2502.10447."}