{"as_of":"2026-08-16T10:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1f7f92abc0b3a6e04c9777f81178f7916b920fb2f27467a5d592a0b901cfa0f1","coverage":[{"denominator":58,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":58,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T18:08:19.017587Z","state":"measured"},{"denominator":59,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":59,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T17:45:51.528645Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T06:11:01.750278Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.19037","last_updated":"2025-07-25T07:46:40Z","snapshot_observed_at":"2026-08-15T18:00:09.179106Z","submitted_at":"2025-07-25T07:46:40Z","title":"MLLM-based Speech Recognition: When and How is Multimodality Beneficial?","version":1},"cited_work":{"arxiv_id":"2507.19037","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.19037","snapshot_observed_at":"2026-08-10T01:09:09.297559Z","title":null,"venue":null,"work_id":"bff52d6e-d690-45f0-8010-7856868cc901","year":2025},"citing_paper":{"arxiv_id":"2604.08209","last_updated":"2026-04-09T13:09:40Z","snapshot_observed_at":"2026-08-15T05:04:48.579203Z","submitted_at":"2026-04-09T13:09:40Z","title":"OmniJigsaw: Enhancing Omni-Modal Reasoning via Modality-Orchestrated Reordering","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T17:45:51.528645Z"},"links":{"cited_paper":"/paper/2507.19037","citing_paper":"/paper/2604.08209"},"observation_digest":"sha256:5e9861aad6cf46567a53862cfcacaa4ebe3ad59629d55c54f8778d10d0d1a911","observation_id":"19493417-f083-4e90-ac6b-3d3122752e56","resolution":{"observed_at":"2026-08-10T01:09:09.297559Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.19037/citation-record","integrity":"/paper/2507.19037/integrity","json":"/paper/2507.19037/citation-record.json","paper":"/paper/2507.19037"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2409.09221","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:08:19.308469Z","title":"Multi- modal speech transformer decoders: When do multiple modalities improve accuracy?","venue":null,"work_id":"908b20d5-63f4-43a8-9d80-f79eb80f6f71","year":2024},"citing_paper":{"arxiv_id":"2507.19037","last_updated":"2025-07-25T07:46:40Z","snapshot_observed_at":"2026-08-15T18:00:09.179106Z","submitted_at":"2025-07-25T07:46:40Z","title":"MLLM-based Speech Recognition: When and How is Multimodality Beneficial?","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T18:08:18.766507Z"},"links":{"citing_paper":"/paper/2507.19037"},"observation_digest":"sha256:a556e4d37be3c2b475822ad2c4f3594787d73f2e74c993d9e3df7cbda74d0bf7","observation_id":"c3e573cf-65f3-49a9-b1e5-55b9c13ca43f","resolution":{"observed_at":"2026-08-15T18:08:19.315717Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-08-15T18:08:18.771390Z","title":"Gem- ini 2.5: Pushing the frontier with advanced reasoning, multimodality, long context, and next generation agentic capabilities,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.19037","last_updated":"2025-07-25T07:46:40Z","snapshot_observed_at":"2026-08-15T18:00:09.179106Z","submitted_at":"2025-07-25T07:46:40Z","title":"MLLM-based Speech Recognition: When and How is Multimodality Beneficial?","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T18:08:18.771390Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2507.19037"},"observation_digest":"sha256:d32e4db7017f93a6eef3d5b941b86c411dba59d7b130f39a71cbde15a3a536c4","observation_id":"f90e351b-e603-4ff9-9c94-b1c93912ee2a","resolution":{"observed_at":"2026-08-15T18:08:18.771390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:08:19.822573Z","title":"Next-gpt: Any-to-any multimodal llm,","venue":null,"work_id":"70e9cb4f-5efc-4f3a-a007-6fa898858707","year":2024},"citing_paper":{"arxiv_id":"2507.19037","last_updated":"2025-07-25T07:46:40Z","snapshot_observed_at":"2026-08-15T18:00:09.179106Z","submitted_at":"2025-07-25T07:46:40Z","title":"MLLM-based Speech Recognition: When and How is Multimodality Beneficial?","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T18:08:18.775950Z"},"links":{"citing_paper":"/paper/2507.19037"},"observation_digest":"sha256:b6e6b5be2f9f8ab2d124267e00f216d20aac35b50205ac52f66e3617470477c7","observation_id":"21ea53f2-f7e7-40b5-b809-13cb0a4817f0","resolution":{"observed_at":"2026-08-15T18:08:19.826497Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13145","last_updated":"2025-03-18T07:02:33Z","snapshot_observed_at":"2026-08-14T12:06:44.634346Z","submitted_at":"2025-02-18T18:59:57Z","title":"Multimodal Mamba: Decoder-only Multimodal State Space Model via Quadratic to Linear Distillation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13145","snapshot_observed_at":"2026-08-15T18:08:18.780134Z","title":"Multimodal mamba: Decoder-only multimodal state space model via quadratic to linear distillation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.19037","last_updated":"2025-07-25T07:46:40Z","snapshot_observed_at":"2026-08-15T18:00:09.179106Z","submitted_at":"2025-07-25T07:46:40Z","title":"MLLM-based Speech Recognition: When and How is Multimodality Beneficial?","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T18:08:18.780134Z"},"links":{"cited_paper":"/paper/2502.13145","citing_paper":"/paper/2507.19037"},"observation_digest":"sha256:5ca59cd736fde50aff0801c7464cb72d27c9c957c7ecf5f276361ffae7449832","observation_id":"b42e5b2e-62da-443f-88ee-1b53fa616297","resolution":{"observed_at":"2026-08-15T18:08:18.780134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06582","last_updated":"2024-06-25T17:44:00Z","snapshot_observed_at":"2026-08-16T06:56:30.639234Z","submitted_at":"2024-06-04T20:08:25Z","title":"Discrete Multimodal Transformers with a Pretrained Large Language Model for Mixed-Supervision Speech Processing","version":2},"cited_work":{"arxiv_id":"2406.06582","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.06582","snapshot_observed_at":"2026-08-15T18:08:19.187831Z","title":"Discrete Multimodal Transformers with a Pretrained Large Language Model for Mixed-Supervision Speech Processing","venue":"cs.CL","work_id":"51d8cdcc-7110-4988-a3ab-d3deb376c44b","year":2024},"citing_paper":{"arxiv_id":"2507.19037","last_updated":"2025-07-25T07:46:40Z","snapshot_observed_at":"2026-08-15T18:00:09.179106Z","submitted_at":"2025-07-25T07:46:40Z","title":"MLLM-based Speech Recognition: When and How is Multimodality Beneficial?","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T18:08:18.784896Z"},"links":{"cited_paper":"/paper/2406.06582","citing_paper":"/paper/2507.19037"},"observation_digest":"sha256:f291f892b6414639d5e90b28d94315f85d8db6cee39ddf4700729251c8590ed9","observation_id":"3f8cdab4-09ad-4202-a4bb-e82f7aad9105","resolution":{"observed_at":"2026-08-15T18:08:19.194368Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:08:19.809113Z","title":"Exploring speech recognition, translation, and understanding with discret e speech units: A comparative study,","venue":null,"work_id":"ecc11de2-9cb7-4afb-a88f-3e4970dbdd38","year":2024},"citing_paper":{"arxiv_id":"2507.19037","last_updated":"2025-07-25T07:46:40Z","snapshot_observed_at":"2026-08-15T18:00:09.179106Z","submitted_at":"2025-07-25T07:46:40Z","title":"MLLM-based Speech Recognition: When and How is Multimodality Beneficial?","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T18:08:18.789458Z"},"links":{"citing_paper":"/paper/2507.19037"},"observation_digest":"sha256:e06d5a05bcc0c5612e44e26698238deda39ecda7ff1989c2b48b49bb1379b07d","observation_id":"1e7b3b71-36b7-492f-8ccf-44d5c78c4b62","resolution":{"observed_at":"2026-08-15T18:08:19.814059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:08:19.796170Z","title":"Speech recognition meets large language model: Benchmarking, models, and exploration,","venue":null,"work_id":"beba2ef8-5860-4c67-a16d-b967442bb862","year":2025},"citing_paper":{"arxiv_id":"2507.19037","last_updated":"2025-07-25T07:46:40Z","snapshot_observed_at":"2026-08-15T18:00:09.179106Z","submitted_at":"2025-07-25T07:46:40Z","title":"MLLM-based Speech Recognition: When and How is Multimodality Beneficial?","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T18:08:18.794719Z"},"links":{"citing_paper":"/paper/2507.19037"},"observation_digest":"sha256:9b9dfc7d751ed035182a3f54a599cc59e56f57de39233d90769216437cca97e5","observation_id":"a0b88f1b-85f6-4be0-b476-0c7d23eddc74","resolution":{"observed_at":"2026-08-15T18:08:19.801207Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:08:19.782558Z","title":"Hubert: Self- supervised speech representation learning by masked prediction of hidden units,","venue":null,"work_id":"6c564297-170c-4cc7-9ab0-7b77df2f9594","year":2021},"citing_paper":{"arxiv_id":"2507.19037","last_updated":"2025-07-25T07:46:40Z","snapshot_observed_at":"2026-08-15T18:00:09.179106Z","submitted_at":"2025-07-25T07:46:40Z","title":"MLLM-based Speech Recognition: When and How is Multimodality Beneficial?","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T18:08:18.799622Z"},"links":{"citing_paper":"/paper/2507.19037"},"observation_digest":"sha256:f3555dc753062c593a49e4aa0e5721e9d6784fe1418cd363da89535954804c75","observation_id":"678efdf9-8030-46c2-8235-4433d439abe0","resolution":{"observed_at":"2026-08-15T18:08:19.786852Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:08:19.770339Z","title":"A comprehensive review of multimodal large language models: Performance and challenges across different tasks,","venue":null,"work_id":"b81120da-87a1-4157-8b7c-1e3efa9db3f1","year":2024},"citing_paper":{"arxiv_id":"2507.19037","last_updated":"2025-07-25T07:46:40Z","snapshot_observed_at":"2026-08-15T18:00:09.179106Z","submitted_at":"2025-07-25T07:46:40Z","title":"MLLM-based Speech Recognition: When and How is Multimodality Beneficial?","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T18:08:18.803629Z"},"links":{"citing_paper":"/paper/2507.19037"},"observation_digest":"sha256:6d2d5a0d31f4c7cb1b2ada63ef248e2d123fa3c7422547dae156ec0a39ba3fc0","observation_id":"c7dd4b52-4a83-4b33-bfb7-190f8bcc8de3","resolution":{"observed_at":"2026-08-15T18:08:19.774604Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.04160","last_updated":"2023-05-22T02:37:02Z","snapshot_observed_at":"2026-08-13T11:47:54.095263Z","submitted_at":"2023-05-07T02:25:42Z","title":"X-LLM: Bootstrapping Advanced Large Language Models by Treating Multi-Modalities as Foreign Languages","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.04160","snapshot_observed_at":"2026-08-15T18:08:18.807653Z","title":"X-llm: Bootstrap- ping advanced large language models by treating multi- modalities as foreign languages,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.19037","last_updated":"2025-07-25T07:46:40Z","snapshot_observed_at":"2026-08-15T18:00:09.179106Z","submitted_at":"2025-07-25T07:46:40Z","title":"MLLM-based Speech Recognition: When and How is Multimodality Beneficial?","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T18:08:18.807653Z"},"links":{"cited_paper":"/paper/2305.04160","citing_paper":"/paper/2507.19037"},"observation_digest":"sha256:28d94d5eb1a7f940fcfa9c67192a0fc136d838d3b22292b894e9459334e7a4c7","observation_id":"913df5e4-5cd2-486e-8865-3de22a8503af","resolution":{"observed_at":"2026-08-15T18:08:18.807653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.11315","last_updated":"2025-06-05T05:58:37Z","snapshot_observed_at":"2026-08-07T17:04:15.408902Z","submitted_at":"2025-03-14T11:31:30Z","title":"MMS-LLaMA: Efficient LLM-based Audio-Visual Speech Recognition with Minimal Multimodal Speech Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.11315","snapshot_observed_at":"2026-08-15T18:08:18.812315Z","title":"Mms-llama: Efﬁcient llm-based audio-visual speech recognition with minimal multimodal speech tokens,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.19037","last_updated":"2025-07-25T07:46:40Z","snapshot_observed_at":"2026-08-15T18:00:09.179106Z","submitted_at":"2025-07-25T07:46:40Z","title":"MLLM-based Speech Recognition: When and How is Multimodality Beneficial?","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T18:08:18.812315Z"},"links":{"cited_paper":"/paper/2503.11315","citing_paper":"/paper/2507.19037"},"observation_digest":"sha256:a03bf65abc3d1581a2cadb848115af7edf61a180bcc980b7ee8e2498d813cf71","observation_id":"d24fb121-cf20-4d97-9c81-0863c290eca7","resolution":{"observed_at":"2026-08-15T18:08:18.812315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:08:19.755906Z","title":"Large lan- guage models are strong audio-visual speech recognition learners,","venue":null,"work_id":"5093205c-277e-44f4-8b1d-311555baad0d","year":2025},"citing_paper":{"arxiv_id":"2507.19037","last_updated":"2025-07-25T07:46:40Z","snapshot_observed_at":"2026-08-15T18:00:09.179106Z","submitted_at":"2025-07-25T07:46:40Z","title":"MLLM-based Speech Recognition: When and How is Multimodality Beneficial?","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T18:08:18.816674Z"},"links":{"citing_paper":"/paper/2507.19037"},"observation_digest":"sha256:b1a56c2b363e9243cc9f8ad12c5b3eb5b43100af4c1f2edadc1ee7614c07a0ca","observation_id":"07b3c3f9-e185-4528-8319-63a29e8699c4","resolution":{"observed_at":"2026-08-15T18:08:19.760517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:08:19.742883Z","title":"Watch or listen: Robust audio-visual speech recognition with visua l corruption modeling and reliability scoring,","venue":null,"work_id":"00292065-5f37-47a8-9f8f-dfbab2325b4d","year":2023},"citing_paper":{"arxiv_id":"2507.19037","last_updated":"2025-07-25T07:46:40Z","snapshot_observed_at":"2026-08-15T18:00:09.179106Z","submitted_at":"2025-07-25T07:46:40Z","title":"MLLM-based Speech Recognition: When and How is Multimodality Beneficial?","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T18:08:18.820439Z"},"links":{"citing_paper":"/paper/2507.19037"},"observation_digest":"sha256:cd3ad0ad54d4161bc15a97e2d0a00cbad42e04ced6bc976675d01d491eb400ad","observation_id":"0d0b914e-cf80-4843-919d-bcef5a4926cf","resolution":{"observed_at":"2026-08-15T18:08:19.747066Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:08:19.729508Z","title":"Large lan- guage models are efﬁcient learners of noise-robust speech recognition,","venue":null,"work_id":"1a61636d-ae05-4b9a-9c42-59d9f1cffc71","year":2024},"citing_paper":{"arxiv_id":"2507.19037","last_updated":"2025-07-25T07:46:40Z","snapshot_observed_at":"2026-08-15T18:00:09.179106Z","submitted_at":"2025-07-25T07:46:40Z","title":"MLLM-based Speech Recognition: When and How is Multimodality Beneficial?","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T18:08:18.824792Z"},"links":{"citing_paper":"/paper/2507.19037"},"observation_digest":"sha256:d9583306031698b82a9da29a8dd2b1dfd7bba087984788c5747c1c05a96d3541","observation_id":"d1e39b58-d6a1-443a-9657-d0a941bdac5f","resolution":{"observed_at":"2026-08-15T18:08:19.733800Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:08:19.715513Z","title":"Avatar: Un- constrained audiovisual speech recognition,","venue":null,"work_id":"9fe1e163-e2bb-4ea6-8270-cd8e3f4c6bc3","year":2022},"citing_paper":{"arxiv_id":"2507.19037","last_updated":"2025-07-25T07:46:40Z","snapshot_observed_at":"2026-08-15T18:00:09.179106Z","submitted_at":"2025-07-25T07:46:40Z","title":"MLLM-based Speech Recognition: When and How is Multimodality Beneficial?","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T18:08:18.829101Z"},"links":{"citing_paper":"/paper/2507.19037"},"observation_digest":"sha256:48e679886a82e625f749df4c5e7116425c4befef84d64ea942b8cc989838967d","observation_id":"07648979-b6d1-4176-bf51-4eba9e608b8a","resolution":{"observed_at":"2026-08-15T18:08:19.720447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:08:19.702954Z","title":"Mmger: Multi-modal and multi-granularity generative error correction with ll m for joint accent and speech recognition,","venue":null,"work_id":"748570f4-2ddc-4ebc-a0c2-5ab28254b2e9","year":2024},"citing_paper":{"arxiv_id":"2507.19037","last_updated":"2025-07-25T07:46:40Z","snapshot_observed_at":"2026-08-15T18:00:09.179106Z","submitted_at":"2025-07-25T07:46:40Z","title":"MLLM-based Speech Recognition: When and How is Multimodality Beneficial?","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T18:08:18.833367Z"},"links":{"citing_paper":"/paper/2507.19037"},"observation_digest":"sha256:696876b3ed207170f2bfa1972ce2b9c0c40192c314756c20d20e179a39304fe8","observation_id":"a779a849-e73d-4472-b0b9-d18e1f4b451c","resolution":{"observed_at":"2026-08-15T18:08:19.707244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:08:19.689732Z","title":"Mamba: Linear-time sequence mod- eling with selective state spaces,","venue":null,"work_id":"7322a097-f5f8-471e-aa5a-1092660f4c01","year":2023},"citing_paper":{"arxiv_id":"2507.19037","last_updated":"2025-07-25T07:46:40Z","snapshot_observed_at":"2026-08-15T18:00:09.179106Z","submitted_at":"2025-07-25T07:46:40Z","title":"MLLM-based Speech Recognition: When and How is Multimodality Beneficial?","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T18:08:18.837512Z"},"links":{"citing_paper":"/paper/2507.19037"},"observation_digest":"sha256:e06361cd8ba504372f88eb68d190f5b674f4c224dcf11c8d892c684797a19792","observation_id":"6cbf5381-b990-4157-ab70-8e85debd40f0","resolution":{"observed_at":"2026-08-15T18:08:19.694982Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:08:18.841709Z","title":"Improved baselines with visual instruction tuning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19037","last_updated":"2025-07-25T07:46:40Z","snapshot_observed_at":"2026-08-15T18:00:09.179106Z","submitted_at":"2025-07-25T07:46:40Z","title":"MLLM-based Speech Recognition: When and How is Multimodality Beneficial?","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T18:08:18.841709Z"},"links":{"citing_paper":"/paper/2507.19037"},"observation_digest":"sha256:cc0577b349ece5a589026deed675197f8394ec761d7bef6b0c29a23fed981ae2","observation_id":"9454dc90-f285-4674-9527-e0c0beed982c","resolution":{"observed_at":"2026-08-15T18:08:18.841709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-08-07T10:17:55.688598Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-15T18:08:18.845694Z","title":"Qwen-audio: Advanc- ing universal audio understanding via uniﬁed large-scale audio-language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.19037","last_updated":"2025-07-25T07:46:40Z","snapshot_observed_at":"2026-08-15T18:00:09.179106Z","submitted_at":"2025-07-25T07:46:40Z","title":"MLLM-based Speech Recognition: When and How is Multimodality Beneficial?","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T18:08:18.845694Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2507.19037"},"observation_digest":"sha256:bb1c40200a45fd70b3171e9d6a18352cabf3bb60801bb6fd5b407f1170a58e84","observation_id":"d51339a1-297b-4b06-8b8c-81d0a4500bdf","resolution":{"observed_at":"2026-08-15T18:08:18.845694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:08:19.669430Z","title":"Mm-interleaved: Interleaved image-text generative modeling via multi- modal feature synchronizer,","venue":null,"work_id":"d292faf6-7dcc-4162-86fb-0c9c1b465be2","year":2024},"citing_paper":{"arxiv_id":"2507.19037","last_updated":"2025-07-25T07:46:40Z","snapshot_observed_at":"2026-08-15T18:00:09.179106Z","submitted_at":"2025-07-25T07:46:40Z","title":"MLLM-based Speech Recognition: When and How is Multimodality Beneficial?","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T18:08:18.850564Z"},"links":{"citing_paper":"/paper/2507.19037"},"observation_digest":"sha256:69fa60192dcd2a5e54b35541d94b49c31579d043cea1b7ab2e70bc7ae3a31c98","observation_id":"d81f9b08-7c84-4b94-a780-d72efe7c4c06","resolution":{"observed_at":"2026-08-15T18:08:19.674964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:08:19.656258Z","title":"Transformers are ssms: Generalized IEEE TRANSACTIONS ON MULTIMEDIA, VOL. XXX, AUGUST 2021 10 models and efﬁcient algorithms through structured state space duality,","venue":null,"work_id":"7daf48a5-2272-4478-aa5f-8bc5a48d63c1","year":2021},"citing_paper":{"arxiv_id":"2507.19037","last_updated":"2025-07-25T07:46:40Z","snapshot_observed_at":"2026-08-15T18:00:09.179106Z","submitted_at":"2025-07-25T07:46:40Z","title":"MLLM-based Speech Recognition: When and How is Multimodality Beneficial?","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T18:08:18.856094Z"},"links":{"citing_paper":"/paper/2507.19037"},"observation_digest":"sha256:87dc7e1fd633aaf71d93c256589856b1411eca06b9f0176aec3cf22f29a515c0","observation_id":"aaf9ea8d-38c8-43ae-bf8b-257ce7e9322b","resolution":{"observed_at":"2026-08-15T18:08:19.660556Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:08:19.644919Z","title":"Cobra: Extending mamba to multi-modal large language model for efﬁcient inference,","venue":null,"work_id":"eb859b64-52bc-4110-bc63-ad410122b524","year":2025},"citing_paper":{"arxiv_id":"2507.19037","last_updated":"2025-07-25T07:46:40Z","snapshot_observed_at":"2026-08-15T18:00:09.179106Z","submitted_at":"2025-07-25T07:46:40Z","title":"MLLM-based Speech Recognition: When and How is Multimodality Beneficial?","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T18:08:18.860457Z"},"links":{"citing_paper":"/paper/2507.19037"},"observation_digest":"sha256:94e168cb8679a6c6420cc16515fe923ac004687cf8161230cf4ef70629ab2fad","observation_id":"6587fa31-2a7e-4651-b08e-900b35ef08b0","resolution":{"observed_at":"2026-08-15T18:08:19.648770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04722","last_updated":"2024-01-09T18:53:20Z","snapshot_observed_at":"2026-07-06T17:13:25.341853Z","submitted_at":"2024-01-09T18:53:20Z","title":"U-Mamba: Enhancing Long-range Dependency for Biomedical Image Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04722","snapshot_observed_at":"2026-08-15T18:08:18.864679Z","title":"U-mamba: Enhancing long- range dependency for biomedical image segmentation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19037","last_updated":"2025-07-25T07:46:40Z","snapshot_observed_at":"2026-08-15T18:00:09.179106Z","submitted_at":"2025-07-25T07:46:40Z","title":"MLLM-based Speech Recognition: When and How is Multimodality Beneficial?","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T18:08:18.864679Z"},"links":{"cited_paper":"/paper/2401.04722","citing_paper":"/paper/2507.19037"},"observation_digest":"sha256:0dc33c7f414c69ae87e0a7c6d15068c7e5dc60ddd510e1cc8fdb4b5a8c600769","observation_id":"10d2330a-fdf2-48ab-a2a9-e37e4f767d12","resolution":{"observed_at":"2026-08-15T18:08:18.864679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:08:19.633355Z","title":"Vl-mamba: Exploring state space models for multimodal learning,","venue":null,"work_id":"68a8a94b-9dce-415d-9c99-3855ff6afecc","year":2024},"citing_paper":{"arxiv_id":"2507.19037","last_updated":"2025-07-25T07:46:40Z","snapshot_observed_at":"2026-08-15T18:00:09.179106Z","submitted_at":"2025-07-25T07:46:40Z","title":"MLLM-based Speech Recognition: When and How is Multimodality Beneficial?","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T18:08:18.868502Z"},"links":{"citing_paper":"/paper/2507.19037"},"observation_digest":"sha256:a32277d9c353c330ab664a3a7e2055f0ab46f7313e9bd4b92cc4bc03f3b7d9a3","observation_id":"b7637d7e-45e8-4168-a67f-e961fdc2d588","resolution":{"observed_at":"2026-08-15T18:08:19.637526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:08:19.620935Z","title":"Foundations & trends in multimodal machine learning: Principles, chal- lenges, and open questions,","venue":null,"work_id":"ec15e253-b7dc-4469-ac08-d31229bf8f84","year":2024},"citing_paper":{"arxiv_id":"2507.19037","last_updated":"2025-07-25T07:46:40Z","snapshot_observed_at":"2026-08-15T18:00:09.179106Z","submitted_at":"2025-07-25T07:46:40Z","title":"MLLM-based Speech Recognition: When and How is Multimodality Beneficial?","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T18:08:18.872168Z"},"links":{"citing_paper":"/paper/2507.19037"},"observation_digest":"sha256:27c7c82da38033bde2030717791d727c572b77ccba5c650d3ccac92c753f8313","observation_id":"c1523190-95e2-410a-8d53-10aacc321d34","resolution":{"observed_at":"2026-08-15T18:08:19.625715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:08:19.608943Z","title":"Diffusion- lm improves controllable text generation,","venue":null,"work_id":"9febdc7b-5157-474b-8b4f-49cd72bbfd0e","year":2022},"citing_paper":{"arxiv_id":"2507.19037","last_updated":"2025-07-25T07:46:40Z","snapshot_observed_at":"2026-08-15T18:00:09.179106Z","submitted_at":"2025-07-25T07:46:40Z","title":"MLLM-based Speech Recognition: When and How is Multimodality Beneficial?","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T18:08:18.885465Z"},"links":{"citing_paper":"/paper/2507.19037"},"observation_digest":"sha256:8a9719c1669714e1d6d4ff50924abac96c8e9a828a2c131088789bdf186452ba","observation_id":"3636cc29-cd3c-4e8c-94e0-57b2dabd6e74","resolution":{"observed_at":"2026-08-15T18:08:19.612881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:08:19.596420Z","title":"Large language diffusion models,","venue":null,"work_id":"b9ba74cb-32ec-4e39-aacd-34d5eb52a5d9","year":2025},"citing_paper":{"arxiv_id":"2507.19037","last_updated":"2025-07-25T07:46:40Z","snapshot_observed_at":"2026-08-15T18:00:09.179106Z","submitted_at":"2025-07-25T07:46:40Z","title":"MLLM-based Speech Recognition: When and How is Multimodality Beneficial?","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T18:08:18.890194Z"},"links":{"citing_paper":"/paper/2507.19037"},"observation_digest":"sha256:f73a733be04197f38fe379ba24e19eb0b51291c8bbec0fc768320d698d2f7538","observation_id":"5be19410-7fcc-4241-916c-2b76a9b8247d","resolution":{"observed_at":"2026-08-15T18:08:19.600420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:08:19.584159Z","title":"Speechgpt: Empow- ering large language models with intrinsic cross-modal conversational abilities,","venue":null,"work_id":"67696f2c-278f-4d3e-9f06-c102983553c8","year":2023},"citing_paper":{"arxiv_id":"2507.19037","last_updated":"2025-07-25T07:46:40Z","snapshot_observed_at":"2026-08-15T18:00:09.179106Z","submitted_at":"2025-07-25T07:46:40Z","title":"MLLM-based Speech Recognition: When and How is Multimodality Beneficial?","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T18:08:18.895150Z"},"links":{"citing_paper":"/paper/2507.19037"},"observation_digest":"sha256:e6cd3630645084301fc3deaea39b86dc6cfd8954767b9acf6484e5b21a1b7676","observation_id":"272cceb3-fdc4-461b-bff8-8b12b6551c15","resolution":{"observed_at":"2026-08-15T18:08:19.589094Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:08:19.572046Z","title":"Mamba in speech: Towards an alternative to self-attention,","venue":null,"work_id":"a0b816df-427e-4119-85e2-5143340af638","year":2025},"citing_paper":{"arxiv_id":"2507.19037","last_updated":"2025-07-25T07:46:40Z","snapshot_observed_at":"2026-08-15T18:00:09.179106Z","submitted_at":"2025-07-25T07:46:40Z","title":"MLLM-based Speech Recognition: When and How is Multimodality Beneficial?","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T18:08:18.899530Z"},"links":{"citing_paper":"/paper/2507.19037"},"observation_digest":"sha256:84a1bbfdc2d9c2f60ab7a9f613f4c2d0e236b4a8312855201a4b6aa4512f9652","observation_id":"2d55106d-d58e-4a28-934b-ad3fc2bedbe8","resolution":{"observed_at":"2026-08-15T18:08:19.575908Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:08:19.560940Z","title":"Where visual speech meets language: Vsp-llm framework for efﬁcient and context-aware visual speech processing,","venue":null,"work_id":"a259927d-395a-451b-baac-d4fae066cff1","year":2024},"citing_paper":{"arxiv_id":"2507.19037","last_updated":"2025-07-25T07:46:40Z","snapshot_observed_at":"2026-08-15T18:00:09.179106Z","submitted_at":"2025-07-25T07:46:40Z","title":"MLLM-based Speech Recognition: When and How is Multimodality Beneficial?","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T18:08:18.903286Z"},"links":{"citing_paper":"/paper/2507.19037"},"observation_digest":"sha256:274707afc1332e331e8d652c7248fcf615e2e3c02f4441f7f36f2e84a89bde62","observation_id":"fb5446a7-e0b9-4e22-90fd-ab3eb3f0b433","resolution":{"observed_at":"2026-08-15T18:08:19.564962Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-08-07T01:18:02.068918Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.12925","snapshot_observed_at":"2026-08-15T18:08:18.907558Z","title":"Audiopalm: A large language model that can speak and listen,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.19037","last_updated":"2025-07-25T07:46:40Z","snapshot_observed_at":"2026-08-15T18:00:09.179106Z","submitted_at":"2025-07-25T07:46:40Z","title":"MLLM-based Speech Recognition: When and How is Multimodality Beneficial?","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T18:08:18.907558Z"},"links":{"cited_paper":"/paper/2306.12925","citing_paper":"/paper/2507.19037"},"observation_digest":"sha256:e7104009d195704274fff49e43d67285b35707d922c7db7a053a6e40e892d5da","observation_id":"fb09a6e2-85e7-488a-aa59-e4d6fb97ec9f","resolution":{"observed_at":"2026-08-15T18:08:18.907558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:08:19.549118Z","title":"Avformer: Injecting vision into frozen speech models for zero-shot av-asr,","venue":null,"work_id":"dacf5aba-a8c9-42ee-8505-6bdaaa32e509","year":2023},"citing_paper":{"arxiv_id":"2507.19037","last_updated":"2025-07-25T07:46:40Z","snapshot_observed_at":"2026-08-15T18:00:09.179106Z","submitted_at":"2025-07-25T07:46:40Z","title":"MLLM-based Speech Recognition: When and How is Multimodality Beneficial?","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T18:08:18.911702Z"},"links":{"citing_paper":"/paper/2507.19037"},"observation_digest":"sha256:eaec78a1e13ca8850e54f647a1da59eede5c73e9092ed8d44a6600e0419b3e82","observation_id":"b50ac2db-981b-41c4-8db5-b16c887c2a86","resolution":{"observed_at":"2026-08-15T18:08:19.553143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:08:19.537655Z","title":"Gesture-aware zero-shot speech recognition for patients with language disorders,","venue":null,"work_id":"1a1b41e3-8642-4c06-a0e7-c17f2d094248","year":2025},"citing_paper":{"arxiv_id":"2507.19037","last_updated":"2025-07-25T07:46:40Z","snapshot_observed_at":"2026-08-15T18:00:09.179106Z","submitted_at":"2025-07-25T07:46:40Z","title":"MLLM-based Speech Recognition: When and How is Multimodality Beneficial?","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T18:08:18.916276Z"},"links":{"citing_paper":"/paper/2507.19037"},"observation_digest":"sha256:6c8ff393f34ed8250a2518d4b8a995e6eac7cab99d5a5ecaa2f611e7d27fd6d7","observation_id":"b793b600-57fd-4929-b18c-e0f972b4440a","resolution":{"observed_at":"2026-08-15T18:08:19.541550Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06273","last_updated":"2025-07-21T06:53:55Z","snapshot_observed_at":"2026-08-15T14:35:42.455470Z","submitted_at":"2025-03-08T16:40:13Z","title":"Zero-AVSR: Zero-Shot Audio-Visual Speech Recognition with LLMs by Learning Language-Agnostic Speech Representations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06273","snapshot_observed_at":"2026-08-15T18:08:18.920776Z","title":"Zero-avsr: Zero-shot audio-visual speech recognition with llms by learning language-agnostic speech representations,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.19037","last_updated":"2025-07-25T07:46:40Z","snapshot_observed_at":"2026-08-15T18:00:09.179106Z","submitted_at":"2025-07-25T07:46:40Z","title":"MLLM-based Speech Recognition: When and How is Multimodality Beneficial?","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T18:08:18.920776Z"},"links":{"cited_paper":"/paper/2503.06273","citing_paper":"/paper/2507.19037"},"observation_digest":"sha256:d13e7325b4f9d3a395f09b62c7434549509afe28c83269808c8f06f9ec24a638","observation_id":"2792da03-5baf-4951-a1fc-32dca1273452","resolution":{"observed_at":"2026-08-15T18:08:18.920776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06362","last_updated":"2025-08-06T17:41:48Z","snapshot_observed_at":"2026-08-07T17:19:43.747391Z","submitted_at":"2025-03-09T00:02:10Z","title":"Adaptive Audio-Visual Speech Recognition via Matryoshka-Based Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06362","snapshot_observed_at":"2026-08-15T18:08:18.924921Z","title":"Adaptive audio-visual speech recognition via matryoshka-based multimodal llms,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.19037","last_updated":"2025-07-25T07:46:40Z","snapshot_observed_at":"2026-08-15T18:00:09.179106Z","submitted_at":"2025-07-25T07:46:40Z","title":"MLLM-based Speech Recognition: When and How is Multimodality Beneficial?","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T18:08:18.924921Z"},"links":{"cited_paper":"/paper/2503.06362","citing_paper":"/paper/2507.19037"},"observation_digest":"sha256:afc8408eae5a8427ad4230d1c55288c25e108c30518831d1fe9f74069af7b777","observation_id":"fc9ea407-1853-49bf-9f5d-8d534cac714e","resolution":{"observed_at":"2026-08-15T18:08:18.924921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:08:19.525837Z","title":"Robust speech recognition via large-scale weak supervision,","venue":null,"work_id":"54a9a813-e562-4866-9a86-d2bb388d2c08","year":2023},"citing_paper":{"arxiv_id":"2507.19037","last_updated":"2025-07-25T07:46:40Z","snapshot_observed_at":"2026-08-15T18:00:09.179106Z","submitted_at":"2025-07-25T07:46:40Z","title":"MLLM-based Speech Recognition: When and How is Multimodality Beneficial?","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T18:08:18.929951Z"},"links":{"citing_paper":"/paper/2507.19037"},"observation_digest":"sha256:340c56ecbd110530fdbd82e23133d61a152abeee8f2a1f441e89953b51dd888e","observation_id":"00be9c3e-7574-41a0-bc77-9ec09d650be3","resolution":{"observed_at":"2026-08-15T18:08:19.529812Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:08:19.514532Z","title":"Perceptual score: What data modalities does your model perceive?","venue":null,"work_id":"280f8889-9756-4655-a3bd-84639fab6374","year":2021},"citing_paper":{"arxiv_id":"2507.19037","last_updated":"2025-07-25T07:46:40Z","snapshot_observed_at":"2026-08-15T18:00:09.179106Z","submitted_at":"2025-07-25T07:46:40Z","title":"MLLM-based Speech Recognition: When and How is Multimodality Beneficial?","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T18:08:18.933403Z"},"links":{"citing_paper":"/paper/2507.19037"},"observation_digest":"sha256:ab25e0e1b14b718dc4b44740bfc134b6d7ec19a7ff06fb27d03a58515c5755fd","observation_id":"47ed3191-fbb7-4a33-8c57-74b2f4f57603","resolution":{"observed_at":"2026-08-15T18:08:19.518476Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-08-06T03:13:37.403059Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-08-15T18:08:18.936763Z","title":"Opt: Open pre-trained transformer language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.19037","last_updated":"2025-07-25T07:46:40Z","snapshot_observed_at":"2026-08-15T18:00:09.179106Z","submitted_at":"2025-07-25T07:46:40Z","title":"MLLM-based Speech Recognition: When and How is Multimodality Beneficial?","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T18:08:18.936763Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2507.19037"},"observation_digest":"sha256:42cd532f32444952dd2f429f72206f49cf6b85d7fa9ca099d3a2a8b0fc4997b7","observation_id":"68229392-882f-44df-8fb1-1c45af54fd8f","resolution":{"observed_at":"2026-08-15T18:08:18.936763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:08:19.503406Z","title":"Librispeech: an asr corpus based on public domain audio books,","venue":null,"work_id":"705f48df-37f7-44d8-a159-044362bb8799","year":2015},"citing_paper":{"arxiv_id":"2507.19037","last_updated":"2025-07-25T07:46:40Z","snapshot_observed_at":"2026-08-15T18:00:09.179106Z","submitted_at":"2025-07-25T07:46:40Z","title":"MLLM-based Speech Recognition: When and How is Multimodality Beneficial?","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T18:08:18.940735Z"},"links":{"citing_paper":"/paper/2507.19037"},"observation_digest":"sha256:5bab074053aae0db5923baf68a1f4955849936076d6fbc06c934f0f3b5e0ec6b","observation_id":"4445125b-d4d2-4759-b990-34cf2ae851af","resolution":{"observed_at":"2026-08-15T18:08:19.507533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:08:19.492618Z","title":"Cvss corpus and massively multilingual speech-to- speech translation,","venue":null,"work_id":"56968997-5a06-4b73-98ec-832add252bc2","year":2022},"citing_paper":{"arxiv_id":"2507.19037","last_updated":"2025-07-25T07:46:40Z","snapshot_observed_at":"2026-08-15T18:00:09.179106Z","submitted_at":"2025-07-25T07:46:40Z","title":"MLLM-based Speech Recognition: When and How is Multimodality Beneficial?","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T18:08:18.945358Z"},"links":{"citing_paper":"/paper/2507.19037"},"observation_digest":"sha256:a5fee3c0a8ef2782d8416f84d747413ff9084443f1c4578b82e7ca81242f2872","observation_id":"94bb2653-48d2-44cb-9284-6e7eebf93853","resolution":{"observed_at":"2026-08-15T18:08:19.496644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2007.10310","last_updated":"2020-10-24T06:07:01Z","snapshot_observed_at":"2026-08-14T22:10:56.475667Z","submitted_at":"2020-07-20T17:53:35Z","title":"CoVoST 2 and Massively Multilingual Speech-to-Text Translation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.10310","snapshot_observed_at":"2026-08-15T18:08:18.949250Z","title":"Covost 2 and massively multilingual speech-to-text translation,","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2507.19037","last_updated":"2025-07-25T07:46:40Z","snapshot_observed_at":"2026-08-15T18:00:09.179106Z","submitted_at":"2025-07-25T07:46:40Z","title":"MLLM-based Speech Recognition: When and How is Multimodality Beneficial?","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T18:08:18.949250Z"},"links":{"cited_paper":"/paper/2007.10310","citing_paper":"/paper/2507.19037"},"observation_digest":"sha256:1571e59ec2dc9b33f47fbfe52abaf291292d1a1b1d45ad274cb063c89d70795f","observation_id":"6654fe36-8e69-4982-97bd-87b4c9347b63","resolution":{"observed_at":"2026-08-15T18:08:18.949250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:08:19.481013Z","title":"Microsoft coco: Common objects in context,","venue":null,"work_id":"934f4290-16f6-4080-9fcd-bad253ff90a9","year":2014},"citing_paper":{"arxiv_id":"2507.19037","last_updated":"2025-07-25T07:46:40Z","snapshot_observed_at":"2026-08-15T18:00:09.179106Z","submitted_at":"2025-07-25T07:46:40Z","title":"MLLM-based Speech Recognition: When and How is Multimodality Beneficial?","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T18:08:18.953240Z"},"links":{"citing_paper":"/paper/2507.19037"},"observation_digest":"sha256:7c98d03ae4321b61f19d21e36492d38d2ec294ac441baa9163a7f8ad57cc55ed","observation_id":"408f3226-4033-4374-8f2e-e8539d49e997","resolution":{"observed_at":"2026-08-15T18:08:19.485293Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.11596","last_updated":"2023-10-25T03:52:07Z","snapshot_observed_at":"2026-08-14T20:49:45.201003Z","submitted_at":"2023-08-22T17:44:18Z","title":"SeamlessM4T: Massively Multilingual & Multimodal Machine Translation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.11596","snapshot_observed_at":"2026-08-15T18:08:18.957514Z","title":"Seam- lessm4t: Massively multilingual & multimodal machine translation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.19037","last_updated":"2025-07-25T07:46:40Z","snapshot_observed_at":"2026-08-15T18:00:09.179106Z","submitted_at":"2025-07-25T07:46:40Z","title":"MLLM-based Speech Recognition: When and How is Multimodality Beneficial?","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T18:08:18.957514Z"},"links":{"cited_paper":"/paper/2308.11596","citing_paper":"/paper/2507.19037"},"observation_digest":"sha256:acfad0c547df7f5b932862a3b535b003314036d867b15966ee3fca856c302472","observation_id":"c239201b-f9af-417f-8de9-6f4f4bb0558e","resolution":{"observed_at":"2026-08-15T18:08:18.957514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:08:19.468973Z","title":"Learning audio-visual speech representation by masked multimodal cluster prediction,","venue":null,"work_id":"b786e9c7-70ea-4cc4-af7f-122a2b2d9292","year":2022},"citing_paper":{"arxiv_id":"2507.19037","last_updated":"2025-07-25T07:46:40Z","snapshot_observed_at":"2026-08-15T18:00:09.179106Z","submitted_at":"2025-07-25T07:46:40Z","title":"MLLM-based Speech Recognition: When and How is Multimodality Beneficial?","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T18:08:18.961349Z"},"links":{"citing_paper":"/paper/2507.19037"},"observation_digest":"sha256:2539d5595c80f32ba006a1f0805812dfaaf6df17c6ac4b418a61c17915a1f50e","observation_id":"f61914bb-bbae-4dcc-8c67-944074878096","resolution":{"observed_at":"2026-08-15T18:08:19.472960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:08:19.457676Z","title":"Zero-shot text- to-image generation,","venue":null,"work_id":"b19759bc-942d-47aa-ad4e-1f570f2a2a88","year":2021},"citing_paper":{"arxiv_id":"2507.19037","last_updated":"2025-07-25T07:46:40Z","snapshot_observed_at":"2026-08-15T18:00:09.179106Z","submitted_at":"2025-07-25T07:46:40Z","title":"MLLM-based Speech Recognition: When and How is Multimodality Beneficial?","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T18:08:18.965387Z"},"links":{"citing_paper":"/paper/2507.19037"},"observation_digest":"sha256:3dfb2fa065c8c3b87934b390d4a1ba30e7a234dfe26a510b744115c72be7fb90","observation_id":"d0de09d2-5e37-47ea-a87c-4aafa2b5146a","resolution":{"observed_at":"2026-08-15T18:08:19.461940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:08:19.445704Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":"0ea72238-aeda-4cf1-af41-c64030418b84","year":2020},"citing_paper":{"arxiv_id":"2507.19037","last_updated":"2025-07-25T07:46:40Z","snapshot_observed_at":"2026-08-15T18:00:09.179106Z","submitted_at":"2025-07-25T07:46:40Z","title":"MLLM-based Speech Recognition: When and How is Multimodality Beneficial?","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T18:08:18.969045Z"},"links":{"citing_paper":"/paper/2507.19037"},"observation_digest":"sha256:73e73461fbba2838dbcd68403dc7f2e7d870431688e9ddbc2edda5b44afa87ba","observation_id":"e84adce2-67ee-4889-b71d-f08a113f675e","resolution":{"observed_at":"2026-08-15T18:08:19.450637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:08:19.433915Z","title":"Decoupled weight decay regularization,","venue":null,"work_id":"0b4672bb-2dfa-46ea-8b5f-3e86f792c3fc","year":2017},"citing_paper":{"arxiv_id":"2507.19037","last_updated":"2025-07-25T07:46:40Z","snapshot_observed_at":"2026-08-15T18:00:09.179106Z","submitted_at":"2025-07-25T07:46:40Z","title":"MLLM-based Speech Recognition: When and How is Multimodality Beneficial?","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T18:08:18.972445Z"},"links":{"citing_paper":"/paper/2507.19037"},"observation_digest":"sha256:fcf023e5c3b416c22bc4c51830cdefa790665c97c411fe0ab0c774ff3c6b9cb8","observation_id":"34763197-be4c-459c-9712-e0ff39790d65","resolution":{"observed_at":"2026-08-15T18:08:19.437858Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:08:19.422216Z","title":"Deep audio- visual speech recognition,","venue":null,"work_id":"69a28c42-c873-41e5-907b-7fcef3d9bdaf","year":2018},"citing_paper":{"arxiv_id":"2507.19037","last_updated":"2025-07-25T07:46:40Z","snapshot_observed_at":"2026-08-15T18:00:09.179106Z","submitted_at":"2025-07-25T07:46:40Z","title":"MLLM-based Speech Recognition: When and How is Multimodality Beneficial?","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T18:08:18.976171Z"},"links":{"citing_paper":"/paper/2507.19037"},"observation_digest":"sha256:5cd7de39a29ca3329f88d1a44bdf0a285c7436e5dcb8986e947b98169dd34f0b","observation_id":"9ad27258-a6d2-41f0-960b-2870186be976","resolution":{"observed_at":"2026-08-15T18:08:19.426624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:08:19.410511Z","title":"Slideavsr: A dataset of paper explanation videos for audio-visual speech recognition,","venue":null,"work_id":"645cf37f-4502-4629-8113-eeb13dd5453c","year":2024},"citing_paper":{"arxiv_id":"2507.19037","last_updated":"2025-07-25T07:46:40Z","snapshot_observed_at":"2026-08-15T18:00:09.179106Z","submitted_at":"2025-07-25T07:46:40Z","title":"MLLM-based Speech Recognition: When and How is Multimodality Beneficial?","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T18:08:18.980618Z"},"links":{"citing_paper":"/paper/2507.19037"},"observation_digest":"sha256:79bbda78b0540cc0961e4af0779d25c0f584e49b2ede0f498533d9e1d668c55c","observation_id":"4774422d-0fbb-4c12-87da-50305f889e5a","resolution":{"observed_at":"2026-08-15T18:08:19.414781Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:08:19.398255Z","title":"Spoken moments: Learning joint audio-visual representations from video descriptions,","venue":null,"work_id":"d9dcad4d-b352-482e-910e-e58298c3ac1f","year":2021},"citing_paper":{"arxiv_id":"2507.19037","last_updated":"2025-07-25T07:46:40Z","snapshot_observed_at":"2026-08-15T18:00:09.179106Z","submitted_at":"2025-07-25T07:46:40Z","title":"MLLM-based Speech Recognition: When and How is Multimodality Beneficial?","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T18:08:18.984832Z"},"links":{"citing_paper":"/paper/2507.19037"},"observation_digest":"sha256:7c7789c6a047ccafde5f061def0df4266c9e63b0efca68eaeded3d7fb29b9b58","observation_id":"4f1d409a-8add-4c12-93ca-11ffb967f691","resolution":{"observed_at":"2026-08-15T18:08:19.402749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:08:19.386301Z","title":"pyttsx3: Ofﬂine text to speech (tts) converter for python,","venue":null,"work_id":"878e5574-9082-45da-b32c-a1854372a3c4","year":null},"citing_paper":{"arxiv_id":"2507.19037","last_updated":"2025-07-25T07:46:40Z","snapshot_observed_at":"2026-08-15T18:00:09.179106Z","submitted_at":"2025-07-25T07:46:40Z","title":"MLLM-based Speech Recognition: When and How is Multimodality Beneficial?","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T18:08:18.988723Z"},"links":{"citing_paper":"/paper/2507.19037"},"observation_digest":"sha256:b8dfac7b53a82e84e1680f6ef0c94ba1105f38de5f921cba97f58ce43e3c7427","observation_id":"8f5bff19-e950-4cb5-a898-7b14a40d218b","resolution":{"observed_at":"2026-08-15T18:08:19.390891Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1510.08484","last_updated":"2015-10-28T20:59:04Z","snapshot_observed_at":"2026-08-14T22:25:51.884597Z","submitted_at":"2015-10-28T20:59:04Z","title":"MUSAN: A Music, Speech, and Noise Corpus","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1510.08484","snapshot_observed_at":"2026-08-15T18:08:18.992534Z","title":"Musan: A music, speech, and noise corpus,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.19037","last_updated":"2025-07-25T07:46:40Z","snapshot_observed_at":"2026-08-15T18:00:09.179106Z","submitted_at":"2025-07-25T07:46:40Z","title":"MLLM-based Speech Recognition: When and How is Multimodality Beneficial?","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T18:08:18.992534Z"},"links":{"cited_paper":"/paper/1510.08484","citing_paper":"/paper/2507.19037"},"observation_digest":"sha256:d3da37c88b1fc4d7ec455523d4bd622e0d740ce9a5740248d085b3cadcc21dd8","observation_id":"502a7683-4b4f-4e05-b863-413ee6eca90a","resolution":{"observed_at":"2026-08-15T18:08:18.992534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:08:19.373982Z","title":"Easyocr: Ready-to-use ocr with 80+ supported lan- guages,","venue":null,"work_id":"8de1a7d8-cc7d-48ef-8f85-c01e7afb243b","year":null},"citing_paper":{"arxiv_id":"2507.19037","last_updated":"2025-07-25T07:46:40Z","snapshot_observed_at":"2026-08-15T18:00:09.179106Z","submitted_at":"2025-07-25T07:46:40Z","title":"MLLM-based Speech Recognition: When and How is Multimodality Beneficial?","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T18:08:18.996449Z"},"links":{"citing_paper":"/paper/2507.19037"},"observation_digest":"sha256:e3ed6e8491d5b1d2729f54dea81f49d577aea121a8db077cb79a1e7d73be32f4","observation_id":"89498a63-f6cb-43e0-b679-fece7763bde2","resolution":{"observed_at":"2026-08-15T18:08:19.377923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:08:19.362105Z","title":"Multi- moments in time: Learning and interpreting models for multi-action video understanding,","venue":null,"work_id":"17306d25-23ff-4a64-a5f3-cc66ec77af25","year":2021},"citing_paper":{"arxiv_id":"2507.19037","last_updated":"2025-07-25T07:46:40Z","snapshot_observed_at":"2026-08-15T18:00:09.179106Z","submitted_at":"2025-07-25T07:46:40Z","title":"MLLM-based Speech Recognition: When and How is Multimodality Beneficial?","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T18:08:19.000266Z"},"links":{"citing_paper":"/paper/2507.19037"},"observation_digest":"sha256:e1758ff9abe3236170634bea182d1f1e2c8eac6babb0f9cfdac6826b89c1c985","observation_id":"93f3b218-634d-478c-9940-26d54c6e24bd","resolution":{"observed_at":"2026-08-15T18:08:19.366134Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:08:19.349043Z","title":"Auto- avsr: Audio-visual speech recognition with automatic labels,","venue":null,"work_id":"9eda2506-4f18-46da-b4dc-f78bf433fb61","year":2023},"citing_paper":{"arxiv_id":"2507.19037","last_updated":"2025-07-25T07:46:40Z","snapshot_observed_at":"2026-08-15T18:00:09.179106Z","submitted_at":"2025-07-25T07:46:40Z","title":"MLLM-based Speech Recognition: When and How is Multimodality Beneficial?","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T18:08:19.005817Z"},"links":{"citing_paper":"/paper/2507.19037"},"observation_digest":"sha256:b6c56f2d809f9d2b3b6d351f5a2a6810b89c39fa466938b7437921c29cfc66d4","observation_id":"cc02efc9-5ce5-420c-9be2-a3f62988bd0a","resolution":{"observed_at":"2026-08-15T18:08:19.353708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:08:19.337052Z","title":"Flamingo: a visual language model for few-shot learning,","venue":null,"work_id":"5ca5bb06-a11c-475e-9f53-4556d9a86e29","year":2022},"citing_paper":{"arxiv_id":"2507.19037","last_updated":"2025-07-25T07:46:40Z","snapshot_observed_at":"2026-08-15T18:00:09.179106Z","submitted_at":"2025-07-25T07:46:40Z","title":"MLLM-based Speech Recognition: When and How is Multimodality Beneficial?","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-15T18:08:19.009408Z"},"links":{"citing_paper":"/paper/2507.19037"},"observation_digest":"sha256:627df4f57cf97fc9b42db45ac3ec0600e860e83d001a4bb24e33b4115ec31236","observation_id":"8c26f861-47c6-4525-9ff7-878f0c730255","resolution":{"observed_at":"2026-08-15T18:08:19.341067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16983","last_updated":"2024-10-22T13:05:11Z","snapshot_observed_at":"2026-08-14T13:16:33.902265Z","submitted_at":"2024-10-22T13:05:11Z","title":"Order Matters: Exploring Order Sensitivity in Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16983","snapshot_observed_at":"2026-08-15T18:08:19.013669Z","title":"Order matters: Exploring order sensitivity in multimodal large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19037","last_updated":"2025-07-25T07:46:40Z","snapshot_observed_at":"2026-08-15T18:00:09.179106Z","submitted_at":"2025-07-25T07:46:40Z","title":"MLLM-based Speech Recognition: When and How is Multimodality Beneficial?","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-15T18:08:19.013669Z"},"links":{"cited_paper":"/paper/2410.16983","citing_paper":"/paper/2507.19037"},"observation_digest":"sha256:90c88d6e93350d652457320f4260d04a458df1cfcb07032416b7bab301f36713","observation_id":"89a83efc-6b20-4894-a2fa-2bca2d5eb5c8","resolution":{"observed_at":"2026-08-15T18:08:19.013669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:08:19.324656Z","title":"Image ﬁrst or text ﬁrst? optimising the sequencing of modalities in large language model prompting and reasoning tasks,","venue":null,"work_id":"1c4c3e5b-7190-484c-988c-f68b19961fb8","year":2025},"citing_paper":{"arxiv_id":"2507.19037","last_updated":"2025-07-25T07:46:40Z","snapshot_observed_at":"2026-08-15T18:00:09.179106Z","submitted_at":"2025-07-25T07:46:40Z","title":"MLLM-based Speech Recognition: When and How is Multimodality Beneficial?","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-15T18:08:19.017587Z"},"links":{"citing_paper":"/paper/2507.19037"},"observation_digest":"sha256:ebd343e83770ad4a59bb2eb3b6e4b9a2f0f91c8ff04fd81f1bc8734b8cbdea6e","observation_id":"6ead41f1-829e-4bb4-bb49-02985ed27086","resolution":{"observed_at":"2026-08-15T18:08:19.329115Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.19037","last_updated":"2025-07-25T07:46:40Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-15T18:00:09.179106Z","submitted_at":"2025-07-25T07:46:40Z","title":"MLLM-based Speech Recognition: When and How is Multimodality Beneficial?"},"reference_resolution":{"displayed":58,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":15,"verified_exact":2,"verified_fuzzy":41},"total_outbound_references":58},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 1 inbound Pith citation observation for arXiv:2507.19037."}