{"as_of":"2026-08-17T00:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:aa519b709cd525319b2bfd726de858026d19a5f7bac1caffdfa77151773a209e","coverage":[{"denominator":42,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T05:31:45.902125Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.17507/citation-record","integrity":"/paper/2412.17507/integrity","json":"/paper/2412.17507/citation-record.json","paper":"/paper/2412.17507"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:31:46.502163Z","title":"Attention is all you need,","venue":null,"work_id":"df2fa9a1-fb8a-494b-a533-e342fccbde96","year":2017},"citing_paper":{"arxiv_id":"2412.17507","last_updated":"2024-12-23T12:08:37Z","snapshot_observed_at":"2026-08-14T14:01:16.816215Z","submitted_at":"2024-12-23T12:08:37Z","title":"UME: Upcycling Mixture-of-Experts for Scalable and Efficient Automatic Speech Recognition","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T05:31:45.743034Z"},"links":{"citing_paper":"/paper/2412.17507"},"observation_digest":"sha256:389e8d0b7afc60c27c634dad68665edc209944aab43cf340190f9e502e136d67","observation_id":"91858430-01ae-44bf-b2d9-5ae3ec0d0d22","resolution":{"observed_at":"2026-08-11T05:31:46.506628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:31:46.488349Z","title":"Recent advances in end-to-end automatic speech recognition,","venue":null,"work_id":"a152a2fa-6c66-4ef5-9ae6-7ce73a5b7163","year":2022},"citing_paper":{"arxiv_id":"2412.17507","last_updated":"2024-12-23T12:08:37Z","snapshot_observed_at":"2026-08-14T14:01:16.816215Z","submitted_at":"2024-12-23T12:08:37Z","title":"UME: Upcycling Mixture-of-Experts for Scalable and Efficient Automatic Speech Recognition","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T05:31:45.747084Z"},"links":{"citing_paper":"/paper/2412.17507"},"observation_digest":"sha256:e3e5443f30b40fed86ea69ebfabd29b93aa9eb84f79cf17ad0128bf85fb6ea4a","observation_id":"1f849a45-c831-45ba-bdb9-07242e5e4ccc","resolution":{"observed_at":"2026-08-11T05:31:46.492646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:31:46.472865Z","title":"End-to- end speech recognition: A survey,","venue":null,"work_id":"c5013050-dacd-493c-a835-906b62da3538","year":2023},"citing_paper":{"arxiv_id":"2412.17507","last_updated":"2024-12-23T12:08:37Z","snapshot_observed_at":"2026-08-14T14:01:16.816215Z","submitted_at":"2024-12-23T12:08:37Z","title":"UME: Upcycling Mixture-of-Experts for Scalable and Efficient Automatic Speech Recognition","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T05:31:45.750704Z"},"links":{"citing_paper":"/paper/2412.17507"},"observation_digest":"sha256:ad6007ce67a9f5ac54b72869d68034cde35b5e401b9c5abbbf7abd8c569decf2","observation_id":"4cca7ba5-2d3f-4584-95ad-d41652265d42","resolution":{"observed_at":"2026-08-11T05:31:46.476625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:31:46.458811Z","title":"Bigssl: Exploring the frontier of large-scale semi-supervised learning for automatic speech recognition,","venue":null,"work_id":"51b253d7-9645-468d-bac7-47bfb8cd179d","year":2022},"citing_paper":{"arxiv_id":"2412.17507","last_updated":"2024-12-23T12:08:37Z","snapshot_observed_at":"2026-08-14T14:01:16.816215Z","submitted_at":"2024-12-23T12:08:37Z","title":"UME: Upcycling Mixture-of-Experts for Scalable and Efficient Automatic Speech Recognition","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T05:31:45.754952Z"},"links":{"citing_paper":"/paper/2412.17507"},"observation_digest":"sha256:75f2a674a9d7bc4ece7c415e273214bc1269ae0e90306927c1eb6a1a8b7be4d7","observation_id":"b16e0c43-5cb9-46f4-8ee5-999aa01d80b4","resolution":{"observed_at":"2026-08-11T05:31:46.464356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:31:46.445090Z","title":"Wavlm: Large- scale self-supervised pre-training for full stack speech processing,","venue":null,"work_id":"f207cb2f-0472-44b0-8975-3addbc2500ca","year":2022},"citing_paper":{"arxiv_id":"2412.17507","last_updated":"2024-12-23T12:08:37Z","snapshot_observed_at":"2026-08-14T14:01:16.816215Z","submitted_at":"2024-12-23T12:08:37Z","title":"UME: Upcycling Mixture-of-Experts for Scalable and Efficient Automatic Speech Recognition","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T05:31:45.759019Z"},"links":{"citing_paper":"/paper/2412.17507"},"observation_digest":"sha256:bb6f276dcadd527f562b897fbb9d0fffe1d9c302f73aa7e4c356522cd18e974f","observation_id":"92785e70-24ab-477d-a5cb-9ccd452425b5","resolution":{"observed_at":"2026-08-11T05:31:46.449827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:31:46.432230Z","title":"Pushing the limits of semi- supervised learning for automatic speech recognition,","venue":null,"work_id":"da0f4278-cc55-49be-b037-f4e3df765185","year":2020},"citing_paper":{"arxiv_id":"2412.17507","last_updated":"2024-12-23T12:08:37Z","snapshot_observed_at":"2026-08-14T14:01:16.816215Z","submitted_at":"2024-12-23T12:08:37Z","title":"UME: Upcycling Mixture-of-Experts for Scalable and Efficient Automatic Speech Recognition","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T05:31:45.762957Z"},"links":{"citing_paper":"/paper/2412.17507"},"observation_digest":"sha256:0cf8ab5bf393b0d3d1a176d5abb60d69e5cd81f6f550c304e390542bb6d9ae6c","observation_id":"d190ecf2-f186-45b7-b1ea-eaaad5dfd948","resolution":{"observed_at":"2026-08-11T05:31:46.437037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:31:46.417915Z","title":"Robust speech recogni- tion via large-scale weak supervision,","venue":null,"work_id":"382c90f2-3663-4d6b-8af6-c21a5cff5f25","year":2023},"citing_paper":{"arxiv_id":"2412.17507","last_updated":"2024-12-23T12:08:37Z","snapshot_observed_at":"2026-08-14T14:01:16.816215Z","submitted_at":"2024-12-23T12:08:37Z","title":"UME: Upcycling Mixture-of-Experts for Scalable and Efficient Automatic Speech Recognition","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T05:31:45.767305Z"},"links":{"citing_paper":"/paper/2412.17507"},"observation_digest":"sha256:c863c170fb96c30c957d030c6d7ec3c067e163912d65af06c119134693b409ea","observation_id":"7451cc52-3353-466f-84d0-d76ed300e440","resolution":{"observed_at":"2026-08-11T05:31:46.422142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.01037","last_updated":"2023-09-25T01:20:23Z","snapshot_observed_at":"2026-08-16T15:51:28.593814Z","submitted_at":"2023-03-02T07:47:18Z","title":"Google USM: Scaling Automatic Speech Recognition Beyond 100 Languages","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.01037","snapshot_observed_at":"2026-08-11T05:31:45.770718Z","title":"Google usm: Scaling au- tomatic speech recognition beyond 100 languages,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17507","last_updated":"2024-12-23T12:08:37Z","snapshot_observed_at":"2026-08-14T14:01:16.816215Z","submitted_at":"2024-12-23T12:08:37Z","title":"UME: Upcycling Mixture-of-Experts for Scalable and Efficient Automatic Speech Recognition","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T05:31:45.770718Z"},"links":{"cited_paper":"/paper/2303.01037","citing_paper":"/paper/2412.17507"},"observation_digest":"sha256:92ecff07a7c8787379942d405825bd56525f2602845e2d9820fa5c7b86c0170a","observation_id":"6bcfa17e-9736-4f08-ae87-0c2c8ec0d0a4","resolution":{"observed_at":"2026-08-11T05:31:45.770718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.03589","last_updated":"2023-04-07T11:13:23Z","snapshot_observed_at":"2026-08-16T15:42:02.682985Z","submitted_at":"2023-04-07T11:13:23Z","title":"On Efficient Training of Large-Scale Deep Learning Models: A Literature Review","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.03589","snapshot_observed_at":"2026-08-11T05:31:45.774570Z","title":"On efficient training of large-scale deep learning models: A literature review,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17507","last_updated":"2024-12-23T12:08:37Z","snapshot_observed_at":"2026-08-14T14:01:16.816215Z","submitted_at":"2024-12-23T12:08:37Z","title":"UME: Upcycling Mixture-of-Experts for Scalable and Efficient Automatic Speech Recognition","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T05:31:45.774570Z"},"links":{"cited_paper":"/paper/2304.03589","citing_paper":"/paper/2412.17507"},"observation_digest":"sha256:174f1e5111820de4470ca0f249627bc163acb06f59d493e22706436080a2dddb","observation_id":"18e5fd35-1719-4844-9b4b-176939978b38","resolution":{"observed_at":"2026-08-11T05:31:45.774570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:31:46.405035Z","title":"Net2net: Acceler- ating learning via knowledge transfer,","venue":null,"work_id":"d0abbdc1-1a43-4c54-a432-f5be5482b262","year":2016},"citing_paper":{"arxiv_id":"2412.17507","last_updated":"2024-12-23T12:08:37Z","snapshot_observed_at":"2026-08-14T14:01:16.816215Z","submitted_at":"2024-12-23T12:08:37Z","title":"UME: Upcycling Mixture-of-Experts for Scalable and Efficient Automatic Speech Recognition","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T05:31:45.778311Z"},"links":{"citing_paper":"/paper/2412.17507"},"observation_digest":"sha256:28a8187456e758915097d94ec27890d782f45f12bfc669cdbf119dbc8328b306","observation_id":"cf954ae4-0aae-4d7f-98a6-b33c75da68b9","resolution":{"observed_at":"2026-08-11T05:31:46.408936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:31:46.393049Z","title":"Data efficient neural scaling law via model reusing,","venue":null,"work_id":"901d0696-0732-47f2-93a7-500911cb5912","year":2023},"citing_paper":{"arxiv_id":"2412.17507","last_updated":"2024-12-23T12:08:37Z","snapshot_observed_at":"2026-08-14T14:01:16.816215Z","submitted_at":"2024-12-23T12:08:37Z","title":"UME: Upcycling Mixture-of-Experts for Scalable and Efficient Automatic Speech Recognition","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T05:31:45.781572Z"},"links":{"citing_paper":"/paper/2412.17507"},"observation_digest":"sha256:c60d9c5efdda4cba3f86f801e1fe6af1ac74ce7e6bdc453a11f59fdd52bf6c0e","observation_id":"b8bdb601-bccf-4a04-aca7-326d6d2d4a46","resolution":{"observed_at":"2026-08-11T05:31:46.397473Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:31:46.380550Z","title":"Efficient large scale language modeling with mixtures of experts,","venue":null,"work_id":"adf34e60-c422-4bb9-862a-b57eda1834e7","year":2022},"citing_paper":{"arxiv_id":"2412.17507","last_updated":"2024-12-23T12:08:37Z","snapshot_observed_at":"2026-08-14T14:01:16.816215Z","submitted_at":"2024-12-23T12:08:37Z","title":"UME: Upcycling Mixture-of-Experts for Scalable and Efficient Automatic Speech Recognition","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T05:31:45.785168Z"},"links":{"citing_paper":"/paper/2412.17507"},"observation_digest":"sha256:2f558ce8db5f6ca12abc158c860357604af97538eb4012150f7e43961aeee0d9","observation_id":"68a09b74-fcdb-4790-80ef-7fbf0f5b7ba5","resolution":{"observed_at":"2026-08-11T05:31:46.384490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-13T19:43:49.936776Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-11T05:31:45.789552Z","title":"Mixtral of experts,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17507","last_updated":"2024-12-23T12:08:37Z","snapshot_observed_at":"2026-08-14T14:01:16.816215Z","submitted_at":"2024-12-23T12:08:37Z","title":"UME: Upcycling Mixture-of-Experts for Scalable and Efficient Automatic Speech Recognition","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T05:31:45.789552Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2412.17507"},"observation_digest":"sha256:b5368b2539606ba77ffa331b5d7c55cc1a4d3d93284d32d50f82c0f101d6f4c7","observation_id":"d236518d-72fc-4d6b-aa6b-78ade80b0a57","resolution":{"observed_at":"2026-08-11T05:31:45.789552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-08-14T18:15:53.516440Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-11T05:31:45.793319Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17507","last_updated":"2024-12-23T12:08:37Z","snapshot_observed_at":"2026-08-14T14:01:16.816215Z","submitted_at":"2024-12-23T12:08:37Z","title":"UME: Upcycling Mixture-of-Experts for Scalable and Efficient Automatic Speech Recognition","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T05:31:45.793319Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2412.17507"},"observation_digest":"sha256:f4d03ddbd0bbcd1212c992b1dd9c23025fa88f103bcc50744c5f4519b2463810","observation_id":"0f7f3164-72ae-4164-a6c5-9a6a8f267683","resolution":{"observed_at":"2026-08-11T05:31:45.793319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:31:46.368220Z","title":"Sparse upcycling: Training mixture-of-experts from dense checkpoints,","venue":null,"work_id":"b23fadd7-cd92-4caa-bde8-1a1e32eafbeb","year":2023},"citing_paper":{"arxiv_id":"2412.17507","last_updated":"2024-12-23T12:08:37Z","snapshot_observed_at":"2026-08-14T14:01:16.816215Z","submitted_at":"2024-12-23T12:08:37Z","title":"UME: Upcycling Mixture-of-Experts for Scalable and Efficient Automatic Speech Recognition","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T05:31:45.796916Z"},"links":{"citing_paper":"/paper/2412.17507"},"observation_digest":"sha256:9f0c7ce3e8f287abead46478520455ab0f335c9ded8ac23898a79043dadcbc89","observation_id":"8ad9ae1f-4aec-47c2-9ea5-b24117f19c03","resolution":{"observed_at":"2026-08-11T05:31:46.373278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04801","last_updated":"2024-06-07T10:05:42Z","snapshot_observed_at":"2026-08-16T13:45:12.818196Z","submitted_at":"2024-06-07T10:05:42Z","title":"MoE Jetpack: From Dense Checkpoints to Adaptive Mixture of Experts for Vision Tasks","version":1},"cited_work":{"arxiv_id":"2406.04801","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.04801","snapshot_observed_at":"2026-08-11T05:31:45.969784Z","title":"MoE Jetpack: From Dense Checkpoints to Adaptive Mixture of Experts for Vision Tasks","venue":"cs.CV","work_id":"ee454637-2f40-4593-81c2-5b449839be89","year":2024},"citing_paper":{"arxiv_id":"2412.17507","last_updated":"2024-12-23T12:08:37Z","snapshot_observed_at":"2026-08-14T14:01:16.816215Z","submitted_at":"2024-12-23T12:08:37Z","title":"UME: Upcycling Mixture-of-Experts for Scalable and Efficient Automatic Speech Recognition","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T05:31:45.800168Z"},"links":{"cited_paper":"/paper/2406.04801","citing_paper":"/paper/2412.17507"},"observation_digest":"sha256:d2ce2fcddfb950141f6af60803d275e027db729b4153f9eed4b46c1c0826df72","observation_id":"e68c2cae-07a4-4cf8-b04a-7c9dc1072931","resolution":{"observed_at":"2026-08-11T05:31:45.977205Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:31:46.354158Z","title":"Outra- geously large neural networks: The sparsely-gated mixture-of-experts layer,","venue":null,"work_id":"aa2223b0-92b3-44c1-b618-739c853a9e67","year":2017},"citing_paper":{"arxiv_id":"2412.17507","last_updated":"2024-12-23T12:08:37Z","snapshot_observed_at":"2026-08-14T14:01:16.816215Z","submitted_at":"2024-12-23T12:08:37Z","title":"UME: Upcycling Mixture-of-Experts for Scalable and Efficient Automatic Speech Recognition","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T05:31:45.804954Z"},"links":{"citing_paper":"/paper/2412.17507"},"observation_digest":"sha256:cced652e479434006560fe6354b89d592c640731dd7d9779f14dad6366171099","observation_id":"22e31cbf-aa8b-4832-a110-8c11437741b9","resolution":{"observed_at":"2026-08-11T05:31:46.359977Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:31:46.340019Z","title":"Switch transformers: Scaling to trillion parameter models with simple and efficient sparsity,","venue":null,"work_id":"e9b28a77-7990-4c1e-b282-933e394a21ce","year":2022},"citing_paper":{"arxiv_id":"2412.17507","last_updated":"2024-12-23T12:08:37Z","snapshot_observed_at":"2026-08-14T14:01:16.816215Z","submitted_at":"2024-12-23T12:08:37Z","title":"UME: Upcycling Mixture-of-Experts for Scalable and Efficient Automatic Speech Recognition","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T05:31:45.808848Z"},"links":{"citing_paper":"/paper/2412.17507"},"observation_digest":"sha256:4740d9979cf83b7291598ee67ffd77f7e4fbcbbe9c4849ad40b37a4c3ae96d9a","observation_id":"dfe9aad1-2088-4426-a315-3f3701bb93d3","resolution":{"observed_at":"2026-08-11T05:31:46.345079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:31:46.327458Z","title":"Speechmoe: Scaling to large acoustic models with dynamic routing mixture of experts,","venue":null,"work_id":"02714782-4564-4ebf-9cc0-566daf2ed804","year":2021},"citing_paper":{"arxiv_id":"2412.17507","last_updated":"2024-12-23T12:08:37Z","snapshot_observed_at":"2026-08-14T14:01:16.816215Z","submitted_at":"2024-12-23T12:08:37Z","title":"UME: Upcycling Mixture-of-Experts for Scalable and Efficient Automatic Speech Recognition","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T05:31:45.813317Z"},"links":{"citing_paper":"/paper/2412.17507"},"observation_digest":"sha256:9cbb311b9733d3f507a6a0020c9971933d8ece4d321e855f9aeffd919a7d0d62","observation_id":"0433a52d-9974-45d8-a935-241f8e0a4726","resolution":{"observed_at":"2026-08-11T05:31:46.331773Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:31:46.313854Z","title":"Speechmoe2: Mixture-of-experts model with improved routing,","venue":null,"work_id":"70b7a7a2-282e-4e58-a4b4-5b05ca97484e","year":2022},"citing_paper":{"arxiv_id":"2412.17507","last_updated":"2024-12-23T12:08:37Z","snapshot_observed_at":"2026-08-14T14:01:16.816215Z","submitted_at":"2024-12-23T12:08:37Z","title":"UME: Upcycling Mixture-of-Experts for Scalable and Efficient Automatic Speech Recognition","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T05:31:45.817467Z"},"links":{"citing_paper":"/paper/2412.17507"},"observation_digest":"sha256:e7ce9d0deddd6f0a1f6dd7c591433b3b9a4ecd891eddf3fba298b06955fc6ebd","observation_id":"71bba485-a8ab-4cc2-ad44-14b62efe5a74","resolution":{"observed_at":"2026-08-11T05:31:46.318884Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:31:46.288131Z","title":"3m: Multi-loss, multi-path and multi-level neural networks for speech recognition,","venue":null,"work_id":"acd85178-d6c0-4b4a-af66-a69c410726f0","year":2022},"citing_paper":{"arxiv_id":"2412.17507","last_updated":"2024-12-23T12:08:37Z","snapshot_observed_at":"2026-08-14T14:01:16.816215Z","submitted_at":"2024-12-23T12:08:37Z","title":"UME: Upcycling Mixture-of-Experts for Scalable and Efficient Automatic Speech Recognition","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T05:31:45.821564Z"},"links":{"citing_paper":"/paper/2412.17507"},"observation_digest":"sha256:3f2d86502c967942d538e721d826fba35d9959d7d1dcba7a5c8fe454359ccf03","observation_id":"df524522-8643-47a0-9bae-bc3a6e35cb4d","resolution":{"observed_at":"2026-08-11T05:31:46.292841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:31:46.274347Z","title":"Language-routing mix- ture of experts for multilingual and code-switching speech recognition,","venue":null,"work_id":"429b7cbb-2389-4a4a-a418-1efc73a5150f","year":2023},"citing_paper":{"arxiv_id":"2412.17507","last_updated":"2024-12-23T12:08:37Z","snapshot_observed_at":"2026-08-14T14:01:16.816215Z","submitted_at":"2024-12-23T12:08:37Z","title":"UME: Upcycling Mixture-of-Experts for Scalable and Efficient Automatic Speech Recognition","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T05:31:45.825489Z"},"links":{"citing_paper":"/paper/2412.17507"},"observation_digest":"sha256:64f195242f8c315cadfde0692a0cf3ea6354575e3231b37b04865cc83125f58c","observation_id":"9f9ce6dc-068f-4ee3-afe1-18ac1e63c979","resolution":{"observed_at":"2026-08-11T05:31:46.279470Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:31:46.262029Z","title":"Ba-moe: Boundary-aware mixture-of-experts adapter for code-switching speech recognition,","venue":null,"work_id":"e9192788-0165-4c92-96fb-1249747574d7","year":2023},"citing_paper":{"arxiv_id":"2412.17507","last_updated":"2024-12-23T12:08:37Z","snapshot_observed_at":"2026-08-14T14:01:16.816215Z","submitted_at":"2024-12-23T12:08:37Z","title":"UME: Upcycling Mixture-of-Experts for Scalable and Efficient Automatic Speech Recognition","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T05:31:45.829535Z"},"links":{"citing_paper":"/paper/2412.17507"},"observation_digest":"sha256:a107994becb2e6009b15f35bda1faba5ecdb95199d70dac959656e44f63cf4ef","observation_id":"7057ea70-e4d2-460b-9d6e-5d4da7d31812","resolution":{"observed_at":"2026-08-11T05:31:46.266505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:31:46.249226Z","title":"Mole: Mixture of language experts for multi-lingual automatic speech recognition,","venue":null,"work_id":"567ae3d5-5f9d-471d-b3e4-ba0f2c91aaa6","year":2023},"citing_paper":{"arxiv_id":"2412.17507","last_updated":"2024-12-23T12:08:37Z","snapshot_observed_at":"2026-08-14T14:01:16.816215Z","submitted_at":"2024-12-23T12:08:37Z","title":"UME: Upcycling Mixture-of-Experts for Scalable and Efficient Automatic Speech Recognition","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T05:31:45.834380Z"},"links":{"citing_paper":"/paper/2412.17507"},"observation_digest":"sha256:1eeef606f5820020fbef047fab377d5a4a8ca19aea11cca45394bbd786509b06","observation_id":"1ddc3055-b65d-4c0a-83b6-962f461a80cd","resolution":{"observed_at":"2026-08-11T05:31:46.253806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:31:46.234892Z","title":"Mixture-of-expert conformer for streaming multilingual asr,","venue":null,"work_id":"9f22294e-5eea-43b6-9092-705a733d1be3","year":2023},"citing_paper":{"arxiv_id":"2412.17507","last_updated":"2024-12-23T12:08:37Z","snapshot_observed_at":"2026-08-14T14:01:16.816215Z","submitted_at":"2024-12-23T12:08:37Z","title":"UME: Upcycling Mixture-of-Experts for Scalable and Efficient Automatic Speech Recognition","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T05:31:45.838297Z"},"links":{"citing_paper":"/paper/2412.17507"},"observation_digest":"sha256:3ae1b8f03e30af74ebf42309c40d5866847f04a63a4a548b7049f1689834ddcf","observation_id":"51f16ebd-3beb-4fb6-bee5-98916dadd991","resolution":{"observed_at":"2026-08-11T05:31:46.239057Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16407","last_updated":"2024-08-08T09:01:00Z","snapshot_observed_at":"2026-08-16T13:57:58.973767Z","submitted_at":"2024-04-25T08:34:21Z","title":"U2++ MoE: Scaling 4.7x parameters with minimal impact on RTF","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16407","snapshot_observed_at":"2026-08-11T05:31:45.841860Z","title":"U2++ moe: Scal- ing 4.7 x parameters with minimal impact on rtf,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17507","last_updated":"2024-12-23T12:08:37Z","snapshot_observed_at":"2026-08-14T14:01:16.816215Z","submitted_at":"2024-12-23T12:08:37Z","title":"UME: Upcycling Mixture-of-Experts for Scalable and Efficient Automatic Speech Recognition","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T05:31:45.841860Z"},"links":{"cited_paper":"/paper/2404.16407","citing_paper":"/paper/2412.17507"},"observation_digest":"sha256:62d6bbaea8f5801fc26cb31195cdfa33d244c22ad09c9d8b0807d5a23bc8ce8d","observation_id":"8894a8e9-e7f0-4f8e-9663-1ccc5aab77ab","resolution":{"observed_at":"2026-08-11T05:31:45.841860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:31:46.221248Z","title":"Conformer: Convolution-augmented transformer for speech recognition,","venue":null,"work_id":"3d7a1e8d-8ade-4131-99d5-546a5bc085e7","year":2020},"citing_paper":{"arxiv_id":"2412.17507","last_updated":"2024-12-23T12:08:37Z","snapshot_observed_at":"2026-08-14T14:01:16.816215Z","submitted_at":"2024-12-23T12:08:37Z","title":"UME: Upcycling Mixture-of-Experts for Scalable and Efficient Automatic Speech Recognition","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T05:31:45.845857Z"},"links":{"citing_paper":"/paper/2412.17507"},"observation_digest":"sha256:e7b9a5380fb7ee0d22c29ea3be08acb80e52773b60ff08e21cfb8593b164c953","observation_id":"f7bfca95-001c-472c-9a83-8b521bc67ed7","resolution":{"observed_at":"2026-08-11T05:31:46.225749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:31:46.207444Z","title":"Massively multilingual asr: A lifelong learning solution,","venue":null,"work_id":"3bba1788-7881-48ea-ae89-4749b31168fb","year":2022},"citing_paper":{"arxiv_id":"2412.17507","last_updated":"2024-12-23T12:08:37Z","snapshot_observed_at":"2026-08-14T14:01:16.816215Z","submitted_at":"2024-12-23T12:08:37Z","title":"UME: Upcycling Mixture-of-Experts for Scalable and Efficient Automatic Speech Recognition","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T05:31:45.850216Z"},"links":{"citing_paper":"/paper/2412.17507"},"observation_digest":"sha256:2a69894d724d284be0be2e807ad3968d2320019bed65d36e4dd0a2c049eead5f","observation_id":"facb98b8-aab9-4b2f-ad77-5059ade415ae","resolution":{"observed_at":"2026-08-11T05:31:46.212790Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:31:46.194154Z","title":"Incremental learning for end-to-end automatic speech recognition,","venue":null,"work_id":"de0e2100-a13b-440b-b637-dd436c455c93","year":2021},"citing_paper":{"arxiv_id":"2412.17507","last_updated":"2024-12-23T12:08:37Z","snapshot_observed_at":"2026-08-14T14:01:16.816215Z","submitted_at":"2024-12-23T12:08:37Z","title":"UME: Upcycling Mixture-of-Experts for Scalable and Efficient Automatic Speech Recognition","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T05:31:45.853940Z"},"links":{"citing_paper":"/paper/2412.17507"},"observation_digest":"sha256:73dbef1ff08b24a5c360cd419090b48d2b510606727d8beaa685812b0925fa1e","observation_id":"aea8e3b8-9c32-4e58-a10a-53fc946bda22","resolution":{"observed_at":"2026-08-11T05:31:46.199163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:31:46.182811Z","title":"A comparison of parameter-efficient asr domain adaptation methods for universal speech and language models,","venue":null,"work_id":"4444735a-93a3-46a8-b8e6-595be3597653","year":2024},"citing_paper":{"arxiv_id":"2412.17507","last_updated":"2024-12-23T12:08:37Z","snapshot_observed_at":"2026-08-14T14:01:16.816215Z","submitted_at":"2024-12-23T12:08:37Z","title":"UME: Upcycling Mixture-of-Experts for Scalable and Efficient Automatic Speech Recognition","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T05:31:45.857826Z"},"links":{"citing_paper":"/paper/2412.17507"},"observation_digest":"sha256:567ac2f5478ee9c38fa2e641208053aaa6934f84ec868e78a19c8f1b4194d082","observation_id":"2af63dbc-1672-4872-aa08-003ca776277b","resolution":{"observed_at":"2026-08-11T05:31:46.186582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:31:46.169167Z","title":"Lora: Low-rank adaptation of large language models,","venue":null,"work_id":"407638a0-a523-4225-a1e2-451719529a65","year":2022},"citing_paper":{"arxiv_id":"2412.17507","last_updated":"2024-12-23T12:08:37Z","snapshot_observed_at":"2026-08-14T14:01:16.816215Z","submitted_at":"2024-12-23T12:08:37Z","title":"UME: Upcycling Mixture-of-Experts for Scalable and Efficient Automatic Speech Recognition","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T05:31:45.861692Z"},"links":{"citing_paper":"/paper/2412.17507"},"observation_digest":"sha256:2d80f6287fa54969e67a45af2bb380051d4fdebcaae541dd33cd95735366c312","observation_id":"fa956995-f1cf-4192-b21c-d8ac917ac5b9","resolution":{"observed_at":"2026-08-11T05:31:46.175266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:31:46.156340Z","title":"Sparsely shared lora on whisper for child speech recognition,","venue":null,"work_id":"bb71d8e0-1fee-4cc0-aa2f-b7cb2abe3278","year":2024},"citing_paper":{"arxiv_id":"2412.17507","last_updated":"2024-12-23T12:08:37Z","snapshot_observed_at":"2026-08-14T14:01:16.816215Z","submitted_at":"2024-12-23T12:08:37Z","title":"UME: Upcycling Mixture-of-Experts for Scalable and Efficient Automatic Speech Recognition","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T05:31:45.865389Z"},"links":{"citing_paper":"/paper/2412.17507"},"observation_digest":"sha256:7433c30af5e1a60b28ad1573448c44706b948d8f89bf061ab0ccf198f5c17ade","observation_id":"04997137-ffdb-40c0-b13c-d19b58afac2f","resolution":{"observed_at":"2026-08-11T05:31:46.160691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:31:46.144084Z","title":"Residual adapters for parameter-efficient asr adaptation to atypical and accented speech,","venue":null,"work_id":"d7bac55c-78ed-4bde-a5cf-613518d5ccc7","year":2021},"citing_paper":{"arxiv_id":"2412.17507","last_updated":"2024-12-23T12:08:37Z","snapshot_observed_at":"2026-08-14T14:01:16.816215Z","submitted_at":"2024-12-23T12:08:37Z","title":"UME: Upcycling Mixture-of-Experts for Scalable and Efficient Automatic Speech Recognition","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T05:31:45.869007Z"},"links":{"citing_paper":"/paper/2412.17507"},"observation_digest":"sha256:47942627a6049fe9cc580f912f3b49c208fa2132befb4c04d50861228b1fce17","observation_id":"b9738662-3ee6-45d4-b668-d835e68a7166","resolution":{"observed_at":"2026-08-11T05:31:46.148401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:31:46.130219Z","title":"Exploiting adapters for cross-lingual low-resource speech recognition,","venue":null,"work_id":"691f6a4e-659a-428e-8164-1ce0ec5b7c5e","year":2021},"citing_paper":{"arxiv_id":"2412.17507","last_updated":"2024-12-23T12:08:37Z","snapshot_observed_at":"2026-08-14T14:01:16.816215Z","submitted_at":"2024-12-23T12:08:37Z","title":"UME: Upcycling Mixture-of-Experts for Scalable and Efficient Automatic Speech Recognition","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T05:31:45.873002Z"},"links":{"citing_paper":"/paper/2412.17507"},"observation_digest":"sha256:e06858aa92418658390ebd1f191d192bdb56dfe126b8e1f02fd41e90eeef01a4","observation_id":"8244306a-1a7d-416a-a308-dbb1625557fe","resolution":{"observed_at":"2026-08-11T05:31:46.134720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:31:46.117222Z","title":"Funasr: A fundamental end-to-end speech recognition toolkit,","venue":null,"work_id":"5e316e56-f968-4b54-b99f-2f30bd72762b","year":2023},"citing_paper":{"arxiv_id":"2412.17507","last_updated":"2024-12-23T12:08:37Z","snapshot_observed_at":"2026-08-14T14:01:16.816215Z","submitted_at":"2024-12-23T12:08:37Z","title":"UME: Upcycling Mixture-of-Experts for Scalable and Efficient Automatic Speech Recognition","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T05:31:45.876729Z"},"links":{"citing_paper":"/paper/2412.17507"},"observation_digest":"sha256:44ec07d92ab7d1e4fcee9c29eda8740182effd41808281d7f974b957b58b0cdf","observation_id":"acfff059-c171-4953-841d-c1130836428d","resolution":{"observed_at":"2026-08-11T05:31:46.121515Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:31:46.102740Z","title":"Paraformer: Fast and accurate parallel transformer for non-autoregressive end-to- end speech recognition,","venue":null,"work_id":"01498ab6-c948-4d53-8a3c-8c46d78016c9","year":2022},"citing_paper":{"arxiv_id":"2412.17507","last_updated":"2024-12-23T12:08:37Z","snapshot_observed_at":"2026-08-14T14:01:16.816215Z","submitted_at":"2024-12-23T12:08:37Z","title":"UME: Upcycling Mixture-of-Experts for Scalable and Efficient Automatic Speech Recognition","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T05:31:45.880769Z"},"links":{"citing_paper":"/paper/2412.17507"},"observation_digest":"sha256:c0fde9d28fcad1e2b01e49227eaee942f7944fa95ae0c2a112d0508b529fd05f","observation_id":"62d2b0f0-26de-4e4a-8736-db5e212d91c2","resolution":{"observed_at":"2026-08-11T05:31:46.107474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02415","last_updated":"2024-05-30T04:45:34Z","snapshot_observed_at":"2026-08-16T14:29:46.614553Z","submitted_at":"2024-01-04T18:59:12Z","title":"LLaMA Pro: Progressive LLaMA with Block Expansion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02415","snapshot_observed_at":"2026-08-11T05:31:45.884693Z","title":"Llama pro: Progressive llama with block expansion,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17507","last_updated":"2024-12-23T12:08:37Z","snapshot_observed_at":"2026-08-14T14:01:16.816215Z","submitted_at":"2024-12-23T12:08:37Z","title":"UME: Upcycling Mixture-of-Experts for Scalable and Efficient Automatic Speech Recognition","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T05:31:45.884693Z"},"links":{"cited_paper":"/paper/2401.02415","citing_paper":"/paper/2412.17507"},"observation_digest":"sha256:cbca96100f88c5137a8038d779434376bfe48f672686be4f71d4d08cf96cc85a","observation_id":"757865e8-760a-464c-bca9-03f4113f0029","resolution":{"observed_at":"2026-08-11T05:31:45.884693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:31:46.089096Z","title":"Smartfrz: An efficient train- ing framework using attention-based layer freezing,","venue":null,"work_id":"d635213b-80e3-4f63-82a6-1eaa19036eef","year":2023},"citing_paper":{"arxiv_id":"2412.17507","last_updated":"2024-12-23T12:08:37Z","snapshot_observed_at":"2026-08-14T14:01:16.816215Z","submitted_at":"2024-12-23T12:08:37Z","title":"UME: Upcycling Mixture-of-Experts for Scalable and Efficient Automatic Speech Recognition","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T05:31:45.888179Z"},"links":{"citing_paper":"/paper/2412.17507"},"observation_digest":"sha256:4033a03567fab81c24606276941c9243995d371f24932434f740e8024d5c60d8","observation_id":"a3405737-ff8a-477c-8968-4907267130bd","resolution":{"observed_at":"2026-08-11T05:31:46.093447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:31:46.077037Z","title":"Wenetspeech: A 10000+ hours multi-domain mandarin corpus for speech recognition,","venue":null,"work_id":"d8eea385-4f1d-4bd3-99a3-61354703bb0e","year":2022},"citing_paper":{"arxiv_id":"2412.17507","last_updated":"2024-12-23T12:08:37Z","snapshot_observed_at":"2026-08-14T14:01:16.816215Z","submitted_at":"2024-12-23T12:08:37Z","title":"UME: Upcycling Mixture-of-Experts for Scalable and Efficient Automatic Speech Recognition","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T05:31:45.891707Z"},"links":{"citing_paper":"/paper/2412.17507"},"observation_digest":"sha256:b981431f85752cf2d0189faef76270f51dd52262f3a70952c90095a9ede88e1a","observation_id":"5b638b6e-9ab0-4595-bb64-6961b0ef84cc","resolution":{"observed_at":"2026-08-11T05:31:46.081135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:31:46.064812Z","title":"Aishell-4: An open source dataset for speech enhancement, separation, recognition and speaker diarization in conference scenario,","venue":null,"work_id":"91e763b8-ebb3-453a-94a7-055b21392818","year":2021},"citing_paper":{"arxiv_id":"2412.17507","last_updated":"2024-12-23T12:08:37Z","snapshot_observed_at":"2026-08-14T14:01:16.816215Z","submitted_at":"2024-12-23T12:08:37Z","title":"UME: Upcycling Mixture-of-Experts for Scalable and Efficient Automatic Speech Recognition","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T05:31:45.894928Z"},"links":{"citing_paper":"/paper/2412.17507"},"observation_digest":"sha256:105b117edec4c84aa8baab0ee5c3a4f0aace06c5d8d03c8beeb4e8350477be5e","observation_id":"61eaed8a-96b9-4b27-bb7d-9cc5ebb98b23","resolution":{"observed_at":"2026-08-11T05:31:46.068826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:31:46.050592Z","title":"Gigaspeech: An evolving, multi-domain asr corpus with 10,000 hours of transcribed audio,","venue":null,"work_id":"efa12e7a-ab06-4741-9550-3542c461e948","year":2021},"citing_paper":{"arxiv_id":"2412.17507","last_updated":"2024-12-23T12:08:37Z","snapshot_observed_at":"2026-08-14T14:01:16.816215Z","submitted_at":"2024-12-23T12:08:37Z","title":"UME: Upcycling Mixture-of-Experts for Scalable and Efficient Automatic Speech Recognition","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T05:31:45.898745Z"},"links":{"citing_paper":"/paper/2412.17507"},"observation_digest":"sha256:e3469e992f150e11c82b2b14a71a1b81ba49c7931e65be23360a50f006913394","observation_id":"9691e893-35fc-4902-abaa-50373cdab966","resolution":{"observed_at":"2026-08-11T05:31:46.055397Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:31:46.039065Z","title":"Connection- ist temporal classification: Labelling unsegmented sequence data with recurrent neural networks,","venue":null,"work_id":"ca93be61-35d6-4e92-8cff-0592a6149926","year":2006},"citing_paper":{"arxiv_id":"2412.17507","last_updated":"2024-12-23T12:08:37Z","snapshot_observed_at":"2026-08-14T14:01:16.816215Z","submitted_at":"2024-12-23T12:08:37Z","title":"UME: Upcycling Mixture-of-Experts for Scalable and Efficient Automatic Speech Recognition","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T05:31:45.902125Z"},"links":{"citing_paper":"/paper/2412.17507"},"observation_digest":"sha256:4393dac2c69ee748b7142b4cb9fac383b89df2780427797cc8f1b9c056033302","observation_id":"fd43b5ba-6aaa-4517-9bca-f4a668e883be","resolution":{"observed_at":"2026-08-11T05:31:46.042820Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.17507","last_updated":"2024-12-23T12:08:37Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-14T14:01:16.816215Z","submitted_at":"2024-12-23T12:08:37Z","title":"UME: Upcycling Mixture-of-Experts for Scalable and Efficient Automatic Speech Recognition"},"reference_resolution":{"displayed":42,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":6,"verified_exact":1,"verified_fuzzy":35},"total_outbound_references":42},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 42 of 42 outbound references and 0 inbound Pith citation observations for arXiv:2412.17507."}