{"as_of":"2026-08-13T06:36:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1b25cf392cecc8411200eec304ed86fe3534b2b69d9ee07d7bd5b4c43a549080","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T11:34:43.082458Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T11:34:42.898199Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-12T11:34:43.135889Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.18107","last_updated":"2024-11-27T07:36:52Z","snapshot_observed_at":"2026-08-12T11:28:37.910397Z","submitted_at":"2024-11-27T07:36:52Z","title":"Fusion of Discrete Representations and Self-Augmented Representations for Multilingual Automatic Speech Recognition","version":1},"cited_work":{"arxiv_id":"2411.18107","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.18107","snapshot_observed_at":"2026-08-12T11:34:43.135889Z","title":"Fusion of Discrete Representations and Self-Augmented Representations for Multilingual Automatic Speech Recognition","venue":"cs.SD","work_id":"3f666389-c687-4f9a-9b2c-09b6350c96ac","year":2024},"citing_paper":{"arxiv_id":"2411.18107","last_updated":"2024-11-27T07:36:52Z","snapshot_observed_at":"2026-08-12T11:28:37.910397Z","submitted_at":"2024-11-27T07:36:52Z","title":"Fusion of Discrete Representations and Self-Augmented Representations for Multilingual Automatic Speech Recognition","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T11:34:42.898199Z"},"links":{"cited_paper":"/paper/2411.18107","citing_paper":"/paper/2411.18107"},"observation_digest":"sha256:5a41db7d6e044b4f49fc635d2cc6c49cf53b97155f6e0cb7d2fad80bc9239ce2","observation_id":"addbb92a-e430-416c-840f-0a6916870228","resolution":{"observed_at":"2026-08-12T11:34:43.143055Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2411.18107/citation-record","integrity":"/paper/2411.18107/integrity","json":"/paper/2411.18107/citation-record.json","paper":"/paper/2411.18107"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.18107","last_updated":"2024-11-27T07:36:52Z","snapshot_observed_at":"2026-08-12T11:28:37.910397Z","submitted_at":"2024-11-27T07:36:52Z","title":"Fusion of Discrete Representations and Self-Augmented Representations for Multilingual Automatic Speech Recognition","version":1},"cited_work":{"arxiv_id":"2411.18107","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.18107","snapshot_observed_at":"2026-08-12T11:34:43.135889Z","title":"Fusion of Discrete Representations and Self-Augmented Representations for Multilingual Automatic Speech Recognition","venue":"cs.SD","work_id":"3f666389-c687-4f9a-9b2c-09b6350c96ac","year":2024},"citing_paper":{"arxiv_id":"2411.18107","last_updated":"2024-11-27T07:36:52Z","snapshot_observed_at":"2026-08-12T11:28:37.910397Z","submitted_at":"2024-11-27T07:36:52Z","title":"Fusion of Discrete Representations and Self-Augmented Representations for Multilingual Automatic Speech Recognition","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T11:34:42.898199Z"},"links":{"cited_paper":"/paper/2411.18107","citing_paper":"/paper/2411.18107"},"observation_digest":"sha256:5a41db7d6e044b4f49fc635d2cc6c49cf53b97155f6e0cb7d2fad80bc9239ce2","observation_id":"addbb92a-e430-416c-840f-0a6916870228","resolution":{"observed_at":"2026-08-12T11:34:43.143055Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:34:43.711964Z","title":"Discretization process Figure 1 provides a high-level overview of our fusion pipeline","venue":null,"work_id":"0d7f0cdd-ae8f-46cc-b408-9792b6514c52","year":null},"citing_paper":{"arxiv_id":"2411.18107","last_updated":"2024-11-27T07:36:52Z","snapshot_observed_at":"2026-08-12T11:28:37.910397Z","submitted_at":"2024-11-27T07:36:52Z","title":"Fusion of Discrete Representations and Self-Augmented Representations for Multilingual Automatic Speech Recognition","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T11:34:42.904143Z"},"links":{"citing_paper":"/paper/2411.18107"},"observation_digest":"sha256:84ace8157e9ce827abadce4e09097cc34db533ebfffeb7e219cee537b91bd221","observation_id":"7778cee4-a5f6-4558-93e2-96a7bcf9caba","resolution":{"observed_at":"2026-08-12T11:34:43.716932Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:34:43.697662Z","title":null,"venue":null,"work_id":"402f7996-ba2b-461a-a859-cbf0b1f4cebe","year":null},"citing_paper":{"arxiv_id":"2411.18107","last_updated":"2024-11-27T07:36:52Z","snapshot_observed_at":"2026-08-12T11:28:37.910397Z","submitted_at":"2024-11-27T07:36:52Z","title":"Fusion of Discrete Representations and Self-Augmented Representations for Multilingual Automatic Speech Recognition","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T11:34:42.909090Z"},"links":{"citing_paper":"/paper/2411.18107"},"observation_digest":"sha256:549aa9557e6517b9b1466db84388563b47d34f779658e50aa4c2b33ac350d021","observation_id":"40d72017-11ef-4591-84a0-9c18c8aca1f1","resolution":{"observed_at":"2026-08-12T11:34:43.702238Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:34:43.682822Z","title":"Dataset We evaluated the proposed method on LibriSpeech-100h [29] and ML-SUPERB [12]","venue":null,"work_id":"2fd972c3-9dce-4853-a5a6-46a302355091","year":2024},"citing_paper":{"arxiv_id":"2411.18107","last_updated":"2024-11-27T07:36:52Z","snapshot_observed_at":"2026-08-12T11:28:37.910397Z","submitted_at":"2024-11-27T07:36:52Z","title":"Fusion of Discrete Representations and Self-Augmented Representations for Multilingual Automatic Speech Recognition","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T11:34:42.913865Z"},"links":{"citing_paper":"/paper/2411.18107"},"observation_digest":"sha256:787b3497008e7d9757512de6b3aae9562448a84d8e0214de8b14a2b37ddbbc63","observation_id":"5c85dc06-3d76-4957-b5a5-be28f69811f9","resolution":{"observed_at":"2026-08-12T11:34:43.687931Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:34:43.668320Z","title":"Quantitative result ASR results","venue":null,"work_id":"70d975e1-ce3f-42c5-bd15-fd0926ef2d9a","year":null},"citing_paper":{"arxiv_id":"2411.18107","last_updated":"2024-11-27T07:36:52Z","snapshot_observed_at":"2026-08-12T11:28:37.910397Z","submitted_at":"2024-11-27T07:36:52Z","title":"Fusion of Discrete Representations and Self-Augmented Representations for Multilingual Automatic Speech Recognition","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T11:34:42.918993Z"},"links":{"citing_paper":"/paper/2411.18107"},"observation_digest":"sha256:0790f77e5b36a9921578b7b6c0f97077b2d29a602e8bddb84678fa233ba3ea08","observation_id":"41f686be-3a5c-4de4-9a6f-89846c00aa29","resolution":{"observed_at":"2026-08-12T11:34:43.673010Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:34:43.652972Z","title":"self-augmented","venue":null,"work_id":"701417aa-0b52-494b-831a-0200c485f670","year":null},"citing_paper":{"arxiv_id":"2411.18107","last_updated":"2024-11-27T07:36:52Z","snapshot_observed_at":"2026-08-12T11:28:37.910397Z","submitted_at":"2024-11-27T07:36:52Z","title":"Fusion of Discrete Representations and Self-Augmented Representations for Multilingual Automatic Speech Recognition","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T11:34:42.924135Z"},"links":{"citing_paper":"/paper/2411.18107"},"observation_digest":"sha256:f7eb2ab71b1bceb6b66705ecd91dc7dbe4ad3e158f3f59d0daa541a896723591","observation_id":"48d47749-f251-40bf-bc93-c1d89e78286e","resolution":{"observed_at":"2026-08-12T11:34:43.658034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:34:43.637556Z","title":"HuBERT: Self-supervised speech rep- resentation learning by masked prediction of hidden units,","venue":null,"work_id":"fdc3fc1c-301a-4cb6-93a2-1c2bfa076fb2","year":2021},"citing_paper":{"arxiv_id":"2411.18107","last_updated":"2024-11-27T07:36:52Z","snapshot_observed_at":"2026-08-12T11:28:37.910397Z","submitted_at":"2024-11-27T07:36:52Z","title":"Fusion of Discrete Representations and Self-Augmented Representations for Multilingual Automatic Speech Recognition","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T11:34:42.928858Z"},"links":{"citing_paper":"/paper/2411.18107"},"observation_digest":"sha256:edfaa7051dfaa84d99f17e34ffe95037b4c01977558f19901a217670a9e4fcb3","observation_id":"4d42857b-202d-4640-bf32-919a286e4c11","resolution":{"observed_at":"2026-08-12T11:34:43.642511Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:34:43.622082Z","title":"A Survey of Multi- lingual Models for Automatic Speech Recognition,","venue":null,"work_id":"e39178a0-f23e-430e-aa48-80789b8df4e6","year":2022},"citing_paper":{"arxiv_id":"2411.18107","last_updated":"2024-11-27T07:36:52Z","snapshot_observed_at":"2026-08-12T11:28:37.910397Z","submitted_at":"2024-11-27T07:36:52Z","title":"Fusion of Discrete Representations and Self-Augmented Representations for Multilingual Automatic Speech Recognition","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T11:34:42.933675Z"},"links":{"citing_paper":"/paper/2411.18107"},"observation_digest":"sha256:c8368cfe5071783ecebfdbdea3dd4da14a7f7146f84e62c8ae260e8a011016f1","observation_id":"2ccf15b9-a944-4d7e-8834-1aa0bfd65702","resolution":{"observed_at":"2026-08-12T11:34:43.627743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:34:43.607142Z","title":"Cross-lingual Automatic Speech Recog- nition Exploiting Articulatory Features,","venue":null,"work_id":"0c8243c9-b62a-4b2a-9e87-dcbc1181cc72","year":2019},"citing_paper":{"arxiv_id":"2411.18107","last_updated":"2024-11-27T07:36:52Z","snapshot_observed_at":"2026-08-12T11:28:37.910397Z","submitted_at":"2024-11-27T07:36:52Z","title":"Fusion of Discrete Representations and Self-Augmented Representations for Multilingual Automatic Speech Recognition","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T11:34:42.938373Z"},"links":{"citing_paper":"/paper/2411.18107"},"observation_digest":"sha256:9655a0c3c1387654355b6b283a4564f4194452e909e96704f2c19b741ab304f9","observation_id":"f9ded218-8b25-4537-b6d8-4f548066e6af","resolution":{"observed_at":"2026-08-12T11:34:43.612015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:34:43.591920Z","title":"wav2vec 2.0: A framework for self- supervised learning of speech representations,","venue":null,"work_id":"aa0f73a4-b8af-476a-9eb8-d8eb4b34e70d","year":2020},"citing_paper":{"arxiv_id":"2411.18107","last_updated":"2024-11-27T07:36:52Z","snapshot_observed_at":"2026-08-12T11:28:37.910397Z","submitted_at":"2024-11-27T07:36:52Z","title":"Fusion of Discrete Representations and Self-Augmented Representations for Multilingual Automatic Speech Recognition","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T11:34:42.943156Z"},"links":{"citing_paper":"/paper/2411.18107"},"observation_digest":"sha256:3b192b7a30e350bcf5bd7ca7b2d2d796fa961c0772351acfc77f7f504606eed3","observation_id":"2431b646-89c6-4a6f-a99b-070af72cca2b","resolution":{"observed_at":"2026-08-12T11:34:43.596629Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:34:43.577485Z","title":"XLS-R: Self-supervised Cross-lingual Speech Representation Learning at Scale,","venue":null,"work_id":"1261cc68-2388-4e53-9a6b-1eac6d8f9973","year":2022},"citing_paper":{"arxiv_id":"2411.18107","last_updated":"2024-11-27T07:36:52Z","snapshot_observed_at":"2026-08-12T11:28:37.910397Z","submitted_at":"2024-11-27T07:36:52Z","title":"Fusion of Discrete Representations and Self-Augmented Representations for Multilingual Automatic Speech Recognition","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T11:34:42.948404Z"},"links":{"citing_paper":"/paper/2411.18107"},"observation_digest":"sha256:2420aecc31d11cca0d5229deb02289f4c7db39e01b33c45ded6031960460dd1e","observation_id":"95077b77-3dfd-4519-8262-985d41698746","resolution":{"observed_at":"2026-08-12T11:34:43.582162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:34:43.562229Z","title":"W2v-BERT: Combining contrastive learning and masked language modeling for self-supervised speech pre-training,","venue":null,"work_id":"dc38b779-8eac-41b6-9d1c-f421b0f63ce6","year":2021},"citing_paper":{"arxiv_id":"2411.18107","last_updated":"2024-11-27T07:36:52Z","snapshot_observed_at":"2026-08-12T11:28:37.910397Z","submitted_at":"2024-11-27T07:36:52Z","title":"Fusion of Discrete Representations and Self-Augmented Representations for Multilingual Automatic Speech Recognition","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T11:34:42.952834Z"},"links":{"citing_paper":"/paper/2411.18107"},"observation_digest":"sha256:7219cf526bdb142c8782e15a593b787d6ee29f430f826e5e2a805098faf50f36","observation_id":"347b95c1-9056-47b1-97dd-117cf5aef508","resolution":{"observed_at":"2026-08-12T11:34:43.567358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:34:43.547599Z","title":"Wavlm: Large-scale self-supervised pre- training for full stack speech processing,","venue":null,"work_id":"a27312de-06e2-473f-893f-51a458a0b9b7","year":2021},"citing_paper":{"arxiv_id":"2411.18107","last_updated":"2024-11-27T07:36:52Z","snapshot_observed_at":"2026-08-12T11:28:37.910397Z","submitted_at":"2024-11-27T07:36:52Z","title":"Fusion of Discrete Representations and Self-Augmented Representations for Multilingual Automatic Speech Recognition","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T11:34:42.958911Z"},"links":{"citing_paper":"/paper/2411.18107"},"observation_digest":"sha256:cf1580549edada25b17f5d1ff032e31c57408f2de3d38870cc16236ffa63ed33","observation_id":"c34e7edf-e82d-4c8d-aa10-45eaae192b7a","resolution":{"observed_at":"2026-08-12T11:34:43.552377Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:34:43.532752Z","title":"Self-supervised speech repre- sentation learning: A review,","venue":null,"work_id":"7c6fc15a-c05f-4c92-9cc4-185aa6066c6b","year":2022},"citing_paper":{"arxiv_id":"2411.18107","last_updated":"2024-11-27T07:36:52Z","snapshot_observed_at":"2026-08-12T11:28:37.910397Z","submitted_at":"2024-11-27T07:36:52Z","title":"Fusion of Discrete Representations and Self-Augmented Representations for Multilingual Automatic Speech Recognition","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T11:34:42.963844Z"},"links":{"citing_paper":"/paper/2411.18107"},"observation_digest":"sha256:c2be17299557792520ed3bbeeda3a4f6f80b1554523107c5663d288493ecc461","observation_id":"95714afb-2bb4-4efc-8a4c-6bc0841a6e58","resolution":{"observed_at":"2026-08-12T11:34:43.537588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:34:43.517919Z","title":"Multi-resolution huBERT: Multi-resolution speech self-supervised learning with masked unit prediction,","venue":null,"work_id":"0f905c61-4e7f-44a0-bc9a-7a5f6af1e54f","year":2024},"citing_paper":{"arxiv_id":"2411.18107","last_updated":"2024-11-27T07:36:52Z","snapshot_observed_at":"2026-08-12T11:28:37.910397Z","submitted_at":"2024-11-27T07:36:52Z","title":"Fusion of Discrete Representations and Self-Augmented Representations for Multilingual Automatic Speech Recognition","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T11:34:42.968484Z"},"links":{"citing_paper":"/paper/2411.18107"},"observation_digest":"sha256:adb6976b168b1a601590c4225e98179bb790b9a228c20e76ae6ab08201766fed","observation_id":"9dfbe30f-78d1-40f9-a069-5ec9779f8083","resolution":{"observed_at":"2026-08-12T11:34:43.522813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:34:43.503692Z","title":"Scaling speech technology to 1,000+ languages,","venue":null,"work_id":"774b2a77-2ee7-4a0a-ac4c-4deb373bb0ce","year":2023},"citing_paper":{"arxiv_id":"2411.18107","last_updated":"2024-11-27T07:36:52Z","snapshot_observed_at":"2026-08-12T11:28:37.910397Z","submitted_at":"2024-11-27T07:36:52Z","title":"Fusion of Discrete Representations and Self-Augmented Representations for Multilingual Automatic Speech Recognition","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T11:34:42.973148Z"},"links":{"citing_paper":"/paper/2411.18107"},"observation_digest":"sha256:3c3839294a06d851e661f83b410794ec6552d034c267e0a3ed412bc7d705d9ae","observation_id":"a945e848-6a0d-49b3-b28d-ba67249f793f","resolution":{"observed_at":"2026-08-12T11:34:43.508388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:34:43.488758Z","title":"SUPERB: Speech Processing Universal PERformance Benchmark,","venue":null,"work_id":"75f63f4a-2173-434d-a731-38a00466cc38","year":2021},"citing_paper":{"arxiv_id":"2411.18107","last_updated":"2024-11-27T07:36:52Z","snapshot_observed_at":"2026-08-12T11:28:37.910397Z","submitted_at":"2024-11-27T07:36:52Z","title":"Fusion of Discrete Representations and Self-Augmented Representations for Multilingual Automatic Speech Recognition","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T11:34:42.977682Z"},"links":{"citing_paper":"/paper/2411.18107"},"observation_digest":"sha256:6f1642ca88af5f48888575acff06255bddd1608057335924f5db606a7ddd4300","observation_id":"812838b2-3ebd-496e-8fd9-71e18ce10da1","resolution":{"observed_at":"2026-08-12T11:34:43.493670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:34:43.473256Z","title":"ML-SUPERB: Multilingual Speech Uni- versal PERformance Benchmark,","venue":null,"work_id":"e7a6bc21-2d14-43f5-ae78-e169a1674aed","year":2023},"citing_paper":{"arxiv_id":"2411.18107","last_updated":"2024-11-27T07:36:52Z","snapshot_observed_at":"2026-08-12T11:28:37.910397Z","submitted_at":"2024-11-27T07:36:52Z","title":"Fusion of Discrete Representations and Self-Augmented Representations for Multilingual Automatic Speech Recognition","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T11:34:42.982163Z"},"links":{"citing_paper":"/paper/2411.18107"},"observation_digest":"sha256:a40538c8231b3ee472ef5cae0eab935ac7360f2e7ff3eebc5342e36ae91cf88d","observation_id":"ab5e4686-c59d-4fde-b42c-18f259eb17ce","resolution":{"observed_at":"2026-08-12T11:34:43.478182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:34:43.457632Z","title":"Exploring speech recognition, transla- tion, and understanding with discrete speech units: A compar- ative study,","venue":null,"work_id":"3720f3b7-9dbe-470f-99e3-08a8fca34c4a","year":2023},"citing_paper":{"arxiv_id":"2411.18107","last_updated":"2024-11-27T07:36:52Z","snapshot_observed_at":"2026-08-12T11:28:37.910397Z","submitted_at":"2024-11-27T07:36:52Z","title":"Fusion of Discrete Representations and Self-Augmented Representations for Multilingual Automatic Speech Recognition","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T11:34:42.986449Z"},"links":{"citing_paper":"/paper/2411.18107"},"observation_digest":"sha256:43caed3499f4a03defb7825875394710594dee04747879ac4cd926c690e02049","observation_id":"f5bcc383-6ce3-4b16-83ab-0532e19ffd77","resolution":{"observed_at":"2026-08-12T11:34:43.462846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:34:43.442259Z","title":"An Exploration of Prompt Tuning on Generative Spoken Language Model for Speech Processing Tasks,","venue":null,"work_id":"8ba51543-91ee-4d17-8e7d-3af3f7d174ad","year":2022},"citing_paper":{"arxiv_id":"2411.18107","last_updated":"2024-11-27T07:36:52Z","snapshot_observed_at":"2026-08-12T11:28:37.910397Z","submitted_at":"2024-11-27T07:36:52Z","title":"Fusion of Discrete Representations and Self-Augmented Representations for Multilingual Automatic Speech Recognition","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T11:34:42.991048Z"},"links":{"citing_paper":"/paper/2411.18107"},"observation_digest":"sha256:7b4e2c2db79b60265327787eeaf0951effde66e104636b8f327fe193b6489abd","observation_id":"5d281b8c-764a-42e6-8108-d988429f4f0d","resolution":{"observed_at":"2026-08-12T11:34:43.447264Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:34:43.427209Z","title":"Towards universal speech discrete tokens: A case study for asr and tts,","venue":null,"work_id":"3c9cabe6-e1b3-44a1-b623-fea9250c0252","year":2024},"citing_paper":{"arxiv_id":"2411.18107","last_updated":"2024-11-27T07:36:52Z","snapshot_observed_at":"2026-08-12T11:28:37.910397Z","submitted_at":"2024-11-27T07:36:52Z","title":"Fusion of Discrete Representations and Self-Augmented Representations for Multilingual Automatic Speech Recognition","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T11:34:42.995775Z"},"links":{"citing_paper":"/paper/2411.18107"},"observation_digest":"sha256:441332e8b3ecc890bb189105d093365522b0873f11b64faea547072cd7c8fb94","observation_id":"5b73ff31-a19a-476a-9370-8edcc61265af","resolution":{"observed_at":"2026-08-12T11:34:43.432134Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:34:43.412831Z","title":"Acoustic bpe for speech generation with dis- crete tokens,","venue":null,"work_id":"00f6baf9-8ec0-4c78-a0a9-42b288f38c18","year":2024},"citing_paper":{"arxiv_id":"2411.18107","last_updated":"2024-11-27T07:36:52Z","snapshot_observed_at":"2026-08-12T11:28:37.910397Z","submitted_at":"2024-11-27T07:36:52Z","title":"Fusion of Discrete Representations and Self-Augmented Representations for Multilingual Automatic Speech Recognition","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T11:34:43.000017Z"},"links":{"citing_paper":"/paper/2411.18107"},"observation_digest":"sha256:b4d71253961d6ded26259a645e38f8d540863796df21d9b387ac736c40120fca","observation_id":"7b89fbaf-c25d-4936-bbf2-50ce11887f5a","resolution":{"observed_at":"2026-08-12T11:34:43.417656Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:34:43.397372Z","title":"V oxtlm: Unified decoder-only models for consolidating speech recognition, synthesis and speech, text continuation tasks,","venue":null,"work_id":"9a74eebe-475a-4e53-8d1a-faea3c2f9651","year":2024},"citing_paper":{"arxiv_id":"2411.18107","last_updated":"2024-11-27T07:36:52Z","snapshot_observed_at":"2026-08-12T11:28:37.910397Z","submitted_at":"2024-11-27T07:36:52Z","title":"Fusion of Discrete Representations and Self-Augmented Representations for Multilingual Automatic Speech Recognition","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T11:34:43.004358Z"},"links":{"citing_paper":"/paper/2411.18107"},"observation_digest":"sha256:a48a3134a294e62f1c0f8c406b0aa3d61e9e5723ef5180820011d4d0569164ea","observation_id":"a70f3d72-a00d-41c6-b89e-914edc1694e8","resolution":{"observed_at":"2026-08-12T11:34:43.402217Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:34:43.382647Z","title":"TokenSplit: Using Discrete Speech Representations for Direct, Refined, and Transcript- Conditioned Speech Separation and Recognition,","venue":null,"work_id":"eb3c6209-5cdc-4270-9dca-980140682cba","year":2023},"citing_paper":{"arxiv_id":"2411.18107","last_updated":"2024-11-27T07:36:52Z","snapshot_observed_at":"2026-08-12T11:28:37.910397Z","submitted_at":"2024-11-27T07:36:52Z","title":"Fusion of Discrete Representations and Self-Augmented Representations for Multilingual Automatic Speech Recognition","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T11:34:43.008752Z"},"links":{"citing_paper":"/paper/2411.18107"},"observation_digest":"sha256:359956ed515aad457179a297232a4e93d915e54aeef0b37d9ebcaed4e56a6e86","observation_id":"66479bd1-a262-479e-aa8c-f980edee6fd6","resolution":{"observed_at":"2026-08-12T11:34:43.387524Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:34:43.368247Z","title":"Akvsr: Audio knowledge empowered visual speech recognition by compressing audio knowledge of a pretrained model,","venue":null,"work_id":"7ee4bc7d-946a-4bc9-ae87-8e687c042a31","year":2024},"citing_paper":{"arxiv_id":"2411.18107","last_updated":"2024-11-27T07:36:52Z","snapshot_observed_at":"2026-08-12T11:28:37.910397Z","submitted_at":"2024-11-27T07:36:52Z","title":"Fusion of Discrete Representations and Self-Augmented Representations for Multilingual Automatic Speech Recognition","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T11:34:43.013179Z"},"links":{"citing_paper":"/paper/2411.18107"},"observation_digest":"sha256:15db5f19eecf8776bbba75f2d907fd62c4bbdebaaf464da2a78eed6306cb3033","observation_id":"52ebb251-95ee-4eb4-90de-9411abd50b6d","resolution":{"observed_at":"2026-08-12T11:34:43.372982Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:34:43.353673Z","title":"Lip reading for low-resource lan- guages by learning and combining general speech knowl- edge and language-specific knowledge,","venue":null,"work_id":"fb539ebd-391f-4bc0-9ef6-941b99ad1290","year":2023},"citing_paper":{"arxiv_id":"2411.18107","last_updated":"2024-11-27T07:36:52Z","snapshot_observed_at":"2026-08-12T11:28:37.910397Z","submitted_at":"2024-11-27T07:36:52Z","title":"Fusion of Discrete Representations and Self-Augmented Representations for Multilingual Automatic Speech Recognition","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T11:34:43.017917Z"},"links":{"citing_paper":"/paper/2411.18107"},"observation_digest":"sha256:2d271796f0ddfb55ff81c276873e2f40874cdcec60fb579ba30648ff4fa27160","observation_id":"f0cbf6cc-5289-4c96-8589-a5dc10c30fe1","resolution":{"observed_at":"2026-08-12T11:34:43.358350Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:34:43.339487Z","title":"Exploration of Efficient End-to-End ASR using Discretized Input from Self-Supervised Learning,","venue":null,"work_id":"babebd19-bbbb-4558-98e3-4b8754d3d7b6","year":2023},"citing_paper":{"arxiv_id":"2411.18107","last_updated":"2024-11-27T07:36:52Z","snapshot_observed_at":"2026-08-12T11:28:37.910397Z","submitted_at":"2024-11-27T07:36:52Z","title":"Fusion of Discrete Representations and Self-Augmented Representations for Multilingual Automatic Speech Recognition","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T11:34:43.022835Z"},"links":{"citing_paper":"/paper/2411.18107"},"observation_digest":"sha256:c31bf930a9787315130e26dd8b3738bf1df06c23cc0478bc06fed1bd388109bc","observation_id":"aa65cded-ebcc-482e-90bc-5f2238d1202e","resolution":{"observed_at":"2026-08-12T11:34:43.344252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:34:43.324563Z","title":"EFFUSE: Efficient self-supervised fea- ture fusion for e2e asr in multilingual and low resource scenar- ios,","venue":null,"work_id":"960b2c0a-ec72-4763-9e03-74f4c215eb67","year":2024},"citing_paper":{"arxiv_id":"2411.18107","last_updated":"2024-11-27T07:36:52Z","snapshot_observed_at":"2026-08-12T11:28:37.910397Z","submitted_at":"2024-11-27T07:36:52Z","title":"Fusion of Discrete Representations and Self-Augmented Representations for Multilingual Automatic Speech Recognition","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T11:34:43.027434Z"},"links":{"citing_paper":"/paper/2411.18107"},"observation_digest":"sha256:156d9ee5c5aff77abd3fab0b91c10bd85e9126e4951186c253f82fa4dd58f22c","observation_id":"7e60bd7e-2e94-4034-abc3-7680c251df96","resolution":{"observed_at":"2026-08-12T11:34:43.329653Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:34:43.310262Z","title":"FeaRLESS: Feature Refinement Loss for Ensembling Self-Supervised Learning Features in Robust End-to-end Speech Recognition,","venue":null,"work_id":"9cf123c6-0349-4374-9572-109dbb60d507","year":2022},"citing_paper":{"arxiv_id":"2411.18107","last_updated":"2024-11-27T07:36:52Z","snapshot_observed_at":"2026-08-12T11:28:37.910397Z","submitted_at":"2024-11-27T07:36:52Z","title":"Fusion of Discrete Representations and Self-Augmented Representations for Multilingual Automatic Speech Recognition","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T11:34:43.032257Z"},"links":{"citing_paper":"/paper/2411.18107"},"observation_digest":"sha256:18fe81a426e6afa90ca35518207b9833aa5d4166b35b0f2fb981fbcbc5ebd045","observation_id":"ed665449-56b6-4c1c-95b4-45594bde2e13","resolution":{"observed_at":"2026-08-12T11:34:43.315058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:34:43.295861Z","title":"Combining spectral and self-supervised features for low resource speech recognition and translation,","venue":null,"work_id":"b0ddf8a2-fb17-4f12-97f9-b2fa67f34bca","year":2022},"citing_paper":{"arxiv_id":"2411.18107","last_updated":"2024-11-27T07:36:52Z","snapshot_observed_at":"2026-08-12T11:28:37.910397Z","submitted_at":"2024-11-27T07:36:52Z","title":"Fusion of Discrete Representations and Self-Augmented Representations for Multilingual Automatic Speech Recognition","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T11:34:43.036753Z"},"links":{"citing_paper":"/paper/2411.18107"},"observation_digest":"sha256:4b915e386b6d93099986b74cfab7ed0878baa2c74d2588a426e1509b5365c72b","observation_id":"758dd497-1111-4d7e-8ce3-052c1661eb16","resolution":{"observed_at":"2026-08-12T11:34:43.300591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:34:43.280683Z","title":"Many-to-many spoken language translation via unified speech and text representation learning with unit- to-unit translation,","venue":null,"work_id":"ba5ae2f8-fb1f-422c-a6e9-8b9520a1403f","year":2023},"citing_paper":{"arxiv_id":"2411.18107","last_updated":"2024-11-27T07:36:52Z","snapshot_observed_at":"2026-08-12T11:28:37.910397Z","submitted_at":"2024-11-27T07:36:52Z","title":"Fusion of Discrete Representations and Self-Augmented Representations for Multilingual Automatic Speech Recognition","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T11:34:43.041184Z"},"links":{"citing_paper":"/paper/2411.18107"},"observation_digest":"sha256:072075d3af0d15c8d7d94fdfdd84ed66d1a0309534708bc0b98fce795bd23b38","observation_id":"c08db803-9d7c-4e75-a2c2-0497a54eee67","resolution":{"observed_at":"2026-08-12T11:34:43.285599Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:34:43.265292Z","title":"Intelligible Lip-to-Speech Synthesis with Speech Units,","venue":null,"work_id":"aaab0c3b-460f-4551-9ab6-9c90260f4dea","year":2023},"citing_paper":{"arxiv_id":"2411.18107","last_updated":"2024-11-27T07:36:52Z","snapshot_observed_at":"2026-08-12T11:28:37.910397Z","submitted_at":"2024-11-27T07:36:52Z","title":"Fusion of Discrete Representations and Self-Augmented Representations for Multilingual Automatic Speech Recognition","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T11:34:43.045634Z"},"links":{"citing_paper":"/paper/2411.18107"},"observation_digest":"sha256:8aa588e6a25a4335d06add04e91c66de305840aa10c4f00935d6e38862199d41","observation_id":"e619195d-d4ef-4add-a9e3-734a93d3ec92","resolution":{"observed_at":"2026-08-12T11:34:43.270423Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:34:43.250111Z","title":"Tmt: Tri-modal translation between speech, image, and text by processing different modalities as different languages,","venue":null,"work_id":"4c1259c8-a7e1-46cb-aa27-5298058ce30c","year":2024},"citing_paper":{"arxiv_id":"2411.18107","last_updated":"2024-11-27T07:36:52Z","snapshot_observed_at":"2026-08-12T11:28:37.910397Z","submitted_at":"2024-11-27T07:36:52Z","title":"Fusion of Discrete Representations and Self-Augmented Representations for Multilingual Automatic Speech Recognition","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T11:34:43.050228Z"},"links":{"citing_paper":"/paper/2411.18107"},"observation_digest":"sha256:85f7b2b6bf7e4f9e19373dc1affc6e8fc941ffab5f0af8e4625a2274523b64b0","observation_id":"18648f34-54b8-402d-b5dc-afcece88096e","resolution":{"observed_at":"2026-08-12T11:34:43.255045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:34:43.234319Z","title":"Towards practical and efficient image- to-speech captioning with vision-language pre-training and multi-modal tokens,","venue":null,"work_id":"cd2d193d-1e80-46b0-89bb-721e724b1fee","year":2024},"citing_paper":{"arxiv_id":"2411.18107","last_updated":"2024-11-27T07:36:52Z","snapshot_observed_at":"2026-08-12T11:28:37.910397Z","submitted_at":"2024-11-27T07:36:52Z","title":"Fusion of Discrete Representations and Self-Augmented Representations for Multilingual Automatic Speech Recognition","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T11:34:43.054853Z"},"links":{"citing_paper":"/paper/2411.18107"},"observation_digest":"sha256:fd3f7fc193bd8c5bf4f157580b3385d1764472c5c3ce0978db2255f31dc954b8","observation_id":"190ceaf9-0dd3-47b3-bb07-d98b69d21cd7","resolution":{"observed_at":"2026-08-12T11:34:43.239436Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:34:43.217131Z","title":"Librispeech: An asr corpus based on public domain audio books,","venue":null,"work_id":"da95f7e9-249a-48cc-b63b-00446290e3f2","year":2015},"citing_paper":{"arxiv_id":"2411.18107","last_updated":"2024-11-27T07:36:52Z","snapshot_observed_at":"2026-08-12T11:28:37.910397Z","submitted_at":"2024-11-27T07:36:52Z","title":"Fusion of Discrete Representations and Self-Augmented Representations for Multilingual Automatic Speech Recognition","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T11:34:43.059407Z"},"links":{"citing_paper":"/paper/2411.18107"},"observation_digest":"sha256:cf6cd5db46bc6de889495db4ccb5be0e82b278a9ebe124c6163077db7d7170a2","observation_id":"210d6f74-d2a7-4b09-92db-e31384f746cd","resolution":{"observed_at":"2026-08-12T11:34:43.222619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:34:43.201685Z","title":"The interspeech 2024 challenge on speech processing using discrete units,","venue":null,"work_id":"7c3fd371-a6de-47a5-8db8-05377b42517b","year":2024},"citing_paper":{"arxiv_id":"2411.18107","last_updated":"2024-11-27T07:36:52Z","snapshot_observed_at":"2026-08-12T11:28:37.910397Z","submitted_at":"2024-11-27T07:36:52Z","title":"Fusion of Discrete Representations and Self-Augmented Representations for Multilingual Automatic Speech Recognition","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T11:34:43.063839Z"},"links":{"citing_paper":"/paper/2411.18107"},"observation_digest":"sha256:2344baf2b869ffd28998fad19506b264973114df6d51b04c68a9c1fe099f1bec","observation_id":"4af76440-2cae-4eaf-b3b3-5917da8e5201","resolution":{"observed_at":"2026-08-12T11:34:43.206840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:34:43.186576Z","title":"Attention is all you need,","venue":null,"work_id":"e8ee5810-a389-406e-bb51-a8031e4bc68d","year":2017},"citing_paper":{"arxiv_id":"2411.18107","last_updated":"2024-11-27T07:36:52Z","snapshot_observed_at":"2026-08-12T11:28:37.910397Z","submitted_at":"2024-11-27T07:36:52Z","title":"Fusion of Discrete Representations and Self-Augmented Representations for Multilingual Automatic Speech Recognition","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T11:34:43.068873Z"},"links":{"citing_paper":"/paper/2411.18107"},"observation_digest":"sha256:ee6253de1ae2fda92523677259e6c58a87313ff62f395860c9fec4a500885fe1","observation_id":"e45b46d1-df8a-4939-b472-01b756ae291d","resolution":{"observed_at":"2026-08-12T11:34:43.191353Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:34:43.170762Z","title":"ESPnet: End-to-end speech processing toolkit,","venue":null,"work_id":"72cd53ae-6ad5-4831-97f5-3b7106fb4d48","year":2018},"citing_paper":{"arxiv_id":"2411.18107","last_updated":"2024-11-27T07:36:52Z","snapshot_observed_at":"2026-08-12T11:28:37.910397Z","submitted_at":"2024-11-27T07:36:52Z","title":"Fusion of Discrete Representations and Self-Augmented Representations for Multilingual Automatic Speech Recognition","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T11:34:43.073261Z"},"links":{"citing_paper":"/paper/2411.18107"},"observation_digest":"sha256:8b0bc8bc266aebc9a8ea6dd7345d11f961698284a75e099854b0cc7f2af9ecd4","observation_id":"66439a34-ee79-42e3-bf6d-e5e31190b3ae","resolution":{"observed_at":"2026-08-12T11:34:43.175704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:34:43.154264Z","title":"librosa: Audio and music signal analy- sis in python,","venue":null,"work_id":"68a28d9c-9a8d-4051-9481-4560d5cdeb43","year":2015},"citing_paper":{"arxiv_id":"2411.18107","last_updated":"2024-11-27T07:36:52Z","snapshot_observed_at":"2026-08-12T11:28:37.910397Z","submitted_at":"2024-11-27T07:36:52Z","title":"Fusion of Discrete Representations and Self-Augmented Representations for Multilingual Automatic Speech Recognition","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T11:34:43.077938Z"},"links":{"citing_paper":"/paper/2411.18107"},"observation_digest":"sha256:472def1cdecc4c5abea7bc573f7c8fe41ad77615e914a04b718a66352c5b1961","observation_id":"82db58c5-2ddc-4dfa-8f23-43ea7faea4c8","resolution":{"observed_at":"2026-08-12T11:34:43.159399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-12T11:34:43.082458Z","title":"Adam: A method for stochastic optimization,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2411.18107","last_updated":"2024-11-27T07:36:52Z","snapshot_observed_at":"2026-08-12T11:28:37.910397Z","submitted_at":"2024-11-27T07:36:52Z","title":"Fusion of Discrete Representations and Self-Augmented Representations for Multilingual Automatic Speech Recognition","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T11:34:43.082458Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2411.18107"},"observation_digest":"sha256:e7a09344524adf5289aed420b2355a3b924f8753962553c09602b5cf110b0ac7","observation_id":"e8ff56df-eb2a-424f-a1d6-d3f96d7c5660","resolution":{"observed_at":"2026-08-12T11:34:43.082458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2411.18107","last_updated":"2024-11-27T07:36:52Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-12T11:28:37.910397Z","submitted_at":"2024-11-27T07:36:52Z","title":"Fusion of Discrete Representations and Self-Augmented Representations for Multilingual Automatic Speech Recognition"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":2,"verified_exact":1,"verified_fuzzy":36},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 1 inbound Pith citation observation for arXiv:2411.18107."}