{"as_of":"2026-08-16T17:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:97f914bc6f0bd39055bdeaac2f9f289d6fc2a2d0ce237486094704581353859d","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":125,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T12:38:53.919600Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":385,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":"2005.08100","doi":"10.48550/arxiv.2005.08100","metadata_source":"pith","pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"C., Parmar, N., Zhang, Y., Yu, J","venue":"eess.AS","work_id":"ea82ef7a-cc1e-489b-8704-4732b4801696","year":2020},"citing_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-08-14T02:29:38.306439Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-12T04:49:30.873360Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2206.10789"},"observation_digest":"sha256:ecbcec8e70437daf2a14916804099f6b0dca1da98c31aa77a3945ac769be1a9c","observation_id":"04016ebf-6b02-4846-90c0-323f59c02367","resolution":{"observed_at":"2026-05-12T04:49:31.123367Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-10T15:38:39.405362+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-10T15:38:39.405362+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":"2005.08100","doi":"10.48550/arxiv.2005.08100","metadata_source":"pith","pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"C., Parmar, N., Zhang, Y., Yu, J","venue":"eess.AS","work_id":"ea82ef7a-cc1e-489b-8704-4732b4801696","year":2020},"citing_paper":{"arxiv_id":"2407.08608","last_updated":"2024-07-12T22:15:02Z","snapshot_observed_at":"2026-08-16T11:15:38.109255Z","submitted_at":"2024-07-11T15:44:48Z","title":"FlashAttention-3: Fast and Accurate Attention with Asynchrony and Low-precision","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-20T19:45:36.337956Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2407.08608"},"observation_digest":"sha256:28ebdef37e9a2dd2f8a722f7fcca096c835f1daa99f8d991de7fb3057f25badf","observation_id":"5f2ea2a7-c11f-4bf2-bdcf-26290f640ceb","resolution":{"observed_at":"2026-05-20T19:45:36.424652Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-10T15:38:39.405362+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-10T15:38:39.405362+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-12T20:38:27.297576Z","title":"Conformer: Convolution -augmented transformer for speech recognition,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2411.09479","last_updated":"2024-11-14T14:35:40Z","snapshot_observed_at":"2026-08-12T20:33:56.489177Z","submitted_at":"2024-11-14T14:35:40Z","title":"An End-To-End Stuttering Detection Method Based On Conformer And BILSTM","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T20:38:27.297576Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2411.09479"},"observation_digest":"sha256:721ad8e93b7d627c631a49396978623af876a3013aaccb3a186fb1c8ab8325ed","observation_id":"cfab2fda-ac46-43bf-980d-589f7f3de15c","resolution":{"observed_at":"2026-08-12T20:38:27.297576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-12T19:31:53.147344Z","title":"Conformer: Convolution-augmented transformer for speech recognition","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2411.10657","last_updated":"2024-11-16T01:34:44Z","snapshot_observed_at":"2026-08-14T10:41:00.039898Z","submitted_at":"2024-11-16T01:34:44Z","title":"Brain-to-Text Decoding with Context-Aware Neural Representations and Large Language Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-12T19:31:53.147344Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2411.10657"},"observation_digest":"sha256:4dde4e0dadcfeec12d8cb7ab40a61d420104f8c455f814b1dbffc72bb0074ba9","observation_id":"98a14354-bb3c-4ea4-9491-3ce727bcc453","resolution":{"observed_at":"2026-08-12T19:31:53.147344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":"2005.08100","doi":"10.48550/arxiv.2005.08100","metadata_source":"pith","pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"C., Parmar, N., Zhang, Y., Yu, J","venue":"eess.AS","work_id":"ea82ef7a-cc1e-489b-8704-4732b4801696","year":2020},"citing_paper":{"arxiv_id":"2411.12363","last_updated":"2026-04-20T02:56:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-19T09:23:22Z","title":"DGSNA: Dynamic Generative Scene-based Noise Addition method","version":6},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-23T17:43:47.086524Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2411.12363"},"observation_digest":"sha256:179031ae3ba9b34a2d8a22ab9ac02fa1ae03f1bbf369e6604b9f02eabd857790","observation_id":"ce81ee95-2193-4b00-a4f9-27085fd51afe","resolution":{"observed_at":"2026-05-23T17:45:46.264977Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-10T15:38:39.405362+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-10T15:38:39.405362+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-12T16:39:03.635883Z","title":"arXiv:2005.08100","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.13325","last_updated":"2024-11-20T13:47:41Z","snapshot_observed_at":"2026-08-14T13:46:32.275186Z","submitted_at":"2024-11-20T13:47:41Z","title":"TPCNet: Representation learning for HI mapping","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-12T16:39:03.635883Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2411.13325"},"observation_digest":"sha256:1ca7494b60a52660befc12248c68c4554ed9ca65480ceb3aa52a1f477a836767","observation_id":"6a70d22d-6fec-4429-8511-d2bc765167c3","resolution":{"observed_at":"2026-08-12T16:39:03.635883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-12T15:58:19.912750Z","title":"Conformer: Convolution-augmented transformer for speech recognition","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2411.13766","last_updated":"2025-07-11T21:47:39Z","snapshot_observed_at":"2026-08-14T07:37:29.230681Z","submitted_at":"2024-11-21T00:29:58Z","title":"Tiny-Align: Bridging Automatic Speech Recognition and Large Language Model on the Edge","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T15:58:19.912750Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2411.13766"},"observation_digest":"sha256:9ae04202ed983d08ed798f76dc17afa7187d11c8156311ad3251724bc8175f37","observation_id":"e25f21ab-818f-4d35-ba98-6f46038e3b9f","resolution":{"observed_at":"2026-08-12T15:58:19.912750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-12T15:53:11.092180Z","title":"Conformer: Convolution-augmented transformer for speech recognition,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2411.13811","last_updated":"2024-11-25T00:21:53Z","snapshot_observed_at":"2026-08-14T00:03:13.464897Z","submitted_at":"2024-11-21T03:21:42Z","title":"X-CrossNet: A complex spectral mapping approach to target speaker extraction with cross attention speaker embedding fusion","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T15:53:11.092180Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2411.13811"},"observation_digest":"sha256:3b325dc7caf86b613425421d60a70270f94b77e86e8125bff083b39a00467409","observation_id":"4f747a62-0642-4d58-9448-abbc1ee71cb4","resolution":{"observed_at":"2026-08-12T15:53:11.092180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-12T15:24:37.520943Z","title":"Conformer: Convolution-augmented transformer for speech recogni- tion","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2411.14283","last_updated":"2024-11-21T16:34:52Z","snapshot_observed_at":"2026-08-16T10:59:08.771159Z","submitted_at":"2024-11-21T16:34:52Z","title":"CAIP: Detecting Router Misconfigurations with Context-Aware Iterative Prompting of LLMs","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T15:24:37.520943Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2411.14283"},"observation_digest":"sha256:0af158962a4242ee3c2676489c9ed2116d10bb4c9953eb6d1f6e478797ff69db","observation_id":"72c49616-a6f7-4f0c-bab0-19185faae6fd","resolution":{"observed_at":"2026-08-12T15:24:37.520943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-12T14:59:52.219465Z","title":"Conformer: Convolution-augmented transformer for speech recognition","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2411.14789","last_updated":"2025-01-13T07:29:53Z","snapshot_observed_at":"2026-08-16T06:35:34.772824Z","submitted_at":"2024-11-22T08:17:46Z","title":"Simplifying CLIP: Unleashing the Power of Large-Scale Models on Consumer-level Computers","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T14:59:52.219465Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2411.14789"},"observation_digest":"sha256:d20610b9c69144e09f1cb10b284a34e9e35c64946e7fdb1735831b3878d914d3","observation_id":"de702da3-e804-42f5-9342-b6696ed0b4fb","resolution":{"observed_at":"2026-08-12T14:59:52.219465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-12T13:27:06.802778Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.16276","last_updated":"2024-11-25T10:53:45Z","snapshot_observed_at":"2026-08-15T18:23:01.640406Z","submitted_at":"2024-11-25T10:53:45Z","title":"The SVASR System for Text-dependent Speaker Verification (TdSV) AAIC Challenge 2024","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-12T13:27:06.802778Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2411.16276"},"observation_digest":"sha256:fde9401221a96947775df9d3e29186a3071eba9206c233178fd37043ef78c4d3","observation_id":"19a5796f-f185-47c5-899f-c9f5460e71e7","resolution":{"observed_at":"2026-08-12T13:27:06.802778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-12T05:27:56.712197Z","title":"Conformer: Convolution-augmented transformer for speech recogni- tion,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2412.00415","last_updated":"2024-11-30T09:48:48Z","snapshot_observed_at":"2026-08-12T05:22:38.661723Z","submitted_at":"2024-11-30T09:48:48Z","title":"Sample adaptive data augmentation with progressive scheduling","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T05:27:56.712197Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2412.00415"},"observation_digest":"sha256:ff84170095ceca39242668a484695fd2d4d4b8220878af570f0a1d0cc1be5cf2","observation_id":"97c55f22-a88e-4c00-a1d6-689ffa66afb3","resolution":{"observed_at":"2026-08-12T05:27:56.712197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-12T05:15:07.718194Z","title":"Conformer: Convolution-augmented transformer for speech recognition,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.00571","last_updated":"2024-12-10T10:23:54Z","snapshot_observed_at":"2026-08-16T01:01:33.190459Z","submitted_at":"2024-11-30T19:53:23Z","title":"From Audio Deepfake Detection to AI-Generated Music Detection -- A Pathway and Overview","version":2},"reference_index":133,"source":"pdf_text","source_observed_at":"2026-08-12T05:15:07.718194Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2412.00571"},"observation_digest":"sha256:eaf0ce768b570d57cd35f02893fa0ac73088b98d5fe74ab306ae1d08dc777fe4","observation_id":"86ac59d4-dba7-4676-93ca-6e7923d2ae11","resolution":{"observed_at":"2026-08-12T05:15:07.718194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-12T04:59:13.263015Z","title":"Conformer: Convolution- augmented transformer for speech recognition,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2412.00877","last_updated":"2024-12-01T16:32:49Z","snapshot_observed_at":"2026-08-15T12:45:18.224284Z","submitted_at":"2024-12-01T16:32:49Z","title":"Complexity boosted adaptive training for better low resource ASR performance","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T04:59:13.263015Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2412.00877"},"observation_digest":"sha256:f21bb94c8c405184c89370ab9e72d81043f0292095166c44fc79c448852197c6","observation_id":"f7d8372a-6714-47ac-b3f5-77c74528a2ee","resolution":{"observed_at":"2026-08-12T04:59:13.263015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-11T21:55:58.410553Z","title":"Conformer: Convolution-augmented transformer for speech recognition,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.04518","last_updated":"2024-12-05T08:51:02Z","snapshot_observed_at":"2026-08-16T12:08:52.383005Z","submitted_at":"2024-12-05T08:51:02Z","title":"Privacy-Preserving Gesture Tracking System Utilizing Frequency-Hopping RFID Signals","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T21:55:58.410553Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2412.04518"},"observation_digest":"sha256:5363cf62a404b5a36b3c277e0a0de6d3e9ab8ac020e5cc4dbd311c0973668a39","observation_id":"1b6aa9a6-81ba-4226-811d-ba94547946eb","resolution":{"observed_at":"2026-08-11T21:55:58.410553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-11T15:11:57.788464Z","title":"Conformer: Convolution-augmented transformer for speech recognition","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2412.11272","last_updated":"2025-04-21T19:26:09Z","snapshot_observed_at":"2026-08-15T19:23:23.094347Z","submitted_at":"2024-12-15T18:27:37Z","title":"WhisperFlow: speech foundation models in real time","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T15:11:57.788464Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2412.11272"},"observation_digest":"sha256:5562aa89227713aea5bfb16e552d568d500222de915062e58070af001a2f487c","observation_id":"468ba433-b7d5-4625-9837-42621a8a68e5","resolution":{"observed_at":"2026-08-11T15:11:57.788464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-11T14:36:52.547219Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.11818","last_updated":"2024-12-16T14:35:32Z","snapshot_observed_at":"2026-08-13T08:00:47.591320Z","submitted_at":"2024-12-16T14:35:32Z","title":"Leveraging User-Generated Metadata of Online Videos for Cover Song Identification","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T14:36:52.547219Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2412.11818"},"observation_digest":"sha256:43921e68693b687adeffff8d4a0a1ad0c54091f7bf5eb47a642667780e60e884","observation_id":"5f9036c2-d73d-4c88-a99c-b9688de14ed4","resolution":{"observed_at":"2026-08-11T14:36:52.547219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-11T13:44:44.021314Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.12858","last_updated":"2024-12-17T12:38:45Z","snapshot_observed_at":"2026-08-15T16:29:44.232315Z","submitted_at":"2024-12-17T12:38:45Z","title":"Efficient Speech Command Recognition Leveraging Spiking Neural Network and Curriculum Learning-based Knowledge Distillation","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T13:44:44.021314Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2412.12858"},"observation_digest":"sha256:fe657707abc85a19f4d5b52b6f380c79c3caa33e688fce3f255e278e43cdff75","observation_id":"b983785e-31dd-4196-8fb4-43bf11a9bc9b","resolution":{"observed_at":"2026-08-11T13:44:44.021314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-11T12:55:40.510711Z","title":"Conformer: Convolution-augmented transformer for speech recognition","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2412.13716","last_updated":"2024-12-18T10:55:43Z","snapshot_observed_at":"2026-08-13T03:19:46.049847Z","submitted_at":"2024-12-18T10:55:43Z","title":"Model Decides How to Tokenize: Adaptive DNA Sequence Tokenization with MxDNA","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T12:55:40.510711Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2412.13716"},"observation_digest":"sha256:ccf49e56023b69becac245ce0a2de0db0784cb1f114ce74852c58ac042954057","observation_id":"f4494061-488f-40dd-81dd-7e3c85f032c4","resolution":{"observed_at":"2026-08-11T12:55:40.510711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-11T12:51:45.534532Z","title":"Conformer: Convolution- augmented transformer for speech recognition,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2412.13788","last_updated":"2024-12-18T12:31:31Z","snapshot_observed_at":"2026-08-15T16:21:07.032033Z","submitted_at":"2024-12-18T12:31:31Z","title":"Open Universal Arabic ASR Leaderboard","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T12:51:45.534532Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2412.13788"},"observation_digest":"sha256:9f059e9e0d02e68549df679d41739803396b56be485bb659ee65a2ef1dab015e","observation_id":"3b012534-5e9b-4b99-9a68-c9ae19e56324","resolution":{"observed_at":"2026-08-11T12:51:45.534532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-11T16:10:24.412313Z","title":"Conformer: Convolution-augmented transformer for speech recog- nition","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2412.16188","last_updated":"2024-12-13T17:55:39Z","snapshot_observed_at":"2026-08-15T10:20:46.683996Z","submitted_at":"2024-12-13T17:55:39Z","title":"A Decade of Deep Learning: A Survey on The Magnificent Seven","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-11T16:10:24.412313Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2412.16188"},"observation_digest":"sha256:3b46244470e1d880836085964fdf4f07a1326b371419f78ec2447c87ef82b36b","observation_id":"c29e5446-e879-48c3-ae36-b9cf25835a2d","resolution":{"observed_at":"2026-08-11T16:10:24.412313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-11T05:45:17.493612Z","title":"Conformer: Convolution-augmented transformer for speech recognition,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2412.17239","last_updated":"2024-12-23T03:19:19Z","snapshot_observed_at":"2026-08-15T10:25:42.549097Z","submitted_at":"2024-12-23T03:19:19Z","title":"Unity is Strength: Unifying Convolutional and Transformeral Features for Better Person Re-Identification","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T05:45:17.493612Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2412.17239"},"observation_digest":"sha256:ef16e2187558ee46989e22efb6aa8b1d6da75e7075a8aa2a82c8e0de8c449fd1","observation_id":"89d46f2c-2d74-4a29-b42c-dbd73854f43c","resolution":{"observed_at":"2026-08-11T05:45:17.493612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-11T05:06:43.616829Z","title":"Conformer: Convolution-augmented transformer for speech recognition","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2412.18099","last_updated":"2024-12-24T02:18:17Z","snapshot_observed_at":"2026-08-15T19:07:00.345767Z","submitted_at":"2024-12-24T02:18:17Z","title":"An Attention-based Framework with Multistation Information for Earthquake Early Warnings","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-11T05:06:43.616829Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2412.18099"},"observation_digest":"sha256:d9f34ab6a9bf9ad0ae54eb0b8fa86f44739f7616f1ce96358080bbc0f808d25c","observation_id":"6e43c16b-898b-4600-99cb-bc3ae141eba5","resolution":{"observed_at":"2026-08-11T05:06:43.616829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-11T14:59:01.753245Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-13T14:56:43.704817Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":141,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.753245Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:41d347928585c282779d76b48d97234e4874f9bb3fc124fb8adc73951cf3a047","observation_id":"86d44d48-9026-4a54-aa1e-5988254c7054","resolution":{"observed_at":"2026-08-11T14:59:01.753245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-10T22:40:22.034251Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.01108","last_updated":"2025-01-03T08:35:34Z","snapshot_observed_at":"2026-08-10T22:32:47.754571Z","submitted_at":"2025-01-02T07:08:29Z","title":"MuQ: Self-Supervised Music Representation Learning with Mel Residual Vector Quantization","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-10T22:40:22.034251Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2501.01108"},"observation_digest":"sha256:cf6cb796759501708faaea6de6edcfc46308c513dded514b04f725e0b7388562","observation_id":"adeb4dd4-d4c7-412c-a215-0322aac9d917","resolution":{"observed_at":"2026-08-10T22:40:22.034251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-10T22:35:19.068918Z","title":"arXiv preprint arXiv:2005.08100 (2020)","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.01333","last_updated":"2025-01-02T16:35:58Z","snapshot_observed_at":"2026-08-16T13:59:35.822629Z","submitted_at":"2025-01-02T16:35:58Z","title":"On the Robustness of Cover Version Identification Models: A Study Using Cover Versions from YouTube","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T22:35:19.068918Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2501.01333"},"observation_digest":"sha256:b8ff94667ebfc984d52e5f327d2f8b7b6b8216eb5239c2a1f773e66f3836c858","observation_id":"d2223582-9090-4ad8-b19c-fc326d1abe6f","resolution":{"observed_at":"2026-08-10T22:35:19.068918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-10T20:15:28.480440Z","title":"Conformer: Convolution-augmented transformer for speech recognition,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2501.09104","last_updated":"2025-01-20T18:35:40Z","snapshot_observed_at":"2026-08-15T12:03:35.994391Z","submitted_at":"2025-01-15T19:42:41Z","title":"A Non-autoregressive Model for Joint STT and TTS","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:28.480440Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2501.09104"},"observation_digest":"sha256:24fe6a4ead66b48dd68a79dd1753db71d8dd3f1ebad779373981aa987b2fc3d8","observation_id":"dba533ba-213b-44b6-b407-465ed4750d52","resolution":{"observed_at":"2026-08-10T20:15:28.480440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-10T16:26:51.213613Z","title":"Conformer: Convolution-augmented transformer for speech recognition","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2501.13230","last_updated":"2025-04-09T19:05:31Z","snapshot_observed_at":"2026-08-16T12:27:08.648377Z","submitted_at":"2025-01-22T21:30:49Z","title":"Let SSMs be ConvNets: State-space Modeling with Optimal Tensor Contractions","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T16:26:51.213613Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2501.13230"},"observation_digest":"sha256:0b46d0e3bd8cfd8661686319611279e91d3d456c2bfe045d3a592177d000714d","observation_id":"478bd955-ecd5-49f8-bc58-12503b7b8c1a","resolution":{"observed_at":"2026-08-10T16:26:51.213613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-10T00:35:49.015294Z","title":"Conformer: Convolution-augmented transformer for speech recognition,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2501.18157","last_updated":"2025-01-30T05:46:30Z","snapshot_observed_at":"2026-08-15T06:46:32.013646Z","submitted_at":"2025-01-30T05:46:30Z","title":"Efficient Audiovisual Speech Processing via MUTUD: Multimodal Training and Unimodal Deployment","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-10T00:35:49.015294Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2501.18157"},"observation_digest":"sha256:14c44470504d178ebc53232745311091f36e3aab96c95d207267b44539f5d614","observation_id":"2810c41d-1183-413b-a937-fa3ecd9ce378","resolution":{"observed_at":"2026-08-10T00:35:49.015294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-08T22:31:38.784878Z","title":"Conformer: Convolution-augmented transformer for speech recognition","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2502.05232","last_updated":"2025-02-06T22:09:52Z","snapshot_observed_at":"2026-08-14T02:34:41.901675Z","submitted_at":"2025-02-06T22:09:52Z","title":"Aligner-Encoders: Self-Attention Transformers Can Be Self-Transducers","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T22:31:38.784878Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2502.05232"},"observation_digest":"sha256:2d9ba35fa1cba16ff580e2d3da760aa6ca4efb07406f5baf2d703d88870d0917","observation_id":"08e73f46-7912-462b-97c7-b3159b4031ef","resolution":{"observed_at":"2026-08-08T22:31:38.784878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-08T17:49:20.093965Z","title":"Conformer: Convolution-augmented transformer for speech recognition,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2502.05837","last_updated":"2025-02-09T10:17:25Z","snapshot_observed_at":"2026-08-14T07:25:49.810871Z","submitted_at":"2025-02-09T10:17:25Z","title":"Synergistic Effects of Knowledge Distillation and Structured Pruning for Self-Supervised Speech Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T17:49:20.093965Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2502.05837"},"observation_digest":"sha256:634815940b17c23e6e306f9eae72caefc25046c5088b79ea0bd25808ebfae78f","observation_id":"2812bdb9-7c65-4922-b502-a03c0395e5fd","resolution":{"observed_at":"2026-08-08T17:49:20.093965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-16T12:38:53.919600Z","title":"Conformer: Convolution-augmented transformer for speech recognition","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2504.12254","last_updated":"2025-04-19T09:55:40Z","snapshot_observed_at":"2026-08-16T12:31:49.196170Z","submitted_at":"2025-04-16T17:05:14Z","title":"Advancing Arabic Speech Recognition Through Large-Scale Weakly Supervised Learning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T12:38:53.919600Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2504.12254"},"observation_digest":"sha256:3a0cc8d6aeec683e66a1e33d2e9109f2b8165daacd66903458a103eaacacdb12","observation_id":"8795af33-1621-412d-bb13-fb6533b37fbb","resolution":{"observed_at":"2026-08-16T12:38:53.919600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-16T05:14:57.770317Z","title":"Conformer: Convolution-augmented transformer for speech recognition","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2504.21214","last_updated":"2025-05-03T07:53:27Z","snapshot_observed_at":"2026-08-16T05:07:52.160589Z","submitted_at":"2025-04-29T22:48:27Z","title":"Pretraining Large Brain Language Model for Active BCI: Silent Speech","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-16T05:14:57.770317Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2504.21214"},"observation_digest":"sha256:6fb1e98ebc52fb3db3bd25e62a719e70d403a219164aada20b3ef701858cce80","observation_id":"c06933bf-c638-48a4-bc5d-18da64b3c0dd","resolution":{"observed_at":"2026-08-16T05:14:57.770317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":"2005.08100","doi":"10.48550/arxiv.2005.08100","metadata_source":"pith","pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"C., Parmar, N., Zhang, Y., Yu, J","venue":"eess.AS","work_id":"ea82ef7a-cc1e-489b-8704-4732b4801696","year":2020},"citing_paper":{"arxiv_id":"2505.06335","last_updated":"2026-04-21T09:43:38Z","snapshot_observed_at":"2026-08-15T17:15:20.134700Z","submitted_at":"2025-05-09T17:27:17Z","title":"Remote Rowhammer Attack using Adversarial Observations on Federated Learning Clients","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-22T15:22:59.827762Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2505.06335"},"observation_digest":"sha256:ff131fbf062c5e3999b043d17431a333f9595bab1c9a825bb6d2edf60ce10427","observation_id":"f1e85b49-285f-41be-aedc-04332efe825a","resolution":{"observed_at":"2026-05-22T15:24:57.799931Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-10T15:38:39.405362+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-10T15:38:39.405362+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-15T21:03:18.003997Z","title":"arXiv:2005.08100","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.10975","last_updated":"2026-05-27T20:17:05Z","snapshot_observed_at":"2026-08-16T06:33:06.115474Z","submitted_at":"2025-05-16T08:21:59Z","title":"Survey of End-to-End Multi-Speaker Automatic Speech Recognition for Monaural Audio","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T21:03:18.003997Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2505.10975"},"observation_digest":"sha256:3222da00650800cd652092574dabc1248091ab4464ae7395afaff80f77e64377","observation_id":"e0acadb9-521d-4ae5-ad88-dff1dd8f2fad","resolution":{"observed_at":"2026-08-15T21:03:18.003997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-15T20:28:07.078243Z","title":", author Qin, J","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.12904","last_updated":"2025-05-19T09:37:46Z","snapshot_observed_at":"2026-08-16T02:17:44.260782Z","submitted_at":"2025-05-19T09:37:46Z","title":"The Computation of Generalized Embeddings for Underwater Acoustic Target Recognition using Contrastive Learning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-15T20:28:07.078243Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2505.12904"},"observation_digest":"sha256:0213378f28b9b9c10eace4d3977bbf1fe68c3389fcb5436bcbd890f4e2790d5b","observation_id":"4c8d1bc7-1d2d-41b1-8955-627e553c55c1","resolution":{"observed_at":"2026-08-15T20:28:07.078243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-15T20:27:12.004662Z","title":"Conformer: Convolution- augmented transformer for speech recognition,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.12969","last_updated":"2025-05-19T11:04:52Z","snapshot_observed_at":"2026-08-15T20:20:21.029221Z","submitted_at":"2025-05-19T11:04:52Z","title":"Calm-Whisper: Reduce Whisper Hallucination On Non-Speech By Calming Crazy Heads Down","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T20:27:12.004662Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2505.12969"},"observation_digest":"sha256:0ec64e6cb70915f230138e72ff746df53a653895a087def3ea7b01fdb9d5e11a","observation_id":"75484c64-f2a6-4f31-9cc0-97337f4de5e5","resolution":{"observed_at":"2026-08-15T20:27:12.004662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-15T20:26:15.047857Z","title":"Conformer: Convolut ion augmented transformer for speech recognition,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.13079","last_updated":"2025-05-19T13:13:18Z","snapshot_observed_at":"2026-08-15T20:18:15.521280Z","submitted_at":"2025-05-19T13:13:18Z","title":"Cross-modal Knowledge Transfer Learning as Graph Matching Based on Optimal Transport for ASR","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:15.047857Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2505.13079"},"observation_digest":"sha256:8e21a0721049bc8d10f817c17425097aaa2a71579195666df80b73de58cfb0ad","observation_id":"7ed58234-60da-43f8-ad8a-aafdf344953b","resolution":{"observed_at":"2026-08-15T20:26:15.047857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-15T20:13:45.889714Z","title":"Conformer: Convolution- augmented transformer for speech recognition,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.13805","last_updated":"2025-05-20T01:34:29Z","snapshot_observed_at":"2026-08-16T08:44:51.413799Z","submitted_at":"2025-05-20T01:34:29Z","title":"ClapFM-EVC: High-Fidelity and Flexible Emotional Voice Conversion with Dual Control from Natural Language and Speech","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T20:13:45.889714Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2505.13805"},"observation_digest":"sha256:51ea2ef7ede0200c91e03515790f0301c16af69fcac1ed59dcd8473fcf85ea39","observation_id":"9cb69022-47e4-49ed-ad31-9af27db019a2","resolution":{"observed_at":"2026-08-15T20:13:45.889714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-07T15:43:03.146074Z","title":"Conformer: Convolution- augmented transformer for speech recognition,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.13971","last_updated":"2025-05-27T05:03:46Z","snapshot_observed_at":"2026-08-15T19:07:02.989483Z","submitted_at":"2025-05-20T06:11:51Z","title":"The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:03.146074Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2505.13971"},"observation_digest":"sha256:9f0eb08137a29a54c1f7a8ca2efa9c4a036fa7d9d74c9b4879776528714d3a9b","observation_id":"75b3023e-f670-4324-8b08-aae5b29f9a25","resolution":{"observed_at":"2026-08-07T15:43:03.146074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-15T20:21:35.938764Z","title":"Conformer: Convolution- augmented transformer for speech recognition,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.14723","last_updated":"2025-05-19T16:09:51Z","snapshot_observed_at":"2026-08-15T20:13:54.662639Z","submitted_at":"2025-05-19T16:09:51Z","title":"QUADS: QUAntized Distillation Framework for Efficient Speech Language Understanding","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T20:21:35.938764Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2505.14723"},"observation_digest":"sha256:3e9b9cccde789ff6f6309ee9d84fc1e244ef1f0b7dbe362698f072eb8208d89a","observation_id":"86ab1fd2-8887-4e89-943f-98ef29dd12c7","resolution":{"observed_at":"2026-08-15T20:21:35.938764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-07T15:30:35.814004Z","title":"arXiv preprint arXiv:2005.08100","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.14887","last_updated":"2025-05-20T20:20:37Z","snapshot_observed_at":"2026-08-15T19:07:45.446475Z","submitted_at":"2025-05-20T20:20:37Z","title":"In-Context Learning Boosts Speech Recognition via Human-like Adaptation to Speakers and Language Varieties","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T15:30:35.814004Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2505.14887"},"observation_digest":"sha256:cdbd1ffe66851c1fc8a12b4cc08b27ac93fd56672b983bf6376a4e29b9c2aaa8","observation_id":"6ed2d261-021f-4fbb-94ef-b7a55cd3ded7","resolution":{"observed_at":"2026-08-07T15:30:35.814004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-07T14:33:40.174375Z","title":"Conformer: Convolution- augmented transformer for speech recognition,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.18453","last_updated":"2025-05-24T01:26:02Z","snapshot_observed_at":"2026-08-16T12:47:56.342175Z","submitted_at":"2025-05-24T01:26:02Z","title":"MPE-TTS: Customized Emotion Zero-Shot Text-To-Speech Using Multi-Modal Prompt","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:40.174375Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2505.18453"},"observation_digest":"sha256:0da27ffeb8079fa597cdd15ef60333faaf99228f8a3e9899d7f73ed376bdb2c0","observation_id":"b0c18d76-84ba-45a3-a517-3d8140f15e51","resolution":{"observed_at":"2026-08-07T14:33:40.174375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-07T14:35:32.658211Z","title":"Con- former: Convolution-augmented transformer for speech recognition.arXiv preprint arXiv:2005.08100,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.18514","last_updated":"2025-05-24T05:24:10Z","snapshot_observed_at":"2026-08-15T19:08:28.436537Z","submitted_at":"2025-05-24T05:24:10Z","title":"Test-Time Adaptation with Binary Feedback","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T14:35:32.658211Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2505.18514"},"observation_digest":"sha256:8208baa5c4a3044657d8d871ac0cea429ab8ec3cc8c96fbd02cdd4b452a6bc3f","observation_id":"bda5f11f-5787-4aae-94a2-bb11cfdf7a1a","resolution":{"observed_at":"2026-08-07T14:35:32.658211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-07T14:12:48.881846Z","title":"Available: https://arxiv.org/abs/2005.08100","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.19774","last_updated":"2025-05-26T09:57:59Z","snapshot_observed_at":"2026-08-16T12:17:14.311534Z","submitted_at":"2025-05-26T09:57:59Z","title":"DuRep: Dual-Mode Speech Representation Learning via ASR-Aware Distillation","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:48.881846Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2505.19774"},"observation_digest":"sha256:27fb9366a542379d7badb2a4adb0c54f9381a23dfbe612699b32ccd864dc04aa","observation_id":"1e9dd8c2-89ec-41fb-9003-a684f8c85455","resolution":{"observed_at":"2026-08-07T14:12:48.881846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":"2005.08100","doi":"10.48550/arxiv.2005.08100","metadata_source":"pith","pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"C., Parmar, N., Zhang, Y., Yu, J","venue":"eess.AS","work_id":"ea82ef7a-cc1e-489b-8704-4732b4801696","year":2020},"citing_paper":{"arxiv_id":"2505.20638","last_updated":"2026-04-09T22:24:30Z","snapshot_observed_at":"2026-07-06T21:31:02.262018Z","submitted_at":"2025-05-27T02:31:24Z","title":"Music Audio-Visual Question Answering Requires Specialized Multimodal Designs","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-19T14:11:52.011626Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2505.20638"},"observation_digest":"sha256:b2000f3673b738854397f38f7cbfd4c5d9bfb59c55c4c8e017a79d78edc30c21","observation_id":"169549f2-9d70-4f14-882e-aa95a3b8fb7f","resolution":{"observed_at":"2026-05-19T14:12:22.089771Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-10T15:38:39.405362+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-10T15:38:39.405362+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-07T13:21:55.806950Z","title":"Conformer: Convolution- augmented transformer for speech recognition,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.22005","last_updated":"2025-05-28T06:12:19Z","snapshot_observed_at":"2026-08-16T12:01:01.033653Z","submitted_at":"2025-05-28T06:12:19Z","title":"Leveraging LLM for Stuttering Speech: A Unified Architecture Bridging Recognition and Event Detection","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:55.806950Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2505.22005"},"observation_digest":"sha256:62f620358074adf1dece5703d73919e5acfc5723874c760d5dda3aaf57edd888","observation_id":"823371dd-2fe8-497f-bf8c-80c1fb16fbab","resolution":{"observed_at":"2026-08-07T13:21:55.806950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-07T13:24:29.745390Z","title":"Conformer: Convolution- augmented transformer for speech recognition,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.22069","last_updated":"2025-05-28T07:51:21Z","snapshot_observed_at":"2026-08-14T18:27:10.731993Z","submitted_at":"2025-05-28T07:51:21Z","title":"Delayed-KD: Delayed Knowledge Distillation based CTC for Low-Latency Streaming ASR","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T13:24:29.745390Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2505.22069"},"observation_digest":"sha256:a6d2c48ed198b33250ad2c27574af572b8134fa57b1575a364d49bddb5027035","observation_id":"6bb3fe55-5ae3-4a56-86bf-0c853d741b88","resolution":{"observed_at":"2026-08-07T13:24:29.745390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-07T12:39:46.387249Z","title":"Conformer: Convolution- augmented transformer for speech recognition,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.24059","last_updated":"2025-05-29T23:03:08Z","snapshot_observed_at":"2026-08-15T19:07:48.178045Z","submitted_at":"2025-05-29T23:03:08Z","title":"Towards disentangling the contributions of articulation and acoustics in multimodal phoneme recognition","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:46.387249Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2505.24059"},"observation_digest":"sha256:19ea17635a2f062dcd2625881dbc0c7bbe1b811bd65bc0672fe97ebab5df7e1a","observation_id":"61506fae-6150-4f64-9c98-12aa2c30bd3e","resolution":{"observed_at":"2026-08-07T12:39:46.387249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-07T12:35:03.644947Z","title":"Conformer: Convolution-augmented transformer for speech recognition,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.24531","last_updated":"2025-05-30T12:39:26Z","snapshot_observed_at":"2026-08-15T02:09:30.182447Z","submitted_at":"2025-05-30T12:39:26Z","title":"Transformers Are Universally Consistent","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:03.644947Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2505.24531"},"observation_digest":"sha256:e5ffa876a21b2df42c5a11f19bbd417bfd3c44c615d4379ced8fbfda1f2ebea4","observation_id":"26300d89-a224-4daa-a4b5-8383f6b86d6f","resolution":{"observed_at":"2026-08-07T12:35:03.644947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-07T05:20:56.451555Z","title":"Conformer: Convolution-augmented transformer for speech recognition,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2506.08348","last_updated":"2025-06-10T02:05:15Z","snapshot_observed_at":"2026-08-14T12:21:50.787477Z","submitted_at":"2025-06-10T02:05:15Z","title":"Pureformer-VC: Non-parallel Voice Conversion with Pure Stylized Transformer Blocks and Triplet Discriminative Training","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:56.451555Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2506.08348"},"observation_digest":"sha256:9d3a09fce02c49ac0b829baceff15e44ada62b6b95644b7da146cf2102c40494","observation_id":"9d099ae3-f46a-4463-bb50-feaf6ed86116","resolution":{"observed_at":"2026-08-07T05:20:56.451555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-07T04:51:25.472023Z","title":"Available: https://arxiv.org/abs/2005.08100","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2506.09653","last_updated":"2025-06-11T12:23:30Z","snapshot_observed_at":"2026-08-14T15:31:55.320808Z","submitted_at":"2025-06-11T12:23:30Z","title":"Recognizing Every Voice: Towards Inclusive ASR for Rural Bhojpuri Women","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T04:51:25.472023Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2506.09653"},"observation_digest":"sha256:af6422094662d28385ef28ee05b116930d7737aafd2c7e6c015d8e64105a7396","observation_id":"41a1e8f9-7454-46d1-955a-b62514b7c4c1","resolution":{"observed_at":"2026-08-07T04:51:25.472023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-07T04:24:25.967159Z","title":"Conformer: Convolution- augmented transformer for speech recognition,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2506.10747","last_updated":"2025-06-12T14:35:18Z","snapshot_observed_at":"2026-08-13T22:30:53.074753Z","submitted_at":"2025-06-12T14:35:18Z","title":"FairASR: Fair Audio Contrastive Learning for Automatic Speech Recognition","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T04:24:25.967159Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2506.10747"},"observation_digest":"sha256:73e8f8aea793e33b8b145a803d2b0b611527cd3d38d5cc1716f4148196ae2398","observation_id":"540381c8-97f5-4e5d-ab92-9a47a0d66f1c","resolution":{"observed_at":"2026-08-07T04:24:25.967159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-07T00:52:03.732161Z","title":"Conformer: Convolution-augmented transformer for speech recognition,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2506.12570","last_updated":"2025-06-14T16:53:39Z","snapshot_observed_at":"2026-08-13T18:08:07.584912Z","submitted_at":"2025-06-14T16:53:39Z","title":"StreamMel: Real-Time Zero-shot Text-to-Speech via Interleaved Continuous Autoregressive Modeling","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T00:52:03.732161Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2506.12570"},"observation_digest":"sha256:486f38acf1d8e1a808b0f52a8bba78754db61998356b1b1eb7ba079715b326db","observation_id":"7d1701fd-bfef-49fa-abcc-e7495a5d0181","resolution":{"observed_at":"2026-08-07T00:52:03.732161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-07T00:50:17.256472Z","title":"Conformer: Convolution- augmented transformer for speech recognition,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2506.12672","last_updated":"2025-06-15T00:37:27Z","snapshot_observed_at":"2026-08-15T19:07:01.366481Z","submitted_at":"2025-06-15T00:37:27Z","title":"SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:17.256472Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2506.12672"},"observation_digest":"sha256:c7bba7beb5d7a741af4296364512adf58650139d6d709413abaf8550c02622f2","observation_id":"0fa73f01-3f40-4b90-a87c-e5527b34ac03","resolution":{"observed_at":"2026-08-07T00:50:17.256472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-07T00:22:24.974764Z","title":"Available: https://arxiv.org/abs/2005.08100","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2506.14153","last_updated":"2025-06-17T03:30:58Z","snapshot_observed_at":"2026-08-14T06:47:23.767903Z","submitted_at":"2025-06-17T03:30:58Z","title":"Pushing the Performance of Synthetic Speech Detection with Kolmogorov-Arnold Networks and Self-Supervised Learning Models","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T00:22:24.974764Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2506.14153"},"observation_digest":"sha256:c39ccc2a62be5b49d9ebcf80cd2a640c358b4e14d5d90b43aa8bc1d1cc564452","observation_id":"bd5a5ea5-4b6a-49a9-85d0-37d29fff8901","resolution":{"observed_at":"2026-08-07T00:22:24.974764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-06T23:50:41.136057Z","title":"Conformer: Convolution-augmented transformer for speech recognition","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2506.15912","last_updated":"2025-06-18T23:16:02Z","snapshot_observed_at":"2026-08-15T17:48:35.399662Z","submitted_at":"2025-06-18T23:16:02Z","title":"Early Attentive Sparsification Accelerates Neural Speech Transcription","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T23:50:41.136057Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2506.15912"},"observation_digest":"sha256:2c51174838ec8aa75ca0110e5a77ef015381d7b55e1c9c4a12071a90d5961be9","observation_id":"f9f662a8-0597-4ae8-9df8-e171d0b0d4d2","resolution":{"observed_at":"2026-08-06T23:50:41.136057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-06T23:34:07.813102Z","title":"Preprint, arXiv:2005.08100","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2506.17019","last_updated":"2025-06-20T14:17:42Z","snapshot_observed_at":"2026-08-14T08:13:11.379123Z","submitted_at":"2025-06-20T14:17:42Z","title":"Instituto de Telecomunica\\c{c}\\~oes at IWSLT 2025: Aligning Small-Scale Speech and Language Models for Speech-to-Text Learning","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:07.813102Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2506.17019"},"observation_digest":"sha256:8c6642de7ed19b29f85bbe19dad7f2ef3e329de6f6e5a4b2a38e4b7fa23dd4c2","observation_id":"da49e256-227c-4898-9ed6-4c9792f3051c","resolution":{"observed_at":"2026-08-06T23:34:07.813102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-06T22:55:46.416417Z","title":"Conformer: Convolution-augmented transformer for speech recognition,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2506.20354","last_updated":"2025-08-25T13:34:45Z","snapshot_observed_at":"2026-08-16T00:41:24.343968Z","submitted_at":"2025-06-25T12:07:10Z","title":"A foundation model with multi-variate parallel attention to generate neuronal activity","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T22:55:46.416417Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2506.20354"},"observation_digest":"sha256:32e22b602f2358fa2ee76d4b19415f69030b9e8033dd94d74c5c68c9ef013e39","observation_id":"9c4f57d1-2c8e-4f24-a2a5-58267cb3db99","resolution":{"observed_at":"2026-08-06T22:55:46.416417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-06T22:26:17.482190Z","title":"Conformer: Convolution- augmented transformer for speech recognition,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2506.22001","last_updated":"2025-06-27T08:14:17Z","snapshot_observed_at":"2026-08-15T13:30:48.124369Z","submitted_at":"2025-06-27T08:14:17Z","title":"WTFormer: A Wavelet Conformer Network for MIMO Speech Enhancement with Spatial Cues Peservation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T22:26:17.482190Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2506.22001"},"observation_digest":"sha256:b543ca52fdca053a6af4ded06c3c3625dda6ed151e310f3e2698fa3710a798d2","observation_id":"37fe7df5-fad6-4e18-9363-f78955c3aa74","resolution":{"observed_at":"2026-08-06T22:26:17.482190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-06T21:19:51.504954Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.00498","last_updated":"2025-08-03T15:08:39Z","snapshot_observed_at":"2026-08-15T19:07:42.982701Z","submitted_at":"2025-07-01T07:13:34Z","title":"MuteSwap: Visual-informed Silent Video Identity Conversion","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T21:19:51.504954Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2507.00498"},"observation_digest":"sha256:3b051f449fe01968532a1b02944af99ed50139190cee457faac69ad8496149b9","observation_id":"9c492056-dde3-4364-b09b-f71204d78236","resolution":{"observed_at":"2026-08-06T21:19:51.504954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-06T20:14:10.664092Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.03482","last_updated":"2025-07-04T11:19:47Z","snapshot_observed_at":"2026-08-15T19:07:43.392289Z","submitted_at":"2025-07-04T11:19:47Z","title":"OMAR-RQ: Open Music Audio Representation Model Trained with Multi-Feature Masked Token Prediction","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T20:14:10.664092Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2507.03482"},"observation_digest":"sha256:f60cdb0d9024ec93d760efa931c1f53ebdcb4e0ee96965bd7558bbd5734dd37e","observation_id":"38f6d3e4-7233-4e86-911c-998220d2cfdd","resolution":{"observed_at":"2026-08-06T20:14:10.664092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-06T19:32:22.134628Z","title":"McInnes, L., Healy, J., and Melville, J","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2507.05333","last_updated":"2025-07-07T18:00:00Z","snapshot_observed_at":"2026-08-14T06:39:32.761131Z","submitted_at":"2025-07-07T18:00:00Z","title":"Causal Foundation Models: Disentangling Physics from Instrument Properties","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:22.134628Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2507.05333"},"observation_digest":"sha256:66ba5680296c14f5b4682133f66c1a2b86699960c0a377a1697c8791d5f99661","observation_id":"ecbfb686-1f96-4a78-be4c-5361c2c574dd","resolution":{"observed_at":"2026-08-06T19:32:22.134628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-06T19:01:27.510652Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.06670","last_updated":"2025-07-09T08:59:32Z","snapshot_observed_at":"2026-08-16T04:20:35.411761Z","submitted_at":"2025-07-09T08:59:32Z","title":"STARS: A Unified Framework for Singing Transcription, Alignment, and Refined Style Annotation","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T19:01:27.510652Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2507.06670"},"observation_digest":"sha256:eb8d9b542e19ea36d5c2c371ef6dcd23b2545bffaee1296527728678b400042b","observation_id":"57f2890f-83b5-4b77-9885-6887a56d5653","resolution":{"observed_at":"2026-08-06T19:01:27.510652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-06T14:42:56.113650Z","title":"Conformer: Convolution-augmented transformer for speech recognition,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2507.18181","last_updated":"2025-07-28T08:55:09Z","snapshot_observed_at":"2026-08-15T09:21:04.969128Z","submitted_at":"2025-07-24T08:27:53Z","title":"SpecASR: Accelerating LLM-based Automatic Speech Recognition via Speculative Decoding","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T14:42:56.113650Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2507.18181"},"observation_digest":"sha256:f0bfc3d7ee23b5a87bb1485f34f6da8612f6c35698e26715595fcc892d39fed4","observation_id":"581e39d2-a2e8-4a33-9fa6-4007ec3be640","resolution":{"observed_at":"2026-08-06T14:42:56.113650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-15T17:52:49.739127Z","title":"Conformer: Convolution-augmented transformer for speech recognition,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2507.20169","last_updated":"2025-07-27T08:16:23Z","snapshot_observed_at":"2026-08-15T19:07:45.499214Z","submitted_at":"2025-07-27T08:16:23Z","title":"Self-Improvement for Audio Large Language Model using Unlabeled Speech","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T17:52:49.739127Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2507.20169"},"observation_digest":"sha256:d5ebda890934d36e5638d168926705714ef143ccac57a4ce764fa7473195fc33","observation_id":"19912d0a-9069-4a27-96cd-5287d68f9453","resolution":{"observed_at":"2026-08-15T17:52:49.739127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":"2005.08100","doi":"10.48550/arxiv.2005.08100","metadata_source":"pith","pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"C., Parmar, N., Zhang, Y., Yu, J","venue":"eess.AS","work_id":"ea82ef7a-cc1e-489b-8704-4732b4801696","year":2020},"citing_paper":{"arxiv_id":"2508.07285","last_updated":"2026-05-19T14:44:40Z","snapshot_observed_at":"2026-08-05T00:29:45.624756Z","submitted_at":"2025-08-10T10:46:14Z","title":"Non-Intrusive Automatic Speech Recognition Refinement: A Survey","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-21T23:34:52.249143Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2508.07285"},"observation_digest":"sha256:9d61dab941d88bf541b804a9d2f7621901594925b9156f1f92d4fca906aae571","observation_id":"ecd4dfe7-a943-40bb-ac73-a8eb964e1f91","resolution":{"observed_at":"2026-05-21T23:35:46.452979Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-10T15:38:39.405362+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-10T15:38:39.405362+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-05T21:12:01.925265Z","title":"Conformer: Convolution-augmented transformer for speech recognition","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2508.09372","last_updated":"2025-08-12T21:59:53Z","snapshot_observed_at":"2026-08-11T09:44:42.440269Z","submitted_at":"2025-08-12T21:59:53Z","title":"A Signer-Invariant Conformer and Multi-Scale Fusion Transformer for Continuous Sign Language Recognition","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T21:12:01.925265Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2508.09372"},"observation_digest":"sha256:1d8b5fe539bb94055b8cd743b125b03ac5b158a8a4d63a3ba665af89d54735aa","observation_id":"9d6e07af-e3de-4174-9279-b39644d2194d","resolution":{"observed_at":"2026-08-05T21:12:01.925265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-05T16:24:13.925390Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.18653","last_updated":"2025-08-26T03:51:03Z","snapshot_observed_at":"2026-08-15T19:06:59.340234Z","submitted_at":"2025-08-26T03:51:03Z","title":"The Sound of Risk: A Multimodal Physics-Informed Acoustic Model for Forecasting Market Volatility and Enhancing Market Interpretability","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-05T16:24:13.925390Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2508.18653"},"observation_digest":"sha256:1a0c0a4b49e7f819289aa62f06bf88881137baf7008cad54cf8bd1d57e78b353","observation_id":"12c4f2be-3549-4235-b773-52986618c110","resolution":{"observed_at":"2026-08-05T16:24:13.925390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-05T14:24:31.055305Z","title":"Conformer: Convolution-augmented transformer for speech recognition,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2508.21470","last_updated":"2025-08-29T09:50:05Z","snapshot_observed_at":"2026-08-15T05:24:25.782456Z","submitted_at":"2025-08-29T09:50:05Z","title":"Fundamentals of Data-Driven Approaches to Acoustic Signal Detection, Filtering, and Transformation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T14:24:31.055305Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2508.21470"},"observation_digest":"sha256:6f755435b2688d04c986b53ebade2ed47df2ad3239f1f6c83ba5a7141a51885d","observation_id":"2bd2cf12-0a45-40ce-bee6-41ffad99057b","resolution":{"observed_at":"2026-08-05T14:24:31.055305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-05T15:22:20.578116Z","title":"Conformer: Convolution-augmented transformer for speech recognition,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2509.00094","last_updated":"2025-08-27T15:28:46Z","snapshot_observed_at":"2026-08-14T03:33:14.709344Z","submitted_at":"2025-08-27T15:28:46Z","title":"Automatic Pronunciation Error Detection and Correction of the Holy Quran's Learners Using Deep Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T15:22:20.578116Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2509.00094"},"observation_digest":"sha256:1e2999f26f4c439c5dec02c4a901979eeeb003f1d985beb93d71fc5884c0d29a","observation_id":"9deb145b-5d8f-44c6-a778-135df11c596b","resolution":{"observed_at":"2026-08-05T15:22:20.578116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-05T13:36:04.660557Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.00503","last_updated":"2025-08-30T13:50:58Z","snapshot_observed_at":"2026-08-14T06:56:40.304507Z","submitted_at":"2025-08-30T13:50:58Z","title":"Entropy-based Coarse and Compressed Semantic Speech Representation Learning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-05T13:36:04.660557Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2509.00503"},"observation_digest":"sha256:4e6f313073c795b0bac2853b5e6ee077e2d8d74ef44a4c6d66b7b8b05f77374d","observation_id":"71d59571-a5e8-4a80-920c-49ba09d4ac7a","resolution":{"observed_at":"2026-08-05T13:36:04.660557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-05T12:00:47.991578Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.02038","last_updated":"2025-09-03T22:50:00Z","snapshot_observed_at":"2026-08-16T09:37:53.467014Z","submitted_at":"2025-09-02T07:28:51Z","title":"NADI 2025: The First Multidialectal Arabic Speech Processing Shared Task","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-05T12:00:47.991578Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2509.02038"},"observation_digest":"sha256:071bf931dd89a0cf8ccd4194238e0583f928e2cc8711a4cfd1383b979837fdcf","observation_id":"13982067-8fed-4bfc-95ad-6293d88d9d1e","resolution":{"observed_at":"2026-08-05T12:00:47.991578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-05T11:40:59.970746Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.02349","last_updated":"2025-09-04T14:25:57Z","snapshot_observed_at":"2026-08-16T11:26:28.123684Z","submitted_at":"2025-09-02T14:15:22Z","title":"AudioCodecBench: A Comprehensive Benchmark for Audio Codec Evaluation","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-05T11:40:59.970746Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2509.02349"},"observation_digest":"sha256:7b34a3fba3a36082b9f37fe8f57ea1f3da8238bdfb6cdb03ea1ac3f7f50eb037","observation_id":"dd0b3353-cd8a-4cff-9ef2-c00dd16d36e1","resolution":{"observed_at":"2026-08-05T11:40:59.970746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-05T10:16:11.974460Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.04393","last_updated":"2025-09-04T17:04:44Z","snapshot_observed_at":"2026-08-09T12:46:23.066946Z","submitted_at":"2025-09-04T17:04:44Z","title":"Contextualized Token Discrimination for Speech Search Query Correction","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-05T10:16:11.974460Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2509.04393"},"observation_digest":"sha256:3d696cad0245f4036568bc8dd6f1d9b51ce55c171211a0f0a177cf7c623fc12b","observation_id":"89d46fd3-6fb4-4019-9d62-d02e9e973939","resolution":{"observed_at":"2026-08-05T10:16:11.974460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-04T18:20:02.004092Z","title":"Conformer: Convolution-augmented transformer for speech recognition,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2509.10031","last_updated":"2025-09-12T07:52:51Z","snapshot_observed_at":"2026-08-15T13:30:47.553688Z","submitted_at":"2025-09-12T07:52:51Z","title":"Unified Learnable 2D Convolutional Feature Extraction for ASR","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T18:20:02.004092Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2509.10031"},"observation_digest":"sha256:abf1e1566762501977164e7bbb565334eee8307df073f6705df06e07be91d01c","observation_id":"109d7505-fcb0-4f70-9f06-f3381a8736ef","resolution":{"observed_at":"2026-08-04T18:20:02.004092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-04T12:50:26.217151Z","title":"Conformer: Convolution-augmented transformer for speech recognition,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2510.01891","last_updated":"2026-05-31T13:26:11Z","snapshot_observed_at":"2026-08-04T12:50:18.502575Z","submitted_at":"2025-10-02T10:59:21Z","title":"HRTFformer: A Spatially-Aware Transformer for Individual HRTF Upsampling in Immersive Audio Rendering","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-04T12:50:26.217151Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2510.01891"},"observation_digest":"sha256:1a292e2644199dcea78290bb805b31990e33d24b6e9d9e89e0e06729d28c9741","observation_id":"963e2091-2ee9-4915-83de-4b9c17528fac","resolution":{"observed_at":"2026-08-04T12:50:26.217151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":"2005.08100","doi":"10.48550/arxiv.2005.08100","metadata_source":"pith","pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"C., Parmar, N., Zhang, Y., Yu, J","venue":"eess.AS","work_id":"ea82ef7a-cc1e-489b-8704-4732b4801696","year":2020},"citing_paper":{"arxiv_id":"2511.03295","last_updated":"2026-04-08T08:46:07Z","snapshot_observed_at":"2026-08-14T22:16:05.832295Z","submitted_at":"2025-11-05T08:49:22Z","title":"How to Evaluate Speech Translation with Source-Aware Neural MT Metrics","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-18T01:36:53.294436Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2511.03295"},"observation_digest":"sha256:0a065a926f73a41c67b5ef25a324ea4f7d8cf0cd0521344936473f7832bd9787","observation_id":"df9c363b-3daf-4ef6-9ea0-617f78190a81","resolution":{"observed_at":"2026-05-18T01:40:37.282806Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-10T15:38:39.405362+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-10T15:38:39.405362+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-03T15:22:49.687539Z","title":"Conformer: Convolution-augmented transformer for speech recognition.arXiv preprint arXiv:2005.08100, 2020","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2512.17351","last_updated":"2026-07-28T16:53:50Z","snapshot_observed_at":"2026-08-13T08:11:02.303804Z","submitted_at":"2025-12-19T08:47:28Z","title":"Physics of Language Models: Part 4.1, Architecture Design and the Magic of Canon Layers","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T15:22:49.687539Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2512.17351"},"observation_digest":"sha256:21918c07b60d0f8e812056315ec94657f7745110f2b5177d7eb345b1f2834838","observation_id":"a62e6233-4ecd-4cb0-ab4c-74f06e339abb","resolution":{"observed_at":"2026-08-03T15:22:49.687539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-03T13:45:23.606608Z","title":"ISBN 978-1-939133-47-2","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2512.23236","last_updated":"2026-07-06T22:18:07Z","snapshot_observed_at":"2026-08-14T21:09:28.913440Z","submitted_at":"2025-12-29T06:31:55Z","title":"KernelEvolve: Scaling Agentic Kernel Coding for Heterogeneous AI Accelerators at Meta","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T13:45:23.606608Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2512.23236"},"observation_digest":"sha256:ce3e10b2843a43041af6d818e7994463d2d972ae4e0bb29c7921250893c2a08f","observation_id":"eae177ea-07c3-4cd9-9be1-0870d84ec4f6","resolution":{"observed_at":"2026-08-03T13:45:23.606608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-03T12:02:00.595452Z","title":"Conformer: Convolution-augmented transformer for speech recognition","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2601.06199","last_updated":"2026-06-01T03:39:22Z","snapshot_observed_at":"2026-08-15T17:09:58.548655Z","submitted_at":"2026-01-08T07:46:03Z","title":"FastSLM: Hierarchical Temporal Abstraction for Efficient Long-Form Speech Adaptation","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T12:02:00.595452Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2601.06199"},"observation_digest":"sha256:0b5d9c1cffbecde1bbcc64df3f7dd314b9dfa8402224ceecd7864981a9dcda7a","observation_id":"52dae236-5a3d-4b27-9707-13a82a1b72d5","resolution":{"observed_at":"2026-08-03T12:02:00.595452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":"2005.08100","doi":"10.48550/arxiv.2005.08100","metadata_source":"pith","pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"C., Parmar, N., Zhang, Y., Yu, J","venue":"eess.AS","work_id":"ea82ef7a-cc1e-489b-8704-4732b4801696","year":2020},"citing_paper":{"arxiv_id":"2601.18295","last_updated":"2026-04-05T09:45:12Z","snapshot_observed_at":"2026-08-11T14:04:31.017779Z","submitted_at":"2026-01-26T09:23:36Z","title":"Noise-Robust Contrastive Learning with an MFCC-Conformer For Coronary Artery Disease Detection","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-16T11:26:15.596039Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2601.18295"},"observation_digest":"sha256:23ff6236c7353238be87574ba2e5563f4e5b68c04991859a45ff3b74cae2b322","observation_id":"6799d9a5-7ce7-48e8-8d67-09f0c696cfcd","resolution":{"observed_at":"2026-05-16T11:27:48.195077Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-10T15:38:39.405362+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-10T15:38:39.405362+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-03T03:27:34.432446Z","title":"Conformer: Convolution-augmented transformer for speech recognition.arXiv preprint arXiv:2005.08100, 2020","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2603.03312","last_updated":"2026-05-29T19:20:43Z","snapshot_observed_at":"2026-08-15T13:12:10.976013Z","submitted_at":"2026-02-09T02:47:07Z","title":"Escaping the BLEU Trap: A Signal-Grounded Framework with Decoupled Semantic Guidance for EEG-to-Text Decoding","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T03:27:34.432446Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2603.03312"},"observation_digest":"sha256:093f7a4c4bfa1a08986e76cb4c53b4191e0fef253785df7e7e40a4375cedee05","observation_id":"c3d2a669-ff9a-4efd-a10c-0b7692264241","resolution":{"observed_at":"2026-08-03T03:27:34.432446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-02T18:35:50.419650Z","title":"Conformer: Convolution- augmented transformer for speech recognition,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2603.08173","last_updated":"2026-07-18T12:50:12Z","snapshot_observed_at":"2026-08-10T19:41:58.785482Z","submitted_at":"2026-03-09T09:53:05Z","title":"Evolution Strategy-Based Calibration for Low-Bit Quantization of Speech Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T18:35:50.419650Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2603.08173"},"observation_digest":"sha256:a90ee1a0b243c1b453801f577a4e5698101971444985b92245bc87c6274ce7c5","observation_id":"bfd8d8b4-0d06-45a6-8bf3-3feaa79919e9","resolution":{"observed_at":"2026-08-02T18:35:50.419650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-07-14T22:43:13.611383Z","title":"Conformer: Convolution-augmented transformer for speech recognition,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2603.11669","last_updated":"2026-06-08T07:16:00Z","snapshot_observed_at":"2026-08-15T19:06:59.854867Z","submitted_at":"2026-03-12T08:37:28Z","title":"SEMamba++: A General Speech Restoration Framework Leveraging Global, Local, and Periodic Spectral Patterns","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-14T22:43:13.611383Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2603.11669"},"observation_digest":"sha256:ba7b1a318cbaa78a77f615789855e60d251cad3c6c0fc13139397e0cb7099ab1","observation_id":"7fd691fd-e381-4a10-b00e-311eb6e9bbcd","resolution":{"observed_at":"2026-07-14T22:43:13.611383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-02T18:03:41.525577Z","title":"Con- former: Convolution-augmented transformer for speech recogni- tion,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2603.16805","last_updated":"2026-07-16T07:47:56Z","snapshot_observed_at":"2026-08-10T23:32:02.693607Z","submitted_at":"2026-03-17T17:09:45Z","title":"Making Separation-First Multi-Stream Audio Watermarking Feasible via Joint Training","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T18:03:41.525577Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2603.16805"},"observation_digest":"sha256:02a5075f76e9bcdc131397a1c0723b4e8d9e0d2e8f3c1e298a409ef6bb371a51","observation_id":"0c892742-1fd4-400a-bd8a-c6751a917048","resolution":{"observed_at":"2026-08-02T18:03:41.525577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-07-14T19:56:33.793167Z","title":"Conformer: Convolution- augmented transformer for speech recognition,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2604.01895","last_updated":"2026-04-02T10:59:55Z","snapshot_observed_at":"2026-08-15T00:34:46.944061Z","submitted_at":"2026-04-02T10:59:55Z","title":"Sharp spectral estimates for free boundary problems arising in plasma physics","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-14T19:56:33.793167Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2604.01895"},"observation_digest":"sha256:1c4f2532ba5414f007a005cf097a8ff439b64ab74d2ef2d99f393a9688ccb13e","observation_id":"25ebb840-3fa1-4c2e-a9b3-c8c223cac999","resolution":{"observed_at":"2026-07-14T19:56:33.793167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":"2005.08100","doi":"10.48550/arxiv.2005.08100","metadata_source":"pith","pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"C., Parmar, N., Zhang, Y., Yu, J","venue":"eess.AS","work_id":"ea82ef7a-cc1e-489b-8704-4732b4801696","year":2020},"citing_paper":{"arxiv_id":"2604.01897","last_updated":"2026-07-13T11:03:37Z","snapshot_observed_at":"2026-08-02T18:54:29.968214Z","submitted_at":"2026-04-02T11:00:37Z","title":"FastTurn: Unifying Acoustic and Streaming Semantic Cues for Low-Latency and Robust Turn Detection","version":4},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-13T20:55:09.141906Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2604.01897"},"observation_digest":"sha256:5731f52130db5e833b50735261b39e3d61462907a39f53ccf866608b7f587609","observation_id":"f98ad145-9767-4ece-9a06-260d23469722","resolution":{"observed_at":"2026-05-13T20:58:15.996997Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-10T15:38:39.405362+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-10T15:38:39.405362+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":"2005.08100","doi":"10.48550/arxiv.2005.08100","metadata_source":"pith","pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"C., Parmar, N., Zhang, Y., Yu, J","venue":"eess.AS","work_id":"ea82ef7a-cc1e-489b-8704-4732b4801696","year":2020},"citing_paper":{"arxiv_id":"2604.03689","last_updated":"2026-04-04T11:22:49Z","snapshot_observed_at":"2026-08-15T08:25:13.460180Z","submitted_at":"2026-04-04T11:22:49Z","title":"MALEFA: Multi-grAnularity Learning and Effective False Alarm Suppression for Zero-shot Keyword Spotting","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-13T17:20:18.787074Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2604.03689"},"observation_digest":"sha256:cd297358777646b3023952b33ae1cb5671f6e9f1c2f4bb692a7a9bfb7b42a4c6","observation_id":"70fa7b1f-716f-42bf-992d-0f62b9440657","resolution":{"observed_at":"2026-05-13T17:23:02.525280Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-10T15:38:39.405362+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-10T15:38:39.405362+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":"2005.08100","doi":"10.48550/arxiv.2005.08100","metadata_source":"pith","pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"C., Parmar, N., Zhang, Y., Yu, J","venue":"eess.AS","work_id":"ea82ef7a-cc1e-489b-8704-4732b4801696","year":2020},"citing_paper":{"arxiv_id":"2604.08003","last_updated":"2026-04-09T09:07:52Z","snapshot_observed_at":"2026-08-15T12:24:31.594968Z","submitted_at":"2026-04-09T09:07:52Z","title":"Rethinking Entropy Allocation in LLM-based ASR: Understanding the Dynamics between Speech Encoders and LLMs","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T18:06:50.408402Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2604.08003"},"observation_digest":"sha256:b839aab754fae21465fd807cc61e60a919a6f6e0976d2625cde0aaf6c7a64ff5","observation_id":"27e726b8-4a17-4182-85ad-ec707cbfaa1d","resolution":{"observed_at":"2026-05-11T05:30:57.621115Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-10T15:38:39.405362+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-10T15:38:39.405362+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":"2005.08100","doi":"10.48550/arxiv.2005.08100","metadata_source":"pith","pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"C., Parmar, N., Zhang, Y., Yu, J","venue":"eess.AS","work_id":"ea82ef7a-cc1e-489b-8704-4732b4801696","year":2020},"citing_paper":{"arxiv_id":"2604.18105","last_updated":"2026-06-18T09:00:08Z","snapshot_observed_at":"2026-08-12T20:55:59.091609Z","submitted_at":"2026-04-20T11:21:06Z","title":"NIM4-ASR: Towards Efficient, Robust, and Customizable Real-Time LLM-Based ASR","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T03:48:14.211240Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2604.18105"},"observation_digest":"sha256:7bdecd3e2c9566dcbef25dc7cfc4297e67e60f50268d51b5103fe79a5ddb3ea6","observation_id":"65366e2f-cbbe-4ce2-adcd-1e79f012d250","resolution":{"observed_at":"2026-05-11T12:21:06.024806Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-10T15:38:39.405362+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-10T15:38:39.405362+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":"2005.08100","doi":"10.48550/arxiv.2005.08100","metadata_source":"pith","pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"C., Parmar, N., Zhang, Y., Yu, J","venue":"eess.AS","work_id":"ea82ef7a-cc1e-489b-8704-4732b4801696","year":2020},"citing_paper":{"arxiv_id":"2604.18105","last_updated":"2026-06-18T09:00:08Z","snapshot_observed_at":"2026-08-12T20:55:59.091609Z","submitted_at":"2026-04-20T11:21:06Z","title":"NIM4-ASR: Towards Efficient, Robust, and Customizable Real-Time LLM-Based ASR","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-05T13:15:50.794969Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2604.18105"},"observation_digest":"sha256:5d31f24439d7aabf56507c1acfdd6be55b1506201a6985ed5f279e387193fc27","observation_id":"39e80b68-f2a1-4a0b-a324-29a11dafecc3","resolution":{"observed_at":"2026-07-05T13:21:06.270505Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-10T15:38:39.405362+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-10T15:38:39.405362+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":"2005.08100","doi":"10.48550/arxiv.2005.08100","metadata_source":"pith","pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"C., Parmar, N., Zhang, Y., Yu, J","venue":"eess.AS","work_id":"ea82ef7a-cc1e-489b-8704-4732b4801696","year":2020},"citing_paper":{"arxiv_id":"2604.19028","last_updated":"2026-04-21T03:23:34Z","snapshot_observed_at":"2026-08-14T17:32:00.083714Z","submitted_at":"2026-04-21T03:23:34Z","title":"Learning Posterior Predictive Distributions for Node Classification from Synthetic Graph Priors","version":1},"reference_index":230,"source":"arxiv_source","source_observed_at":"2026-05-10T03:50:44.626261Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2604.19028"},"observation_digest":"sha256:121fe0df21476911a5369b360cb0037c2670d2ad8e0221c884289722a0929758","observation_id":"41a58e19-f876-4a08-afd5-02077e5c2d07","resolution":{"observed_at":"2026-05-11T12:21:04.509497Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-10T15:38:39.405362+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-10T15:38:39.405362+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":"2005.08100","doi":"10.48550/arxiv.2005.08100","metadata_source":"pith","pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"C., Parmar, N., Zhang, Y., Yu, J","venue":"eess.AS","work_id":"ea82ef7a-cc1e-489b-8704-4732b4801696","year":2020},"citing_paper":{"arxiv_id":"2604.23653","last_updated":"2026-04-26T10:47:18Z","snapshot_observed_at":"2026-07-06T23:09:52.860780Z","submitted_at":"2026-04-26T10:47:18Z","title":"ResAF-Net: An Anchor-Free Attention-Based Network for Tree Detection and Agricultural Mapping in Palestine","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-08T06:51:54.321037Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2604.23653"},"observation_digest":"sha256:565a7f19e9d32b97cea1ba847540b81d9eacfd4ad5540c01fdecd7cd83854cbd","observation_id":"99efac63-c8cc-4bb1-838e-ec9722303421","resolution":{"observed_at":"2026-05-11T21:06:13.351597Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-10T15:38:39.405362+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-10T15:38:39.405362+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":"2005.08100","doi":"10.48550/arxiv.2005.08100","metadata_source":"pith","pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"C., Parmar, N., Zhang, Y., Yu, J","venue":"eess.AS","work_id":"ea82ef7a-cc1e-489b-8704-4732b4801696","year":2020},"citing_paper":{"arxiv_id":"2605.11901","last_updated":"2026-05-12T10:15:00Z","snapshot_observed_at":"2026-07-06T23:23:39.723268Z","submitted_at":"2026-05-12T10:15:00Z","title":"AccLock: Unlocking Identity with Heartbeat Using In-Ear Accelerometers","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-13T05:24:04.546820Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2605.11901"},"observation_digest":"sha256:e5a1979aae7e6f930853750b8a29464e454dfefada99b9d703dacd8792a2a829","observation_id":"b514e865-dcd0-4746-871f-a3e83e9a65c8","resolution":{"observed_at":"2026-05-13T05:27:18.633700Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-10T15:38:39.405362+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-10T15:38:39.405362+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":"2005.08100","doi":"10.48550/arxiv.2005.08100","metadata_source":"pith","pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"C., Parmar, N., Zhang, Y., Yu, J","venue":"eess.AS","work_id":"ea82ef7a-cc1e-489b-8704-4732b4801696","year":2020},"citing_paper":{"arxiv_id":"2605.16555","last_updated":"2026-05-15T18:57:48Z","snapshot_observed_at":"2026-08-02T22:36:41.510450Z","submitted_at":"2026-05-15T18:57:48Z","title":"MedASR: An Open-Source Model for High-Accuracy Medical Dictation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-19T21:18:56.084055Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2605.16555"},"observation_digest":"sha256:a2699a5f1800d13acd90ddf8beb6ebc5110d82ca6830ed827c4271cc179dc092","observation_id":"df2d7a77-9d60-400e-ac7f-7e97e2084e00","resolution":{"observed_at":"2026-05-19T21:22:48.080788Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-10T15:38:39.405362+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-10T15:38:39.405362+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":"2005.08100","doi":"10.48550/arxiv.2005.08100","metadata_source":"pith","pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"C., Parmar, N., Zhang, Y., Yu, J","venue":"eess.AS","work_id":"ea82ef7a-cc1e-489b-8704-4732b4801696","year":2020},"citing_paper":{"arxiv_id":"2605.17152","last_updated":"2026-05-16T20:56:15Z","snapshot_observed_at":"2026-08-12T11:54:49.449152Z","submitted_at":"2026-05-16T20:56:15Z","title":"Multilingual and Multimodal LLMs in the Wild: Building for Low-Resource Languages","version":1},"reference_index":242,"source":"arxiv_source","source_observed_at":"2026-05-20T14:33:36.100966Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2605.17152"},"observation_digest":"sha256:4344a282ff146f11bc1f74a12bd6b9115742deaad40bcda3aed2e28b520fc9ba","observation_id":"a8e13d0d-7ece-4114-a837-e5bdd89d3948","resolution":{"observed_at":"2026-05-20T14:38:21.743997Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-10T15:38:39.405362+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-10T15:38:39.405362+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":"2005.08100","doi":"10.48550/arxiv.2005.08100","metadata_source":"pith","pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"C., Parmar, N., Zhang, Y., Yu, J","venue":"eess.AS","work_id":"ea82ef7a-cc1e-489b-8704-4732b4801696","year":2020},"citing_paper":{"arxiv_id":"2605.19632","last_updated":"2026-05-19T10:15:58Z","snapshot_observed_at":"2026-08-15T10:34:58.141502Z","submitted_at":"2026-05-19T10:15:58Z","title":"Executable Boundary Contracts for Sound Event Traces","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-20T02:08:44.066554Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2605.19632"},"observation_digest":"sha256:df6b90c27a1945ace7664be5ff023491342dd21ba256b6a8f5ab4aca2edb224e","observation_id":"321c05f4-83f6-4fb6-9d51-64546cd41c36","resolution":{"observed_at":"2026-05-20T02:12:58.511264Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-10T15:38:39.405362+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-10T15:38:39.405362+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":"2005.08100","doi":"10.48550/arxiv.2005.08100","metadata_source":"pith","pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"C., Parmar, N., Zhang, Y., Yu, J","venue":"eess.AS","work_id":"ea82ef7a-cc1e-489b-8704-4732b4801696","year":2020},"citing_paper":{"arxiv_id":"2605.28139","last_updated":"2026-05-27T08:22:47Z","snapshot_observed_at":"2026-08-05T12:11:37.559145Z","submitted_at":"2026-05-27T08:22:47Z","title":"Data-Efficient On-Policy Distillation for Automatic Speech Recognition","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-29T12:02:35.332633Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2605.28139"},"observation_digest":"sha256:cb086b98bda057e585927e8cac39a00dfa444d099e0e96a1fedbe2fb81d42784","observation_id":"1ab776c2-1163-4f25-a61c-21b3550f82c6","resolution":{"observed_at":"2026-06-29T12:03:23.188660Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-10T15:38:39.405362+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-10T15:38:39.405362+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":"2005.08100","doi":"10.48550/arxiv.2005.08100","metadata_source":"pith","pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"C., Parmar, N., Zhang, Y., Yu, J","venue":"eess.AS","work_id":"ea82ef7a-cc1e-489b-8704-4732b4801696","year":2020},"citing_paper":{"arxiv_id":"2605.30689","last_updated":"2026-05-29T00:34:17Z","snapshot_observed_at":"2026-08-13T13:44:06.588677Z","submitted_at":"2026-05-29T00:34:17Z","title":"ConTrans: Learning Text-enhanced Local-global Temporal Representations for Zero-shot Temporal Action Localization","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-28T23:27:25.975576Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2605.30689"},"observation_digest":"sha256:2bc6db51d6539d0a0f9fe2dfa937fff2ad4e31bbcaa6606094ff4eed651f2064","observation_id":"87626e57-fa71-489b-9e89-f75dca9e397f","resolution":{"observed_at":"2026-06-28T23:32:47.449856Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-10T15:38:39.405362+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-10T15:38:39.405362+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2005.08100/citation-record","integrity":"/paper/2005.08100/integrity","json":"/paper/2005.08100/citation-record.json","paper":"/paper/2005.08100"},"outbound":[],"paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 100 inbound Pith citation observations for arXiv:2005.08100."}