{"as_of":"2026-08-08T00:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0b28cc75d5768f2738684cec9bc978f381983ab1adefd72ae035fa716303e033","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:19:03.988835Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.24820/citation-record","integrity":"/paper/2505.24820/integrity","json":"/paper/2505.24820/citation-record.json","paper":"/paper/2505.24820"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:10.606057Z","title":"Small-footprint keyword spotting using deep neural networks,","venue":null,"work_id":"d2717cd1-6439-432f-9868-eabfd286cf84","year":null},"citing_paper":{"arxiv_id":"2505.24820","last_updated":"2025-05-30T17:22:39Z","snapshot_observed_at":"2026-08-07T12:10:46.492997Z","submitted_at":"2025-05-30T17:22:39Z","title":"Masked Self-distilled Transducer-based Keyword Spotting with Semi-autoregressive Decoding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:00.619891Z"},"links":{"citing_paper":"/paper/2505.24820"},"observation_digest":"sha256:6ea4fe53309033bf6f7c2af5d95ee0d1135cd048a698545c614ce494c90ca68f","observation_id":"40a7845b-64aa-4b1a-8603-a10eba5bbd0e","resolution":{"observed_at":"2026-08-07T12:19:10.692811Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:00.707955Z","title":"Multi-task learning and weighted cross-entropy for dnn-based keyword spotting,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.24820","last_updated":"2025-05-30T17:22:39Z","snapshot_observed_at":"2026-08-07T12:10:46.492997Z","submitted_at":"2025-05-30T17:22:39Z","title":"Masked Self-distilled Transducer-based Keyword Spotting with Semi-autoregressive Decoding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:00.707955Z"},"links":{"citing_paper":"/paper/2505.24820"},"observation_digest":"sha256:7ec8d304bd1d529a8eae2c0ecb9572a8ff6c006810e62789151cb0e84783d6e8","observation_id":"576125be-7efa-4db4-8869-dd5b0e5df1eb","resolution":{"observed_at":"2026-08-07T12:19:00.707955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:10.256857Z","title":"Compressed time delay neural network for small-footprint keyword spotting,","venue":null,"work_id":"ced947d4-5845-4063-a2ac-83fede9f99f3","year":2017},"citing_paper":{"arxiv_id":"2505.24820","last_updated":"2025-05-30T17:22:39Z","snapshot_observed_at":"2026-08-07T12:10:46.492997Z","submitted_at":"2025-05-30T17:22:39Z","title":"Masked Self-distilled Transducer-based Keyword Spotting with Semi-autoregressive Decoding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:00.797083Z"},"links":{"citing_paper":"/paper/2505.24820"},"observation_digest":"sha256:4a540ae36b4cfa37d65c2a8267f28d2a84739b75b6d3111509209d13038a76c1","observation_id":"b7dad51d-c728-4538-a5ee-825625d8bf66","resolution":{"observed_at":"2026-08-07T12:19:10.441790Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:09.947388Z","title":"Text adaptive detection for customizable keyword spotting,","venue":null,"work_id":"49a5e8e3-26e0-47f0-bacb-5660ebf86cad","year":2022},"citing_paper":{"arxiv_id":"2505.24820","last_updated":"2025-05-30T17:22:39Z","snapshot_observed_at":"2026-08-07T12:10:46.492997Z","submitted_at":"2025-05-30T17:22:39Z","title":"Masked Self-distilled Transducer-based Keyword Spotting with Semi-autoregressive Decoding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:00.882708Z"},"links":{"citing_paper":"/paper/2505.24820"},"observation_digest":"sha256:4c6c09819a109eed525ad89f9b9de9b986e672eec1250d6419e470dc9a9441ce","observation_id":"6cb99265-851e-41f4-a5a0-83fbd8d41d1a","resolution":{"observed_at":"2026-08-07T12:19:10.092117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:09.705093Z","title":"Text-aware speech separation for multi-talker keyword spotting,","venue":null,"work_id":"7dc35a2d-406d-4868-8b16-60de1ca77e33","year":2024},"citing_paper":{"arxiv_id":"2505.24820","last_updated":"2025-05-30T17:22:39Z","snapshot_observed_at":"2026-08-07T12:10:46.492997Z","submitted_at":"2025-05-30T17:22:39Z","title":"Masked Self-distilled Transducer-based Keyword Spotting with Semi-autoregressive Decoding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:00.999348Z"},"links":{"citing_paper":"/paper/2505.24820"},"observation_digest":"sha256:2194dbb4931ce498e45cfe5ec2980968ff63fec728cff22abfdd540bae582c43","observation_id":"74d6320e-f709-4ca0-9c40-b91baf56ed54","resolution":{"observed_at":"2026-08-07T12:19:09.790094Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19577","last_updated":"2025-06-30T16:21:25Z","snapshot_observed_at":"2026-08-07T14:09:14.736514Z","submitted_at":"2025-05-26T06:47:43Z","title":"MFA-KWS: Effective Keyword Spotting with Multi-head Frame-asynchronous Decoding","version":3},"cited_work":{"arxiv_id":"2505.19577","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.19577","snapshot_observed_at":"2026-08-07T12:19:04.401514Z","title":"MFA-KWS: Effective Keyword Spotting with Multi-head Frame-asynchronous Decoding","venue":"eess.AS","work_id":"87eba257-50ac-43e6-8102-a857591930f8","year":2025},"citing_paper":{"arxiv_id":"2505.24820","last_updated":"2025-05-30T17:22:39Z","snapshot_observed_at":"2026-08-07T12:10:46.492997Z","submitted_at":"2025-05-30T17:22:39Z","title":"Masked Self-distilled Transducer-based Keyword Spotting with Semi-autoregressive Decoding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:01.129873Z"},"links":{"cited_paper":"/paper/2505.19577","citing_paper":"/paper/2505.24820"},"observation_digest":"sha256:9c648c168060f14c0783a6217178c2a507fbdb34b68ee8bfded79a55de056a30","observation_id":"569e28d9-7201-4607-8b5b-f007d3cf46b8","resolution":{"observed_at":"2026-08-07T12:19:04.474772Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:09.456940Z","title":"Self-attention transducers for end-to-end speech recognition,","venue":null,"work_id":"f093b47d-1049-4ce3-ad32-4213adb37666","year":2019},"citing_paper":{"arxiv_id":"2505.24820","last_updated":"2025-05-30T17:22:39Z","snapshot_observed_at":"2026-08-07T12:10:46.492997Z","submitted_at":"2025-05-30T17:22:39Z","title":"Masked Self-distilled Transducer-based Keyword Spotting with Semi-autoregressive Decoding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:01.225778Z"},"links":{"citing_paper":"/paper/2505.24820"},"observation_digest":"sha256:e1029a7f61eb9386f31e3b729dc65b5e1b95e10a4cca7a17a43be5354f86f983","observation_id":"7a5d9b57-681b-4a6e-a3a3-279362e9252e","resolution":{"observed_at":"2026-08-07T12:19:09.609371Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.12977","last_updated":"2019-10-28T21:29:21Z","snapshot_observed_at":"2026-08-07T03:57:12.028834Z","submitted_at":"2019-10-28T21:29:21Z","title":"Transformer-Transducer: End-to-End Speech Recognition with Self-Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.12977","snapshot_observed_at":"2026-08-07T12:19:01.332106Z","title":"Transformer-transducer: End-to-end speech recognition with self-attention,","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2505.24820","last_updated":"2025-05-30T17:22:39Z","snapshot_observed_at":"2026-08-07T12:10:46.492997Z","submitted_at":"2025-05-30T17:22:39Z","title":"Masked Self-distilled Transducer-based Keyword Spotting with Semi-autoregressive Decoding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:01.332106Z"},"links":{"cited_paper":"/paper/1910.12977","citing_paper":"/paper/2505.24820"},"observation_digest":"sha256:fbb44b80ebc9fcf79925ecc18fa217a03acb7678081338ea64c78f4c84632eee","observation_id":"9fa23c3d-4ec9-4e85-9680-74cd8537d232","resolution":{"observed_at":"2026-08-07T12:19:01.332106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:09.240045Z","title":"Transformer transducer: A streamable speech recognition model with transformer encoders and rnn-t loss,","venue":null,"work_id":"1069a0e3-0a9d-4960-9c6d-8e777d2caeb2","year":2020},"citing_paper":{"arxiv_id":"2505.24820","last_updated":"2025-05-30T17:22:39Z","snapshot_observed_at":"2026-08-07T12:10:46.492997Z","submitted_at":"2025-05-30T17:22:39Z","title":"Masked Self-distilled Transducer-based Keyword Spotting with Semi-autoregressive Decoding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:01.416405Z"},"links":{"citing_paper":"/paper/2505.24820"},"observation_digest":"sha256:69afa7f23803da70bbf8e54cdfa7562390bec564f5456a1026e6a5aca6f89552","observation_id":"d836ed7d-4221-4fda-804e-49be7a1750a3","resolution":{"observed_at":"2026-08-07T12:19:09.323308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:09.044235Z","title":"ContextNet: Improving Convolutional Neural Networks for Automatic Speech Recognition with Global Context,","venue":null,"work_id":"d61cffe0-4233-4074-8627-fcb25f93fdbf","year":2020},"citing_paper":{"arxiv_id":"2505.24820","last_updated":"2025-05-30T17:22:39Z","snapshot_observed_at":"2026-08-07T12:10:46.492997Z","submitted_at":"2025-05-30T17:22:39Z","title":"Masked Self-distilled Transducer-based Keyword Spotting with Semi-autoregressive Decoding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:01.525372Z"},"links":{"citing_paper":"/paper/2505.24820"},"observation_digest":"sha256:cdb94ea856aa4242f4f24d95048458464d93ea0b861c0273db86d7aa98061cb4","observation_id":"f93c5290-5484-4848-bfae-31d685209850","resolution":{"observed_at":"2026-08-07T12:19:09.130396Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:01.631171Z","title":"Conformer: Convolution- augmented Transformer for Speech Recognition,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.24820","last_updated":"2025-05-30T17:22:39Z","snapshot_observed_at":"2026-08-07T12:10:46.492997Z","submitted_at":"2025-05-30T17:22:39Z","title":"Masked Self-distilled Transducer-based Keyword Spotting with Semi-autoregressive Decoding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:01.631171Z"},"links":{"citing_paper":"/paper/2505.24820"},"observation_digest":"sha256:8a850347a01330e72c914897c4b4ea6ab75fce7bbd69cf417527bcc9ed742eb4","observation_id":"4938cc31-fd36-4efe-a45b-5bfc1739ea9c","resolution":{"observed_at":"2026-08-07T12:19:01.631171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05352","last_updated":"2022-07-01T20:41:39Z","snapshot_observed_at":"2026-07-06T12:59:16.136198Z","submitted_at":"2022-04-11T18:18:53Z","title":"Large-Scale Streaming End-to-End Speech Translation with Neural Transducers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05352","snapshot_observed_at":"2026-08-07T12:19:01.722172Z","title":"Large-scale streaming end-to-end speech translation with neural transducers,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.24820","last_updated":"2025-05-30T17:22:39Z","snapshot_observed_at":"2026-08-07T12:10:46.492997Z","submitted_at":"2025-05-30T17:22:39Z","title":"Masked Self-distilled Transducer-based Keyword Spotting with Semi-autoregressive Decoding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:01.722172Z"},"links":{"cited_paper":"/paper/2204.05352","citing_paper":"/paper/2505.24820"},"observation_digest":"sha256:1dc5df1ae924f47d41318da616ae74b14f619f0c2eaeb77ceab41793efca00c1","observation_id":"6f932803-aaed-4d1d-9318-ec47fabbddc3","resolution":{"observed_at":"2026-08-07T12:19:01.722172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14321","last_updated":"2025-03-14T00:10:58Z","snapshot_observed_at":"2026-07-06T17:20:33.356092Z","submitted_at":"2024-01-25T17:19:01Z","title":"VALL-T: Decoder-Only Generative Transducer for Robust and Decoding-Controllable Text-to-Speech","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14321","snapshot_observed_at":"2026-08-07T12:19:01.847943Z","title":"V ALL-T: decoder-only generative transducer for robust and decoding-controllable text-to-speech,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24820","last_updated":"2025-05-30T17:22:39Z","snapshot_observed_at":"2026-08-07T12:10:46.492997Z","submitted_at":"2025-05-30T17:22:39Z","title":"Masked Self-distilled Transducer-based Keyword Spotting with Semi-autoregressive Decoding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:01.847943Z"},"links":{"cited_paper":"/paper/2401.14321","citing_paper":"/paper/2505.24820"},"observation_digest":"sha256:33597acf6a016c8e6e66745f4a0cffe6fca6fc910dffcd280fa372bbf4be6586","observation_id":"a3208703-8afc-40fe-955b-7e983c385967","resolution":{"observed_at":"2026-08-07T12:19:01.847943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:08.715148Z","title":"Streaming small-footprint keyword spotting using sequence-to- sequence models,","venue":null,"work_id":"e9830a8b-97d0-433d-bf2e-0ec5b21575c7","year":2017},"citing_paper":{"arxiv_id":"2505.24820","last_updated":"2025-05-30T17:22:39Z","snapshot_observed_at":"2026-08-07T12:10:46.492997Z","submitted_at":"2025-05-30T17:22:39Z","title":"Masked Self-distilled Transducer-based Keyword Spotting with Semi-autoregressive Decoding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:02.076071Z"},"links":{"citing_paper":"/paper/2505.24820"},"observation_digest":"sha256:ab7ab8765fb17d7532064e6c29cc51192c0aac156a69139334080d758b4b1815","observation_id":"d2c9b7b9-8800-4463-83ba-73efb5daf17e","resolution":{"observed_at":"2026-08-07T12:19:08.897277Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:08.462696Z","title":"Adaptation of rnn transducer with text-to-speech technology for keyword spotting,","venue":null,"work_id":"a29b6f6d-e884-4e11-a8c1-12becb9b5ab1","year":2020},"citing_paper":{"arxiv_id":"2505.24820","last_updated":"2025-05-30T17:22:39Z","snapshot_observed_at":"2026-08-07T12:10:46.492997Z","submitted_at":"2025-05-30T17:22:39Z","title":"Masked Self-distilled Transducer-based Keyword Spotting with Semi-autoregressive Decoding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:02.192193Z"},"links":{"citing_paper":"/paper/2505.24820"},"observation_digest":"sha256:f0acc55af12c2052a7923605cbe6d6566b7085c6ce3dffd901675cf73d398296","observation_id":"955f634b-17a6-4da2-85e4-6655b6afb25e","resolution":{"observed_at":"2026-08-07T12:19:08.602495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:08.178730Z","title":"Improving rnn trans- ducer modeling for small-footprint keyword spotting,","venue":null,"work_id":"e57aed30-a27c-4925-83b1-c0500ddccab8","year":2021},"citing_paper":{"arxiv_id":"2505.24820","last_updated":"2025-05-30T17:22:39Z","snapshot_observed_at":"2026-08-07T12:10:46.492997Z","submitted_at":"2025-05-30T17:22:39Z","title":"Masked Self-distilled Transducer-based Keyword Spotting with Semi-autoregressive Decoding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:02.287962Z"},"links":{"citing_paper":"/paper/2505.24820"},"observation_digest":"sha256:0f8438fa1659b52399417f84faabc37986113d3f82440e5bfd81fd497bb1137d","observation_id":"060320cd-109c-4168-a2e5-6f70ffcbbf9b","resolution":{"observed_at":"2026-08-07T12:19:08.297088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:08.026270Z","title":"Rnn-t based open-vocabulary keyword spot- ting in mandarin with multi-level detection,","venue":null,"work_id":"d4e5809f-dc91-4335-aad5-f5a9f1c3bb41","year":2021},"citing_paper":{"arxiv_id":"2505.24820","last_updated":"2025-05-30T17:22:39Z","snapshot_observed_at":"2026-08-07T12:10:46.492997Z","submitted_at":"2025-05-30T17:22:39Z","title":"Masked Self-distilled Transducer-based Keyword Spotting with Semi-autoregressive Decoding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:02.373111Z"},"links":{"citing_paper":"/paper/2505.24820"},"observation_digest":"sha256:10b7a361e35f679dba00b8b316509ccf48a2939137ab9f60993e0e0933cd78f3","observation_id":"a7e195fb-519f-47fa-a25d-afad723fd7fc","resolution":{"observed_at":"2026-08-07T12:19:08.105424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:06.964943Z","title":"CaTT- KWS: A multi-stage customized keyword spotting framework based on cascaded transducer-transformer,","venue":null,"work_id":"db7c0309-9dac-427b-a2c3-3b345f321977","year":2022},"citing_paper":{"arxiv_id":"2505.24820","last_updated":"2025-05-30T17:22:39Z","snapshot_observed_at":"2026-08-07T12:10:46.492997Z","submitted_at":"2025-05-30T17:22:39Z","title":"Masked Self-distilled Transducer-based Keyword Spotting with Semi-autoregressive Decoding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:02.459007Z"},"links":{"citing_paper":"/paper/2505.24820"},"observation_digest":"sha256:b8f4be7d51efa7f78f29ecabb05599f27b601a676e195e3928819253d8d6ae06","observation_id":"38930a02-9ed7-4c52-9fdd-40418d906bd4","resolution":{"observed_at":"2026-08-07T12:19:07.575606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:06.718772Z","title":"TDT-KWS: fast and accurate keyword spotting using token-and-duration transducer,","venue":null,"work_id":"dea86fde-173d-4d1c-9821-84c7d598c617","year":2024},"citing_paper":{"arxiv_id":"2505.24820","last_updated":"2025-05-30T17:22:39Z","snapshot_observed_at":"2026-08-07T12:10:46.492997Z","submitted_at":"2025-05-30T17:22:39Z","title":"Masked Self-distilled Transducer-based Keyword Spotting with Semi-autoregressive Decoding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:02.556456Z"},"links":{"citing_paper":"/paper/2505.24820"},"observation_digest":"sha256:87747dbbf6fb27f05a089aef0c07c089472ab8741be65014b66a6a0a5fe24576","observation_id":"2e30d6a4-72d5-4839-a6a7-e55a806f1d32","resolution":{"observed_at":"2026-08-07T12:19:06.854939Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:06.546603Z","title":"U2-KWS: unified two-pass open-vocabulary keyword spotting with keyword bias,","venue":null,"work_id":"0172dc73-2769-4b38-82a7-bb08cc27a3ea","year":2023},"citing_paper":{"arxiv_id":"2505.24820","last_updated":"2025-05-30T17:22:39Z","snapshot_observed_at":"2026-08-07T12:10:46.492997Z","submitted_at":"2025-05-30T17:22:39Z","title":"Masked Self-distilled Transducer-based Keyword Spotting with Semi-autoregressive Decoding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:02.622523Z"},"links":{"citing_paper":"/paper/2505.24820"},"observation_digest":"sha256:cfdf04043436886c3a1d595c2b4cb30daf690ffa0d68b89e8b9533bf87cfaeb3","observation_id":"defb9deb-c112-421c-aa3e-54ec040b6b8f","resolution":{"observed_at":"2026-08-07T12:19:06.617608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:06.392613Z","title":"Three-in-one: Fast and accurate transducer for hybrid-autoregressive speech recognition,","venue":null,"work_id":"c2f51219-53dc-4afe-82f5-8a9318a336d7","year":2025},"citing_paper":{"arxiv_id":"2505.24820","last_updated":"2025-05-30T17:22:39Z","snapshot_observed_at":"2026-08-07T12:10:46.492997Z","submitted_at":"2025-05-30T17:22:39Z","title":"Masked Self-distilled Transducer-based Keyword Spotting with Semi-autoregressive Decoding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:02.719287Z"},"links":{"citing_paper":"/paper/2505.24820"},"observation_digest":"sha256:9808dc31184328115c1702aaf8253e1a32a20ee8b435ddb690368b7d30e4d201","observation_id":"cb096fb0-db40-4cec-b377-dbaba7eb3fdb","resolution":{"observed_at":"2026-08-07T12:19:06.464267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:06.246458Z","title":"Nemo: a toolkit for building ai applications using neural modules,","venue":null,"work_id":"24c7d62a-26bb-45df-ae77-1015b042fa83","year":2019},"citing_paper":{"arxiv_id":"2505.24820","last_updated":"2025-05-30T17:22:39Z","snapshot_observed_at":"2026-08-07T12:10:46.492997Z","submitted_at":"2025-05-30T17:22:39Z","title":"Masked Self-distilled Transducer-based Keyword Spotting with Semi-autoregressive Decoding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:02.815351Z"},"links":{"citing_paper":"/paper/2505.24820"},"observation_digest":"sha256:2df0c71780d7889d9904b36a2686c5fd3b2ad39edfc918fdbe036937b4349379","observation_id":"d6220edf-908f-49eb-a7c8-8f8545d4d96b","resolution":{"observed_at":"2026-08-07T12:19:06.315753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:06.056460Z","title":"Pruned rnn-t for fast, memory-efficient asr training,","venue":null,"work_id":"ec6c7d63-35f9-4241-92bb-b62b27b99aa6","year":2022},"citing_paper":{"arxiv_id":"2505.24820","last_updated":"2025-05-30T17:22:39Z","snapshot_observed_at":"2026-08-07T12:10:46.492997Z","submitted_at":"2025-05-30T17:22:39Z","title":"Masked Self-distilled Transducer-based Keyword Spotting with Semi-autoregressive Decoding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:02.915688Z"},"links":{"citing_paper":"/paper/2505.24820"},"observation_digest":"sha256:ec2bb727424522ec874a17bb3e376a0394531163a6442532be4f2ecff9e954de","observation_id":"ab6c263f-ff78-493e-bd00-6c059a49176c","resolution":{"observed_at":"2026-08-07T12:19:06.168334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:05.853982Z","title":"Rnn- transducer with stateless prediction network,","venue":null,"work_id":"97b55b0e-49c5-465b-9311-36e6c020f432","year":2020},"citing_paper":{"arxiv_id":"2505.24820","last_updated":"2025-05-30T17:22:39Z","snapshot_observed_at":"2026-08-07T12:10:46.492997Z","submitted_at":"2025-05-30T17:22:39Z","title":"Masked Self-distilled Transducer-based Keyword Spotting with Semi-autoregressive Decoding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:03.004964Z"},"links":{"citing_paper":"/paper/2505.24820"},"observation_digest":"sha256:f7d94fb4b5775d057fd8763836dcfddf1058715f588fd41d3401567c00b8c510","observation_id":"a44eee6d-54a9-438d-a620-b1a68439ebc5","resolution":{"observed_at":"2026-08-07T12:19:05.948443Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:05.690999Z","title":"Dropout: A simple way to prevent neural networks from overfitting,","venue":null,"work_id":"5ab170c2-5dc4-4a6a-a13e-cd5093827bd7","year":1929},"citing_paper":{"arxiv_id":"2505.24820","last_updated":"2025-05-30T17:22:39Z","snapshot_observed_at":"2026-08-07T12:10:46.492997Z","submitted_at":"2025-05-30T17:22:39Z","title":"Masked Self-distilled Transducer-based Keyword Spotting with Semi-autoregressive Decoding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:03.085171Z"},"links":{"citing_paper":"/paper/2505.24820"},"observation_digest":"sha256:840f1a59d7ae074da8438d86806fe8701d5112a519667e19134d73ed9c0eba10","observation_id":"4624edf5-7ac1-4ac6-b6fe-47981f0307d7","resolution":{"observed_at":"2026-08-07T12:19:05.757700Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:05.520619Z","title":"Efficient keyword spotting using dilated convolutions and gating,","venue":null,"work_id":"bb7f0798-d2b0-48b4-9ae4-eff4c731bd51","year":2019},"citing_paper":{"arxiv_id":"2505.24820","last_updated":"2025-05-30T17:22:39Z","snapshot_observed_at":"2026-08-07T12:10:46.492997Z","submitted_at":"2025-05-30T17:22:39Z","title":"Masked Self-distilled Transducer-based Keyword Spotting with Semi-autoregressive Decoding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:03.173361Z"},"links":{"citing_paper":"/paper/2505.24820"},"observation_digest":"sha256:e43df55c2d63c9a575b42f87fe4ccc8665eda059847200742542739fdadfb5b3","observation_id":"187f803c-8eb2-41c8-87f9-77179beee825","resolution":{"observed_at":"2026-08-07T12:19:05.589153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:05.340111Z","title":"Librispeech: an asr corpus based on public domain audio books,","venue":null,"work_id":"1f78be31-6b62-4d20-bc81-f181a9c89b8c","year":2015},"citing_paper":{"arxiv_id":"2505.24820","last_updated":"2025-05-30T17:22:39Z","snapshot_observed_at":"2026-08-07T12:10:46.492997Z","submitted_at":"2025-05-30T17:22:39Z","title":"Masked Self-distilled Transducer-based Keyword Spotting with Semi-autoregressive Decoding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:03.285607Z"},"links":{"citing_paper":"/paper/2505.24820"},"observation_digest":"sha256:48b90f151dc677e8c9556f4570fa4e30b776df42291c62b3b3fcdb1afd1eaba1","observation_id":"3e645d75-6a41-4a33-ab57-f553db2abeca","resolution":{"observed_at":"2026-08-07T12:19:05.420708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1808.10583","last_updated":"2018-09-13T02:45:27Z","snapshot_observed_at":"2026-07-06T06:58:27.332918Z","submitted_at":"2018-08-31T03:11:08Z","title":"AISHELL-2: Transforming Mandarin ASR Research Into Industrial Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.10583","snapshot_observed_at":"2026-08-07T12:19:03.404914Z","title":"AISHELL-2: transforming mandarin ASR research into industrial scale,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.24820","last_updated":"2025-05-30T17:22:39Z","snapshot_observed_at":"2026-08-07T12:10:46.492997Z","submitted_at":"2025-05-30T17:22:39Z","title":"Masked Self-distilled Transducer-based Keyword Spotting with Semi-autoregressive Decoding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:03.404914Z"},"links":{"cited_paper":"/paper/1808.10583","citing_paper":"/paper/2505.24820"},"observation_digest":"sha256:86237c169ffa963f8778c30e8783215d6d7f38e700c70ff0b088ef42fcea8234","observation_id":"e675afcc-afbe-408b-a6e4-59047e63509b","resolution":{"observed_at":"2026-08-07T12:19:03.404914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:03.502345Z","title":"Region proposal network based small-footprint keyword spotting,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.24820","last_updated":"2025-05-30T17:22:39Z","snapshot_observed_at":"2026-08-07T12:10:46.492997Z","submitted_at":"2025-05-30T17:22:39Z","title":"Masked Self-distilled Transducer-based Keyword Spotting with Semi-autoregressive Decoding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:03.502345Z"},"links":{"citing_paper":"/paper/2505.24820"},"observation_digest":"sha256:5c6d5dab03d183ff965de8cb19662c46d0739ad58cf150a1ab7bde495c6c8926","observation_id":"19c52e71-435d-48de-9b53-4f838db885d1","resolution":{"observed_at":"2026-08-07T12:19:03.502345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:05.139610Z","title":"Audio augmentation for speech recognition","venue":null,"work_id":"a970cb1c-f827-4616-83f0-9ac64e0144b4","year":2015},"citing_paper":{"arxiv_id":"2505.24820","last_updated":"2025-05-30T17:22:39Z","snapshot_observed_at":"2026-08-07T12:10:46.492997Z","submitted_at":"2025-05-30T17:22:39Z","title":"Masked Self-distilled Transducer-based Keyword Spotting with Semi-autoregressive Decoding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:03.581444Z"},"links":{"citing_paper":"/paper/2505.24820"},"observation_digest":"sha256:d302c4952a038f0c07ce704e97c149d342f4696df9c5e719d9d40e96ba629d98","observation_id":"baabb938-3dd2-4f70-b9b3-c8b61b396bb1","resolution":{"observed_at":"2026-08-07T12:19:05.230564Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:04.955217Z","title":"Specaugment: A simple data augmentation method for automatic speech recognition,","venue":null,"work_id":"db111c32-692d-43ce-b158-659fe8dae771","year":2019},"citing_paper":{"arxiv_id":"2505.24820","last_updated":"2025-05-30T17:22:39Z","snapshot_observed_at":"2026-08-07T12:10:46.492997Z","submitted_at":"2025-05-30T17:22:39Z","title":"Masked Self-distilled Transducer-based Keyword Spotting with Semi-autoregressive Decoding","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:03.646259Z"},"links":{"citing_paper":"/paper/2505.24820"},"observation_digest":"sha256:de85ffb2e6208930fa97f2263bcecc3879ef0fa018a2b10ede243735f84c6e66","observation_id":"cdf56a29-64bf-4c38-9954-4a91d4efdc48","resolution":{"observed_at":"2026-08-07T12:19:05.040391Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:04.750723Z","title":"Deep-FSMN for large vocabulary continuous speech recognition,","venue":null,"work_id":"4e307166-1b15-4f11-95a5-240a9dfc6667","year":2018},"citing_paper":{"arxiv_id":"2505.24820","last_updated":"2025-05-30T17:22:39Z","snapshot_observed_at":"2026-08-07T12:10:46.492997Z","submitted_at":"2025-05-30T17:22:39Z","title":"Masked Self-distilled Transducer-based Keyword Spotting with Semi-autoregressive Decoding","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:03.741120Z"},"links":{"citing_paper":"/paper/2505.24820"},"observation_digest":"sha256:088d3f65703b094dd6188f02a301418e9ce1148631f07d98e37fbcd7674d22d7","observation_id":"3843eb05-36e4-4313-9353-b6e23fd01e7a","resolution":{"observed_at":"2026-08-07T12:19:04.830444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.09364","last_updated":"2020-06-24T00:57:25Z","snapshot_observed_at":"2026-07-06T07:16:33.611269Z","submitted_at":"2018-11-23T05:24:15Z","title":"Learning pronunciation from a foreign language in speech synthesis networks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.09364","snapshot_observed_at":"2026-08-07T12:19:03.795856Z","title":"Learning pronunciation from a foreign language in speech synthesis networks,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.24820","last_updated":"2025-05-30T17:22:39Z","snapshot_observed_at":"2026-08-07T12:10:46.492997Z","submitted_at":"2025-05-30T17:22:39Z","title":"Masked Self-distilled Transducer-based Keyword Spotting with Semi-autoregressive Decoding","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:03.795856Z"},"links":{"cited_paper":"/paper/1811.09364","citing_paper":"/paper/2505.24820"},"observation_digest":"sha256:3f73c506366833929fb95683494b0ec5acf3fd5851a3ddd672060fe21587f17d","observation_id":"5ec8b2d6-15be-4c00-a479-6c3fedea4a7d","resolution":{"observed_at":"2026-08-07T12:19:03.795856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:03.881735Z","title":"Adam: A method for stochastic optimiza- tion,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.24820","last_updated":"2025-05-30T17:22:39Z","snapshot_observed_at":"2026-08-07T12:10:46.492997Z","submitted_at":"2025-05-30T17:22:39Z","title":"Masked Self-distilled Transducer-based Keyword Spotting with Semi-autoregressive Decoding","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:03.881735Z"},"links":{"citing_paper":"/paper/2505.24820"},"observation_digest":"sha256:08f247d359bf51b8b3c44306c4b9c14a08bd0839f2a5837c2e2c8fcf14100631","observation_id":"0b49f958-28fc-4bec-9af8-3c9127c18d55","resolution":{"observed_at":"2026-08-07T12:19:03.881735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:04.575034Z","title":"Decoupled weight decay regularization,","venue":null,"work_id":"f53aaa81-4ba9-475d-95b0-edd2f6277f65","year":2019},"citing_paper":{"arxiv_id":"2505.24820","last_updated":"2025-05-30T17:22:39Z","snapshot_observed_at":"2026-08-07T12:10:46.492997Z","submitted_at":"2025-05-30T17:22:39Z","title":"Masked Self-distilled Transducer-based Keyword Spotting with Semi-autoregressive Decoding","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:03.988835Z"},"links":{"citing_paper":"/paper/2505.24820"},"observation_digest":"sha256:89299b6f9e11bba2d634cfae0a541bc403a6e685a5543ea834f68290dd6d313b","observation_id":"b692d8b1-6199-4619-a2b3-995820431b75","resolution":{"observed_at":"2026-08-07T12:19:04.653221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14321","last_updated":"2025-03-14T00:10:58Z","snapshot_observed_at":"2026-07-06T17:20:33.356092Z","submitted_at":"2024-01-25T17:19:01Z","title":"VALL-T: Decoder-Only Generative Transducer for Robust and Decoding-Controllable Text-to-Speech","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14321","snapshot_observed_at":"2026-08-07T12:19:01.968041Z","title":"Available: https://doi.org/10.48550/arXiv.2401.14321","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24820","last_updated":"2025-05-30T17:22:39Z","snapshot_observed_at":"2026-08-07T12:10:46.492997Z","submitted_at":"2025-05-30T17:22:39Z","title":"Masked Self-distilled Transducer-based Keyword Spotting with Semi-autoregressive Decoding","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:01.968041Z"},"links":{"cited_paper":"/paper/2401.14321","citing_paper":"/paper/2505.24820"},"observation_digest":"sha256:adbf7d5682b39d43050e2b489194c787210e4aeb0e05417c69d24fb799f630da","observation_id":"ba1f6b20-a679-4c40-94ab-177822983e7f","resolution":{"observed_at":"2026-08-07T12:19:01.968041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.24820","last_updated":"2025-05-30T17:22:39Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-07T12:10:46.492997Z","submitted_at":"2025-05-30T17:22:39Z","title":"Masked Self-distilled Transducer-based Keyword Spotting with Semi-autoregressive Decoding"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":10,"verified_exact":1,"verified_fuzzy":25},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 0 inbound Pith citation observations for arXiv:2505.24820."}