{"as_of":"2026-08-05T20:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5f45c9becc82fb7d7e9df4b45e61a6bf38600997b71f290f5ba0c15171aec06e","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":48,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":48,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":48,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":48,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T15:52:34.585187Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-07T20:34:09.733636Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2106.04624","last_updated":"2021-06-08T18:22:56Z","snapshot_observed_at":"2026-08-04T07:20:14.379561Z","submitted_at":"2021-06-08T18:22:56Z","title":"SpeechBrain: A General-Purpose Speech Toolkit","version":1},"cited_work":{"arxiv_id":"2106.04624","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.04624","snapshot_observed_at":"2026-07-07T20:34:09.733636Z","title":"SpeechBrain: A general- purpose speech toolkit","venue":"eess.AS","work_id":"21b4460f-26ae-410a-a409-f69a6b2005da","year":2021},"citing_paper":{"arxiv_id":"2406.14294","last_updated":"2026-04-21T15:27:17Z","snapshot_observed_at":"2026-07-30T17:14:02.349402Z","submitted_at":"2024-06-20T13:23:27Z","title":"DASB - Discrete Audio and Speech Benchmark","version":4},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-24T00:26:57.419537Z"},"links":{"cited_paper":"/paper/2106.04624","citing_paper":"/paper/2406.14294"},"observation_digest":"sha256:5e98180dc56a50b09bc74da9b073a81f848e226ab1c9930412175c67d6b8ed52","observation_id":"03ff4e08-5398-4fa5-8d4f-0ee3c7af1055","resolution":{"observed_at":"2026-05-24T00:28:39.555237Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04624","last_updated":"2021-06-08T18:22:56Z","snapshot_observed_at":"2026-08-04T07:20:14.379561Z","submitted_at":"2021-06-08T18:22:56Z","title":"SpeechBrain: A General-Purpose Speech Toolkit","version":1},"cited_work":{"arxiv_id":"2106.04624","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.04624","snapshot_observed_at":"2026-07-07T20:34:09.733636Z","title":"SpeechBrain: A general- purpose speech toolkit","venue":"eess.AS","work_id":"21b4460f-26ae-410a-a409-f69a6b2005da","year":2021},"citing_paper":{"arxiv_id":"2507.23511","last_updated":"2026-05-11T14:54:52Z","snapshot_observed_at":"2026-08-03T03:37:10.882228Z","submitted_at":"2025-07-31T12:47:43Z","title":"MECAT: A Multi-Experts Constructed Benchmark for Fine-Grained Audio Understanding Tasks","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-19T02:41:52.996457Z"},"links":{"cited_paper":"/paper/2106.04624","citing_paper":"/paper/2507.23511"},"observation_digest":"sha256:ed738d22acad500db3efefe7b6016b805962446456d8fb2fd7af86ffffb0fd40","observation_id":"ab84775f-5968-4bab-96fd-a80e98d4b669","resolution":{"observed_at":"2026-05-19T02:41:59.647937Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04624","last_updated":"2021-06-08T18:22:56Z","snapshot_observed_at":"2026-08-04T07:20:14.379561Z","submitted_at":"2021-06-08T18:22:56Z","title":"SpeechBrain: A General-Purpose Speech Toolkit","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.04624","snapshot_observed_at":"2026-08-05T14:33:21.048857Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.21193","last_updated":"2025-08-28T20:17:26Z","snapshot_observed_at":"2026-08-05T14:33:19.740537Z","submitted_at":"2025-08-28T20:17:26Z","title":"Benchmarking Large Pretrained Multilingual Models on Qu\\'ebec French Speech Recognition","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T14:33:21.048857Z"},"links":{"cited_paper":"/paper/2106.04624","citing_paper":"/paper/2508.21193"},"observation_digest":"sha256:931a8dcde6d879d3309f7419db38867aa98248111a22bf54a990376a1a707070","observation_id":"4b6c3108-644b-42f8-982b-fcde1c237a11","resolution":{"observed_at":"2026-08-05T14:33:21.048857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04624","last_updated":"2021-06-08T18:22:56Z","snapshot_observed_at":"2026-08-04T07:20:14.379561Z","submitted_at":"2021-06-08T18:22:56Z","title":"SpeechBrain: A General-Purpose Speech Toolkit","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.04624","snapshot_observed_at":"2026-08-05T13:26:17.225948Z","title":"Ravanelli, T","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.00675","last_updated":"2025-08-31T03:06:37Z","snapshot_observed_at":"2026-08-05T13:26:08.545798Z","submitted_at":"2025-08-31T03:06:37Z","title":"Speaker-Conditioned Phrase Break Prediction for Text-to-Speech with Phoneme-Level Pre-trained Language Model","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-05T13:26:17.225948Z"},"links":{"cited_paper":"/paper/2106.04624","citing_paper":"/paper/2509.00675"},"observation_digest":"sha256:8f6719e0a7044dff0342e823642618f89272e41936bb9843766e33a559aa0402","observation_id":"fa2b14c0-3adf-407a-8f9c-8fcc845c9604","resolution":{"observed_at":"2026-08-05T13:26:17.225948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04624","last_updated":"2021-06-08T18:22:56Z","snapshot_observed_at":"2026-08-04T07:20:14.379561Z","submitted_at":"2021-06-08T18:22:56Z","title":"SpeechBrain: A General-Purpose Speech Toolkit","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.04624","snapshot_observed_at":"2026-08-05T11:29:03.289501Z","title":"Ravanelli et al., SpeechBrain: A general-purpose speech toolkit, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.02771","last_updated":"2025-09-02T19:20:06Z","snapshot_observed_at":"2026-08-05T11:29:00.334912Z","submitted_at":"2025-09-02T19:20:06Z","title":"Analysis of Speaker Verification Performance Trade-offs with Neural Audio Codec Transmission","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T11:29:03.289501Z"},"links":{"cited_paper":"/paper/2106.04624","citing_paper":"/paper/2509.02771"},"observation_digest":"sha256:0360ef13e3722291fcbebefd72bc53c6295f11ce9b0a27247d2702e6c4595a32","observation_id":"8795520f-d940-4ae1-8b92-aa907a3fd6ca","resolution":{"observed_at":"2026-08-05T11:29:03.289501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04624","last_updated":"2021-06-08T18:22:56Z","snapshot_observed_at":"2026-08-04T07:20:14.379561Z","submitted_at":"2021-06-08T18:22:56Z","title":"SpeechBrain: A General-Purpose Speech Toolkit","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.04624","snapshot_observed_at":"2026-08-05T06:01:28.516189Z","title":"Speechbrain: A general-purpose speech toolkit,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.04667","last_updated":"2025-09-04T21:30:25Z","snapshot_observed_at":"2026-08-05T06:01:28.101527Z","submitted_at":"2025-09-04T21:30:25Z","title":"DarkStream: real-time speech anonymization with low latency","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T06:01:28.516189Z"},"links":{"cited_paper":"/paper/2106.04624","citing_paper":"/paper/2509.04667"},"observation_digest":"sha256:c88e1cf4dcb6b7ddfee218fe0352cf4bb8da6cabdb5c53d22c48ec2358747f89","observation_id":"7815c48d-833d-4958-98a9-37ff63980bb0","resolution":{"observed_at":"2026-08-05T06:01:28.516189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04624","last_updated":"2021-06-08T18:22:56Z","snapshot_observed_at":"2026-08-04T07:20:14.379561Z","submitted_at":"2021-06-08T18:22:56Z","title":"SpeechBrain: A General-Purpose Speech Toolkit","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.04624","snapshot_observed_at":"2026-08-04T19:36:44.191622Z","title":"Speechbrain: A general-purpose speech toolkit,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.09196","last_updated":"2025-09-11T07:11:46Z","snapshot_observed_at":"2026-08-04T19:36:43.290020Z","submitted_at":"2025-09-11T07:11:46Z","title":"Efficient Trie-based Biasing using K-step Prediction for Rare Word Recognition","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T19:36:44.191622Z"},"links":{"cited_paper":"/paper/2106.04624","citing_paper":"/paper/2509.09196"},"observation_digest":"sha256:9fd2f22ecc6f52e99f6d2ea4379a0d7e0d9f6e30d772b097232067603a01a8ac","observation_id":"8ba76ccf-b79e-42c4-a5ee-9e40c665cd94","resolution":{"observed_at":"2026-08-04T19:36:44.191622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04624","last_updated":"2021-06-08T18:22:56Z","snapshot_observed_at":"2026-08-04T07:20:14.379561Z","submitted_at":"2021-06-08T18:22:56Z","title":"SpeechBrain: A General-Purpose Speech Toolkit","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.04624","snapshot_observed_at":"2026-08-04T19:35:50.642548Z","title":"SpeechBrain: A general-purpose speech toolkit,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.09197","last_updated":"2025-09-11T07:12:17Z","snapshot_observed_at":"2026-08-04T19:35:50.266457Z","submitted_at":"2025-09-11T07:12:17Z","title":"Improving Synthetic Data Training for Contextual Biasing Models with a Keyword-Aware Cost Function","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T19:35:50.642548Z"},"links":{"cited_paper":"/paper/2106.04624","citing_paper":"/paper/2509.09197"},"observation_digest":"sha256:e9a9b7e106ce7869bead5db0fed25c9fcaf63885349e6e2af4880f42e54b024b","observation_id":"c449d607-5843-4983-9e02-a7dfbb3cc2d1","resolution":{"observed_at":"2026-08-04T19:35:50.642548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04624","last_updated":"2021-06-08T18:22:56Z","snapshot_observed_at":"2026-08-04T07:20:14.379561Z","submitted_at":"2021-06-08T18:22:56Z","title":"SpeechBrain: A General-Purpose Speech Toolkit","version":1},"cited_work":{"arxiv_id":"2106.04624","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.04624","snapshot_observed_at":"2026-07-07T20:34:09.733636Z","title":"SpeechBrain: A general- purpose speech toolkit","venue":"eess.AS","work_id":"21b4460f-26ae-410a-a409-f69a6b2005da","year":2021},"citing_paper":{"arxiv_id":"2510.10785","last_updated":"2026-01-24T16:41:09Z","snapshot_observed_at":"2026-07-06T22:32:27.698678Z","submitted_at":"2025-10-12T20:02:14Z","title":"FAC-FACodec: Controllable Zero-Shot Foreign Accent Conversion with Factorized Speech Codec","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-18T07:56:46.302918Z"},"links":{"cited_paper":"/paper/2106.04624","citing_paper":"/paper/2510.10785"},"observation_digest":"sha256:8d0c23949c43791331225d105926c426d177bde93eaf372d2199800f3eddf319","observation_id":"1bdf1c66-9918-442e-9e88-34e8c11aa282","resolution":{"observed_at":"2026-05-18T08:01:06.813118Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04624","last_updated":"2021-06-08T18:22:56Z","snapshot_observed_at":"2026-08-04T07:20:14.379561Z","submitted_at":"2021-06-08T18:22:56Z","title":"SpeechBrain: A General-Purpose Speech Toolkit","version":1},"cited_work":{"arxiv_id":"2106.04624","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.04624","snapshot_observed_at":"2026-07-07T20:34:09.733636Z","title":"SpeechBrain: A general- purpose speech toolkit","venue":"eess.AS","work_id":"21b4460f-26ae-410a-a409-f69a6b2005da","year":2021},"citing_paper":{"arxiv_id":"2601.20896","last_updated":"2026-04-23T07:03:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-28T08:56:11Z","title":"A Study of Data Selection Strategies for Pre-training Self-Supervised Speech Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-16T10:17:15.726726Z"},"links":{"cited_paper":"/paper/2106.04624","citing_paper":"/paper/2601.20896"},"observation_digest":"sha256:a580e8d0945e0564769daae2ec4731b864a1550f86fafd7a2a18f2794d200dfa","observation_id":"efe285bf-bfab-4787-a307-57fb14c1594f","resolution":{"observed_at":"2026-05-16T10:17:43.810929Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04624","last_updated":"2021-06-08T18:22:56Z","snapshot_observed_at":"2026-08-04T07:20:14.379561Z","submitted_at":"2021-06-08T18:22:56Z","title":"SpeechBrain: A General-Purpose Speech Toolkit","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.04624","snapshot_observed_at":"2026-08-02T17:37:37.865879Z","title":"Speechbrain: A general-purpose speech toolkit,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.22590","last_updated":"2026-07-20T14:14:56Z","snapshot_observed_at":"2026-08-04T07:21:47.478600Z","submitted_at":"2026-03-23T21:29:33Z","title":"Precision-Varying Prediction (PVP): Robustifying ASR systems against adversarial attacks","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T17:37:37.865879Z"},"links":{"cited_paper":"/paper/2106.04624","citing_paper":"/paper/2603.22590"},"observation_digest":"sha256:33e38725b00de5901e695ece00596eeba07aefafa7c33b15312db2f87830ff61","observation_id":"d4d3ea68-d443-4092-9532-321246a79cd2","resolution":{"observed_at":"2026-08-02T17:37:37.865879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04624","last_updated":"2021-06-08T18:22:56Z","snapshot_observed_at":"2026-08-04T07:20:14.379561Z","submitted_at":"2021-06-08T18:22:56Z","title":"SpeechBrain: A General-Purpose Speech Toolkit","version":1},"cited_work":{"arxiv_id":"2106.04624","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.04624","snapshot_observed_at":"2026-07-07T20:34:09.733636Z","title":"SpeechBrain: A general- purpose speech toolkit","venue":"eess.AS","work_id":"21b4460f-26ae-410a-a409-f69a6b2005da","year":2021},"citing_paper":{"arxiv_id":"2604.08450","last_updated":"2026-04-09T16:47:18Z","snapshot_observed_at":"2026-08-03T01:01:06.335848Z","submitted_at":"2026-04-09T16:47:18Z","title":"DeepFense: A Unified, Modular, and Extensible Framework for Robust Deepfake Audio Detection","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T17:00:05.187070Z"},"links":{"cited_paper":"/paper/2106.04624","citing_paper":"/paper/2604.08450"},"observation_digest":"sha256:95363d74018ce54cc66a1fb52e019a5f63048c4764acf756b3413941ff65b58d","observation_id":"398b8ad4-9035-4187-9ac8-b4c826dd6fc3","resolution":{"observed_at":"2026-05-11T07:45:57.571202Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04624","last_updated":"2021-06-08T18:22:56Z","snapshot_observed_at":"2026-08-04T07:20:14.379561Z","submitted_at":"2021-06-08T18:22:56Z","title":"SpeechBrain: A General-Purpose Speech Toolkit","version":1},"cited_work":{"arxiv_id":"2106.04624","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.04624","snapshot_observed_at":"2026-07-07T20:34:09.733636Z","title":"SpeechBrain: A general- purpose speech toolkit","venue":"eess.AS","work_id":"21b4460f-26ae-410a-a409-f69a6b2005da","year":2021},"citing_paper":{"arxiv_id":"2604.12398","last_updated":"2026-04-14T07:33:44Z","snapshot_observed_at":"2026-07-06T23:00:37.144068Z","submitted_at":"2026-04-14T07:33:44Z","title":"Contextual Biasing for ASR in Speech LLM with Common Word Cues and Bias Word Position Prediction","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-10T14:35:20.515352Z"},"links":{"cited_paper":"/paper/2106.04624","citing_paper":"/paper/2604.12398"},"observation_digest":"sha256:bb8fcac1f8f8268102c6cf4a50c26a61221cceb0d8921edf606a60c24b5515bb","observation_id":"a2f19927-ea26-4e36-a4bc-0ddffeaa8bfe","resolution":{"observed_at":"2026-05-10T14:35:33.967335Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04624","last_updated":"2021-06-08T18:22:56Z","snapshot_observed_at":"2026-08-04T07:20:14.379561Z","submitted_at":"2021-06-08T18:22:56Z","title":"SpeechBrain: A General-Purpose Speech Toolkit","version":1},"cited_work":{"arxiv_id":"2106.04624","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.04624","snapshot_observed_at":"2026-07-07T20:34:09.733636Z","title":"SpeechBrain: A general- purpose speech toolkit","venue":"eess.AS","work_id":"21b4460f-26ae-410a-a409-f69a6b2005da","year":2021},"citing_paper":{"arxiv_id":"2604.13335","last_updated":"2026-04-14T22:55:09Z","snapshot_observed_at":"2026-08-02T22:03:14.565588Z","submitted_at":"2026-04-14T22:55:09Z","title":"SEDTalker: Emotion-Aware 3D Facial Animation Using Frame-Level Speech Emotion Diarization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T14:59:44.064137Z"},"links":{"cited_paper":"/paper/2106.04624","citing_paper":"/paper/2604.13335"},"observation_digest":"sha256:24ba5f17f7cd804cafadd453a84a9a2069ce3f1a29f966df67145e720bb5d433","observation_id":"f7a336ad-8814-4316-b4a5-d50dc6e9a686","resolution":{"observed_at":"2026-05-11T11:21:04.487867Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04624","last_updated":"2021-06-08T18:22:56Z","snapshot_observed_at":"2026-08-04T07:20:14.379561Z","submitted_at":"2021-06-08T18:22:56Z","title":"SpeechBrain: A General-Purpose Speech Toolkit","version":1},"cited_work":{"arxiv_id":"2106.04624","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.04624","snapshot_observed_at":"2026-07-07T20:34:09.733636Z","title":"SpeechBrain: A general- purpose speech toolkit","venue":"eess.AS","work_id":"21b4460f-26ae-410a-a409-f69a6b2005da","year":2021},"citing_paper":{"arxiv_id":"2604.15923","last_updated":"2026-04-17T10:28:21Z","snapshot_observed_at":"2026-07-06T23:03:21.422544Z","submitted_at":"2026-04-17T10:28:21Z","title":"Hierarchical Codec Diffusion for Video-to-Speech Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-10T08:12:01.260833Z"},"links":{"cited_paper":"/paper/2106.04624","citing_paper":"/paper/2604.15923"},"observation_digest":"sha256:158400b672d845bbcd801980c851ca84ba399c494eec650047c3aa998cca4ac8","observation_id":"2210251c-a48b-4864-8bbb-3f5aa96affb6","resolution":{"observed_at":"2026-05-10T08:12:26.275104Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04624","last_updated":"2021-06-08T18:22:56Z","snapshot_observed_at":"2026-08-04T07:20:14.379561Z","submitted_at":"2021-06-08T18:22:56Z","title":"SpeechBrain: A General-Purpose Speech Toolkit","version":1},"cited_work":{"arxiv_id":"2106.04624","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.04624","snapshot_observed_at":"2026-07-07T20:34:09.733636Z","title":"SpeechBrain: A general- purpose speech toolkit","venue":"eess.AS","work_id":"21b4460f-26ae-410a-a409-f69a6b2005da","year":2021},"citing_paper":{"arxiv_id":"2604.19028","last_updated":"2026-04-21T03:23:34Z","snapshot_observed_at":"2026-07-06T23:05:44.499005Z","submitted_at":"2026-04-21T03:23:34Z","title":"Learning Posterior Predictive Distributions for Node Classification from Synthetic Graph Priors","version":1},"reference_index":224,"source":"arxiv_source","source_observed_at":"2026-05-10T03:50:44.626261Z"},"links":{"cited_paper":"/paper/2106.04624","citing_paper":"/paper/2604.19028"},"observation_digest":"sha256:9b5c260c5d77cbfb527e7fdc336b4fad63ca9f33ddb20c5c4d8ce3ba9fbd9209","observation_id":"a20f70c0-7572-414a-8a3b-02936d9d4387","resolution":{"observed_at":"2026-05-11T12:21:04.729303Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04624","last_updated":"2021-06-08T18:22:56Z","snapshot_observed_at":"2026-08-04T07:20:14.379561Z","submitted_at":"2021-06-08T18:22:56Z","title":"SpeechBrain: A General-Purpose Speech Toolkit","version":1},"cited_work":{"arxiv_id":"2106.04624","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.04624","snapshot_observed_at":"2026-07-07T20:34:09.733636Z","title":"SpeechBrain: A general- purpose speech toolkit","venue":"eess.AS","work_id":"21b4460f-26ae-410a-a409-f69a6b2005da","year":2021},"citing_paper":{"arxiv_id":"2604.19151","last_updated":"2026-07-03T06:33:53Z","snapshot_observed_at":"2026-07-12T18:55:04.007927Z","submitted_at":"2026-04-21T07:02:01Z","title":"Voice of India: A Large-Scale Benchmark for Real-World Speech Recognition in India","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-10T02:36:06.825753Z"},"links":{"cited_paper":"/paper/2106.04624","citing_paper":"/paper/2604.19151"},"observation_digest":"sha256:fbeca5f1a64acb4cbffbd6143a9591a2fbede0a47d1e4070f51a2c7de0691339","observation_id":"356dd397-1fc8-48cd-93e2-f80740ceef87","resolution":{"observed_at":"2026-05-11T12:56:05.596946Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04624","last_updated":"2021-06-08T18:22:56Z","snapshot_observed_at":"2026-08-04T07:20:14.379561Z","submitted_at":"2021-06-08T18:22:56Z","title":"SpeechBrain: A General-Purpose Speech Toolkit","version":1},"cited_work":{"arxiv_id":"2106.04624","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.04624","snapshot_observed_at":"2026-07-07T20:34:09.733636Z","title":"SpeechBrain: A general- purpose speech toolkit","venue":"eess.AS","work_id":"21b4460f-26ae-410a-a409-f69a6b2005da","year":2021},"citing_paper":{"arxiv_id":"2604.19330","last_updated":"2026-04-29T12:12:36Z","snapshot_observed_at":"2026-08-03T01:33:20.785741Z","submitted_at":"2026-04-21T10:58:48Z","title":"Text-To-Speech with Chain-of-Details: modeling temporal dynamics in speech generation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-10T01:01:06.094276Z"},"links":{"cited_paper":"/paper/2106.04624","citing_paper":"/paper/2604.19330"},"observation_digest":"sha256:89b4a6ed4e0e648c98c6532791a81f74fbc35c0b91cbc1bf3af1409c199c9c75","observation_id":"9682e527-aec6-4734-a843-d164e549f27b","resolution":{"observed_at":"2026-05-10T01:04:50.145569Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04624","last_updated":"2021-06-08T18:22:56Z","snapshot_observed_at":"2026-08-04T07:20:14.379561Z","submitted_at":"2021-06-08T18:22:56Z","title":"SpeechBrain: A General-Purpose Speech Toolkit","version":1},"cited_work":{"arxiv_id":"2106.04624","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.04624","snapshot_observed_at":"2026-07-07T20:34:09.733636Z","title":"SpeechBrain: A general- purpose speech toolkit","venue":"eess.AS","work_id":"21b4460f-26ae-410a-a409-f69a6b2005da","year":2021},"citing_paper":{"arxiv_id":"2604.20229","last_updated":"2026-05-06T22:20:00Z","snapshot_observed_at":"2026-07-06T23:06:44.624357Z","submitted_at":"2026-04-22T06:23:40Z","title":"Enhancing Speaker Verification with Whispered Speech via Post-Processing","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-09T23:28:05.344284Z"},"links":{"cited_paper":"/paper/2106.04624","citing_paper":"/paper/2604.20229"},"observation_digest":"sha256:d11ea7a72fc0884177f9d272af1a7b434685cdba026cfcb6007baf938cad5e66","observation_id":"19ea0026-1b6e-4764-916d-f7c5a07eac0a","resolution":{"observed_at":"2026-05-09T23:29:43.958668Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04624","last_updated":"2021-06-08T18:22:56Z","snapshot_observed_at":"2026-08-04T07:20:14.379561Z","submitted_at":"2021-06-08T18:22:56Z","title":"SpeechBrain: A General-Purpose Speech Toolkit","version":1},"cited_work":{"arxiv_id":"2106.04624","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.04624","snapshot_observed_at":"2026-07-07T20:34:09.733636Z","title":"SpeechBrain: A general- purpose speech toolkit","venue":"eess.AS","work_id":"21b4460f-26ae-410a-a409-f69a6b2005da","year":2021},"citing_paper":{"arxiv_id":"2604.26676","last_updated":"2026-04-29T13:47:22Z","snapshot_observed_at":"2026-07-06T23:12:15.279847Z","submitted_at":"2026-04-29T13:47:22Z","title":"A Toolkit for Detecting Spurious Correlations in Speech Datasets","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-07T12:04:36.906876Z"},"links":{"cited_paper":"/paper/2106.04624","citing_paper":"/paper/2604.26676"},"observation_digest":"sha256:6e56ba1e71bb3d97cb92621618a04c95526545dee2ad41f322489e0a204c579d","observation_id":"ae3991df-2278-4d19-9f79-fa697650c224","resolution":{"observed_at":"2026-05-12T09:11:27.405133Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04624","last_updated":"2021-06-08T18:22:56Z","snapshot_observed_at":"2026-08-04T07:20:14.379561Z","submitted_at":"2021-06-08T18:22:56Z","title":"SpeechBrain: A General-Purpose Speech Toolkit","version":1},"cited_work":{"arxiv_id":"2106.04624","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.04624","snapshot_observed_at":"2026-07-07T20:34:09.733636Z","title":"SpeechBrain: A general- purpose speech toolkit","venue":"eess.AS","work_id":"21b4460f-26ae-410a-a409-f69a6b2005da","year":2021},"citing_paper":{"arxiv_id":"2604.27542","last_updated":"2026-05-05T13:10:11Z","snapshot_observed_at":"2026-07-06T23:13:02.921765Z","submitted_at":"2026-04-30T07:48:20Z","title":"HATS: An Open data set Integrating Human Perception Applied to the Evaluation of Automatic Speech Recognition Metrics","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-07T09:19:31.900807Z"},"links":{"cited_paper":"/paper/2106.04624","citing_paper":"/paper/2604.27542"},"observation_digest":"sha256:eb3aa216c66d044d7f5565b2fb733ed313f48b371508fa98a61fd59679ea74c2","observation_id":"f62378f7-5d2d-48fe-8df3-4a476d1e214d","resolution":{"observed_at":"2026-05-12T09:46:27.031807Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04624","last_updated":"2021-06-08T18:22:56Z","snapshot_observed_at":"2026-08-04T07:20:14.379561Z","submitted_at":"2021-06-08T18:22:56Z","title":"SpeechBrain: A General-Purpose Speech Toolkit","version":1},"cited_work":{"arxiv_id":"2106.04624","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.04624","snapshot_observed_at":"2026-07-07T20:34:09.733636Z","title":"SpeechBrain: A general- purpose speech toolkit","venue":"eess.AS","work_id":"21b4460f-26ae-410a-a409-f69a6b2005da","year":2021},"citing_paper":{"arxiv_id":"2605.03671","last_updated":"2026-05-05T12:09:12Z","snapshot_observed_at":"2026-07-06T23:16:34.988490Z","submitted_at":"2026-05-05T12:09:12Z","title":"A Paradigm for Interpreting Metrics and Identifying Critical Errors in Automatic Speech Recognition","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-07T16:39:02.065010Z"},"links":{"cited_paper":"/paper/2106.04624","citing_paper":"/paper/2605.03671"},"observation_digest":"sha256:539d7bbda9dbc4bbac94006afa8e6d17424589dc9c2ac2c2b27efb3382208af3","observation_id":"337f6e71-ec55-4aa5-877a-c2bace00e8b2","resolution":{"observed_at":"2026-05-11T23:36:31.492928Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04624","last_updated":"2021-06-08T18:22:56Z","snapshot_observed_at":"2026-08-04T07:20:14.379561Z","submitted_at":"2021-06-08T18:22:56Z","title":"SpeechBrain: A General-Purpose Speech Toolkit","version":1},"cited_work":{"arxiv_id":"2106.04624","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.04624","snapshot_observed_at":"2026-07-07T20:34:09.733636Z","title":"SpeechBrain: A general- purpose speech toolkit","venue":"eess.AS","work_id":"21b4460f-26ae-410a-a409-f69a6b2005da","year":2021},"citing_paper":{"arxiv_id":"2605.07291","last_updated":"2026-05-08T06:01:28Z","snapshot_observed_at":"2026-07-06T23:19:41.053744Z","submitted_at":"2026-05-08T06:01:28Z","title":"Evaluating voice anonymisation using similarity rank disclosure","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-11T00:55:20.324372Z"},"links":{"cited_paper":"/paper/2106.04624","citing_paper":"/paper/2605.07291"},"observation_digest":"sha256:87a35e03b7f52c9d0f66782c9075cf327818edda287966b124760fe6eab77503","observation_id":"702ef76d-b5a0-4a21-9237-3a00d4fd7144","resolution":{"observed_at":"2026-05-11T05:00:55.849557Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04624","last_updated":"2021-06-08T18:22:56Z","snapshot_observed_at":"2026-08-04T07:20:14.379561Z","submitted_at":"2021-06-08T18:22:56Z","title":"SpeechBrain: A General-Purpose Speech Toolkit","version":1},"cited_work":{"arxiv_id":"2106.04624","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.04624","snapshot_observed_at":"2026-07-07T20:34:09.733636Z","title":"SpeechBrain: A general- purpose speech toolkit","venue":"eess.AS","work_id":"21b4460f-26ae-410a-a409-f69a6b2005da","year":2021},"citing_paper":{"arxiv_id":"2605.20299","last_updated":"2026-05-19T12:34:16Z","snapshot_observed_at":"2026-07-06T23:30:53.900592Z","submitted_at":"2026-05-19T12:34:16Z","title":"Mechanisms of Misgeneralization in Physical Sequence Modeling","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-05-21T07:44:37.810511Z"},"links":{"cited_paper":"/paper/2106.04624","citing_paper":"/paper/2605.20299"},"observation_digest":"sha256:95ab02cc536de574ae5062b8ba918410884516f68e5e1ff3704128405f550a0d","observation_id":"88532c32-d578-47f6-80fb-34aa42460307","resolution":{"observed_at":"2026-05-21T07:44:48.708253Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04624","last_updated":"2021-06-08T18:22:56Z","snapshot_observed_at":"2026-08-04T07:20:14.379561Z","submitted_at":"2021-06-08T18:22:56Z","title":"SpeechBrain: A General-Purpose Speech Toolkit","version":1},"cited_work":{"arxiv_id":"2106.04624","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.04624","snapshot_observed_at":"2026-07-07T20:34:09.733636Z","title":"SpeechBrain: A general- purpose speech toolkit","venue":"eess.AS","work_id":"21b4460f-26ae-410a-a409-f69a6b2005da","year":2021},"citing_paper":{"arxiv_id":"2605.24451","last_updated":"2026-05-23T08:00:26Z","snapshot_observed_at":"2026-08-04T07:21:49.116673Z","submitted_at":"2026-05-23T08:00:26Z","title":"Phonetic Modeling of Dialectal Variation in Vietnamese Speech","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-30T13:29:59.049839Z"},"links":{"cited_paper":"/paper/2106.04624","citing_paper":"/paper/2605.24451"},"observation_digest":"sha256:8fb618a96512a414b6f7bcac8ab5545150caa0bc3c897e1ecc933729da8bade6","observation_id":"b20d2510-fb91-4fed-84da-c5a819cf4ae3","resolution":{"observed_at":"2026-06-30T13:34:40.334031Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04624","last_updated":"2021-06-08T18:22:56Z","snapshot_observed_at":"2026-08-04T07:20:14.379561Z","submitted_at":"2021-06-08T18:22:56Z","title":"SpeechBrain: A General-Purpose Speech Toolkit","version":1},"cited_work":{"arxiv_id":"2106.04624","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.04624","snapshot_observed_at":"2026-07-07T20:34:09.733636Z","title":"SpeechBrain: A general- purpose speech toolkit","venue":"eess.AS","work_id":"21b4460f-26ae-410a-a409-f69a6b2005da","year":2021},"citing_paper":{"arxiv_id":"2605.26978","last_updated":"2026-05-26T13:03:20Z","snapshot_observed_at":"2026-07-06T23:36:43.912215Z","submitted_at":"2026-05-26T13:03:20Z","title":"PashtoTTS-Bench: automated screening for low-resource non-Latin-script text-to-speech","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-29T18:44:12.111291Z"},"links":{"cited_paper":"/paper/2106.04624","citing_paper":"/paper/2605.26978"},"observation_digest":"sha256:8aa6d5fdd8432f110a4c48e7ae243e421ddd979ac79c5e181d07cee3d8178cc5","observation_id":"6b9e549b-3f59-4f58-a5b8-cf140b364a33","resolution":{"observed_at":"2026-06-29T18:53:51.906976Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04624","last_updated":"2021-06-08T18:22:56Z","snapshot_observed_at":"2026-08-04T07:20:14.379561Z","submitted_at":"2021-06-08T18:22:56Z","title":"SpeechBrain: A General-Purpose Speech Toolkit","version":1},"cited_work":{"arxiv_id":"2106.04624","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.04624","snapshot_observed_at":"2026-07-07T20:34:09.733636Z","title":"SpeechBrain: A general- purpose speech toolkit","venue":"eess.AS","work_id":"21b4460f-26ae-410a-a409-f69a6b2005da","year":2021},"citing_paper":{"arxiv_id":"2605.27874","last_updated":"2026-05-27T02:51:09Z","snapshot_observed_at":"2026-08-01T13:45:03.918790Z","submitted_at":"2026-05-27T02:51:09Z","title":"Syllabic-Structure Decoder for Automatic Speech Recognition in Vietnamese","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-29T13:24:28.184435Z"},"links":{"cited_paper":"/paper/2106.04624","citing_paper":"/paper/2605.27874"},"observation_digest":"sha256:590c2bc4a25a68f229981ae2afe12abf2d03841bda3bb9ee9bed67b77e5c016d","observation_id":"d4e9fddf-723c-4e89-b04a-2551a4a4a1dd","resolution":{"observed_at":"2026-06-29T13:33:28.505625Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04624","last_updated":"2021-06-08T18:22:56Z","snapshot_observed_at":"2026-08-04T07:20:14.379561Z","submitted_at":"2021-06-08T18:22:56Z","title":"SpeechBrain: A General-Purpose Speech Toolkit","version":1},"cited_work":{"arxiv_id":"2106.04624","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.04624","snapshot_observed_at":"2026-07-07T20:34:09.733636Z","title":"SpeechBrain: A general- purpose speech toolkit","venue":"eess.AS","work_id":"21b4460f-26ae-410a-a409-f69a6b2005da","year":2021},"citing_paper":{"arxiv_id":"2606.01135","last_updated":"2026-05-31T10:15:08Z","snapshot_observed_at":"2026-07-06T23:41:43.820102Z","submitted_at":"2026-05-31T10:15:08Z","title":"Spiking and Event-driven Neuromorphic Mamba Models for Efficient Speech Recognition","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-28T16:22:07.001549Z"},"links":{"cited_paper":"/paper/2106.04624","citing_paper":"/paper/2606.01135"},"observation_digest":"sha256:df74cf06d944f0154fac439f1e455ebb1f9a4ca83648f859682e06901535c5be","observation_id":"3d596dbb-32e0-41bb-b76d-1342e3e3cee9","resolution":{"observed_at":"2026-07-01T21:46:15.482506Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04624","last_updated":"2021-06-08T18:22:56Z","snapshot_observed_at":"2026-08-04T07:20:14.379561Z","submitted_at":"2021-06-08T18:22:56Z","title":"SpeechBrain: A General-Purpose Speech Toolkit","version":1},"cited_work":{"arxiv_id":"2106.04624","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.04624","snapshot_observed_at":"2026-07-07T20:34:09.733636Z","title":"SpeechBrain: A general- purpose speech toolkit","venue":"eess.AS","work_id":"21b4460f-26ae-410a-a409-f69a6b2005da","year":2021},"citing_paper":{"arxiv_id":"2606.07240","last_updated":"2026-06-05T13:09:21Z","snapshot_observed_at":"2026-08-05T07:23:40.814546Z","submitted_at":"2026-06-05T13:09:21Z","title":"KIT's Submission to Cross-Lingual Voice Cloning in IWSLT 2026","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-06-27T21:39:11.265338Z"},"links":{"cited_paper":"/paper/2106.04624","citing_paper":"/paper/2606.07240"},"observation_digest":"sha256:f2b0489ca2efefef4ad27bcb56031899df4f3a83059f1a41125cfbeb66d8e70d","observation_id":"d6bee9e5-98fd-412b-b6d1-96bf8548f102","resolution":{"observed_at":"2026-07-02T19:07:18.239939Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04624","last_updated":"2021-06-08T18:22:56Z","snapshot_observed_at":"2026-08-04T07:20:14.379561Z","submitted_at":"2021-06-08T18:22:56Z","title":"SpeechBrain: A General-Purpose Speech Toolkit","version":1},"cited_work":{"arxiv_id":"2106.04624","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.04624","snapshot_observed_at":"2026-07-07T20:34:09.733636Z","title":"SpeechBrain: A general- purpose speech toolkit","venue":"eess.AS","work_id":"21b4460f-26ae-410a-a409-f69a6b2005da","year":2021},"citing_paper":{"arxiv_id":"2606.17339","last_updated":"2026-06-15T22:38:36Z","snapshot_observed_at":"2026-07-06T23:52:57.359941Z","submitted_at":"2026-06-15T22:38:36Z","title":"SpeechDx: A Multi-Task Benchmark for Clinical Speech AI","version":1},"reference_index":115,"source":"pdf_text","source_observed_at":"2026-06-27T03:09:07.295810Z"},"links":{"cited_paper":"/paper/2106.04624","citing_paper":"/paper/2606.17339"},"observation_digest":"sha256:8333ad97c5ba53dfc02f469357c4c9733ea99cdfed560e98307f73bcb22fe701","observation_id":"e01fcc82-81d9-4ba4-82fc-1eff38a70c69","resolution":{"observed_at":"2026-07-03T18:28:48.484005Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04624","last_updated":"2021-06-08T18:22:56Z","snapshot_observed_at":"2026-08-04T07:20:14.379561Z","submitted_at":"2021-06-08T18:22:56Z","title":"SpeechBrain: A General-Purpose Speech Toolkit","version":1},"cited_work":{"arxiv_id":"2106.04624","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.04624","snapshot_observed_at":"2026-07-07T20:34:09.733636Z","title":"SpeechBrain: A general- purpose speech toolkit","venue":"eess.AS","work_id":"21b4460f-26ae-410a-a409-f69a6b2005da","year":2021},"citing_paper":{"arxiv_id":"2606.18466","last_updated":"2026-06-16T20:18:09Z","snapshot_observed_at":"2026-08-02T19:08:24.570321Z","submitted_at":"2026-06-16T20:18:09Z","title":"Montreal Forced Aligner and the state of speech-to-text alignment in 2026","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-27T00:27:25.550404Z"},"links":{"cited_paper":"/paper/2106.04624","citing_paper":"/paper/2606.18466"},"observation_digest":"sha256:1556d03949b55cedbabdfc4e7df7f6011cb10f5b8329c4e0208bc7448dfd8d64","observation_id":"8f53b2f8-a5e8-44c8-b12a-dd8716ec0836","resolution":{"observed_at":"2026-07-03T21:28:59.352659Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04624","last_updated":"2021-06-08T18:22:56Z","snapshot_observed_at":"2026-08-04T07:20:14.379561Z","submitted_at":"2021-06-08T18:22:56Z","title":"SpeechBrain: A General-Purpose Speech Toolkit","version":1},"cited_work":{"arxiv_id":"2106.04624","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.04624","snapshot_observed_at":"2026-07-07T20:34:09.733636Z","title":"SpeechBrain: A general- purpose speech toolkit","venue":"eess.AS","work_id":"21b4460f-26ae-410a-a409-f69a6b2005da","year":2021},"citing_paper":{"arxiv_id":"2606.20680","last_updated":"2026-06-13T15:28:54Z","snapshot_observed_at":"2026-08-04T07:26:18.657571Z","submitted_at":"2026-06-13T15:28:54Z","title":"Beyond ROC-AUC: Operating-Point Performance Reporting for Biometric Verification","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-27T04:08:21.510476Z"},"links":{"cited_paper":"/paper/2106.04624","citing_paper":"/paper/2606.20680"},"observation_digest":"sha256:7d7f6b3688c0242cd32ea553e2be33a75103df96db1fbf3dbaa40b053c726905","observation_id":"141b9598-06ad-49f2-af8d-e8f0ba02889d","resolution":{"observed_at":"2026-07-03T17:28:44.523417Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04624","last_updated":"2021-06-08T18:22:56Z","snapshot_observed_at":"2026-08-04T07:20:14.379561Z","submitted_at":"2021-06-08T18:22:56Z","title":"SpeechBrain: A General-Purpose Speech Toolkit","version":1},"cited_work":{"arxiv_id":"2106.04624","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.04624","snapshot_observed_at":"2026-07-07T20:34:09.733636Z","title":"SpeechBrain: A general- purpose speech toolkit","venue":"eess.AS","work_id":"21b4460f-26ae-410a-a409-f69a6b2005da","year":2021},"citing_paper":{"arxiv_id":"2606.21305","last_updated":"2026-06-19T10:37:09Z","snapshot_observed_at":"2026-08-02T18:56:30.058323Z","submitted_at":"2026-06-19T10:37:09Z","title":"LISE : Listenable Interpretable Speaker Embeddings","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-26T13:10:03.421453Z"},"links":{"cited_paper":"/paper/2106.04624","citing_paper":"/paper/2606.21305"},"observation_digest":"sha256:93161f44bffbb01374cac230c7c487f71d1d34771dbdf310bc6b57622b784832","observation_id":"546f19b6-79d6-4f92-92af-af6e65361b18","resolution":{"observed_at":"2026-07-04T07:39:39.082204Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04624","last_updated":"2021-06-08T18:22:56Z","snapshot_observed_at":"2026-08-04T07:20:14.379561Z","submitted_at":"2021-06-08T18:22:56Z","title":"SpeechBrain: A General-Purpose Speech Toolkit","version":1},"cited_work":{"arxiv_id":"2106.04624","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.04624","snapshot_observed_at":"2026-07-07T20:34:09.733636Z","title":"SpeechBrain: A general- purpose speech toolkit","venue":"eess.AS","work_id":"21b4460f-26ae-410a-a409-f69a6b2005da","year":2021},"citing_paper":{"arxiv_id":"2606.21854","last_updated":"2026-06-20T03:21:57Z","snapshot_observed_at":"2026-08-02T18:16:50.732892Z","submitted_at":"2026-06-20T03:21:57Z","title":"ESPnet3: Infrastructure for Scalable Speech and Audio Research in the Foundation Model Era","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-26T11:54:08.457573Z"},"links":{"cited_paper":"/paper/2106.04624","citing_paper":"/paper/2606.21854"},"observation_digest":"sha256:57b556543b9c792bf9a857ab4b3e13387036240cacd967fd80dcec7d1a9f7880","observation_id":"f657bdcd-718b-4de8-8622-20664f22c5e1","resolution":{"observed_at":"2026-07-04T08:19:44.211104Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04624","last_updated":"2021-06-08T18:22:56Z","snapshot_observed_at":"2026-08-04T07:20:14.379561Z","submitted_at":"2021-06-08T18:22:56Z","title":"SpeechBrain: A General-Purpose Speech Toolkit","version":1},"cited_work":{"arxiv_id":"2106.04624","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.04624","snapshot_observed_at":"2026-07-07T20:34:09.733636Z","title":"SpeechBrain: A general- purpose speech toolkit","venue":"eess.AS","work_id":"21b4460f-26ae-410a-a409-f69a6b2005da","year":2021},"citing_paper":{"arxiv_id":"2606.31112","last_updated":"2026-06-30T04:15:39Z","snapshot_observed_at":"2026-07-07T00:04:53.774826Z","submitted_at":"2026-06-30T04:15:39Z","title":"What Counts as an Error? Dual-Reference Benchmarking for Atypical ASR","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-01T05:52:30.228009Z"},"links":{"cited_paper":"/paper/2106.04624","citing_paper":"/paper/2606.31112"},"observation_digest":"sha256:9974cc5134286968581a7b9f267049adfe2b80c6c5d5c63a98dacc142926c93d","observation_id":"15644453-f388-4335-a515-62b9e3980227","resolution":{"observed_at":"2026-07-01T10:05:41.138932Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04624","last_updated":"2021-06-08T18:22:56Z","snapshot_observed_at":"2026-08-04T07:20:14.379561Z","submitted_at":"2021-06-08T18:22:56Z","title":"SpeechBrain: A General-Purpose Speech Toolkit","version":1},"cited_work":{"arxiv_id":"2106.04624","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.04624","snapshot_observed_at":"2026-07-07T20:34:09.733636Z","title":"SpeechBrain: A general- purpose speech toolkit","venue":"eess.AS","work_id":"21b4460f-26ae-410a-a409-f69a6b2005da","year":2021},"citing_paper":{"arxiv_id":"2606.31947","last_updated":"2026-07-02T16:10:55Z","snapshot_observed_at":"2026-08-02T06:13:08.396324Z","submitted_at":"2026-06-30T16:53:15Z","title":"LuxEmo: Expressive Text-to-Speech Corpus for Luxembourgish","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-01T05:38:16.224617Z"},"links":{"cited_paper":"/paper/2106.04624","citing_paper":"/paper/2606.31947"},"observation_digest":"sha256:47bda76205d150d9d3351e3bd6c2e96924342aefea87c8d88a09bb7ca2e58676","observation_id":"5beeb03a-ed44-42de-afd5-42e41bcd8edc","resolution":{"observed_at":"2026-07-01T10:15:45.051640Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04624","last_updated":"2021-06-08T18:22:56Z","snapshot_observed_at":"2026-08-04T07:20:14.379561Z","submitted_at":"2021-06-08T18:22:56Z","title":"SpeechBrain: A General-Purpose Speech Toolkit","version":1},"cited_work":{"arxiv_id":"2106.04624","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.04624","snapshot_observed_at":"2026-07-07T20:34:09.733636Z","title":"SpeechBrain: A general- purpose speech toolkit","venue":"eess.AS","work_id":"21b4460f-26ae-410a-a409-f69a6b2005da","year":2021},"citing_paper":{"arxiv_id":"2606.31947","last_updated":"2026-07-02T16:10:55Z","snapshot_observed_at":"2026-08-02T06:13:08.396324Z","submitted_at":"2026-06-30T16:53:15Z","title":"LuxEmo: Expressive Text-to-Speech Corpus for Luxembourgish","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-03T21:56:41.303269Z"},"links":{"cited_paper":"/paper/2106.04624","citing_paper":"/paper/2606.31947"},"observation_digest":"sha256:587925c19dec983a8876dc7553c3fe089e334383d6195e3f0148784190fe30c5","observation_id":"015a7276-ef5e-4851-a4d3-0633fc1ed2f8","resolution":{"observed_at":"2026-07-03T21:58:58.322839Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04624","last_updated":"2021-06-08T18:22:56Z","snapshot_observed_at":"2026-08-04T07:20:14.379561Z","submitted_at":"2021-06-08T18:22:56Z","title":"SpeechBrain: A General-Purpose Speech Toolkit","version":1},"cited_work":{"arxiv_id":"2106.04624","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.04624","snapshot_observed_at":"2026-07-07T20:34:09.733636Z","title":"SpeechBrain: A general- purpose speech toolkit","venue":"eess.AS","work_id":"21b4460f-26ae-410a-a409-f69a6b2005da","year":2021},"citing_paper":{"arxiv_id":"2607.01502","last_updated":"2026-07-01T22:01:29Z","snapshot_observed_at":"2026-07-07T00:07:04.211507Z","submitted_at":"2026-07-01T22:01:29Z","title":"From Monolingual to Multilingual: Evaluating Mamba for ASR in South African Languages","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-03T20:54:42.216660Z"},"links":{"cited_paper":"/paper/2106.04624","citing_paper":"/paper/2607.01502"},"observation_digest":"sha256:ee65203d898710ec27dd49c457c258387025ac4132a58d3c893cae90dc408a6d","observation_id":"448946c4-88cc-401e-9a9b-9e68b73e0e91","resolution":{"observed_at":"2026-07-03T20:58:57.286676Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04624","last_updated":"2021-06-08T18:22:56Z","snapshot_observed_at":"2026-08-04T07:20:14.379561Z","submitted_at":"2021-06-08T18:22:56Z","title":"SpeechBrain: A General-Purpose Speech Toolkit","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.04624","snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"arXiv preprint arXiv:2106.04624 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-08-03T04:23:48.650624Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"cited_paper":"/paper/2106.04624","citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:086a9d997245d428f7a23297c079314a9c5aa5ba2a4ac8406325d75863e370f6","observation_id":"f1a3da29-8750-4303-98f5-833a79ab54ee","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04624","last_updated":"2021-06-08T18:22:56Z","snapshot_observed_at":"2026-08-04T07:20:14.379561Z","submitted_at":"2021-06-08T18:22:56Z","title":"SpeechBrain: A General-Purpose Speech Toolkit","version":1},"cited_work":{"arxiv_id":"2106.04624","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.04624","snapshot_observed_at":"2026-07-07T20:34:09.733636Z","title":"SpeechBrain: A general- purpose speech toolkit","venue":"eess.AS","work_id":"21b4460f-26ae-410a-a409-f69a6b2005da","year":2021},"citing_paper":{"arxiv_id":"2607.05276","last_updated":"2026-07-06T16:21:34Z","snapshot_observed_at":"2026-08-02T01:15:17.727303Z","submitted_at":"2026-07-06T16:21:34Z","title":"ProPS: Prompted Profile Synthesis for Natural Language-Conditioned Speaker Embedding Distributions","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-07T20:30:53.546267Z"},"links":{"cited_paper":"/paper/2106.04624","citing_paper":"/paper/2607.05276"},"observation_digest":"sha256:6b331f5ddec13f0223611d315ec87d0f436744a37e09bb724303114f05d6dea1","observation_id":"d832546d-4020-4aff-9a35-390c916bd3ea","resolution":{"observed_at":"2026-07-07T20:34:09.742292Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04624","last_updated":"2021-06-08T18:22:56Z","snapshot_observed_at":"2026-08-04T07:20:14.379561Z","submitted_at":"2021-06-08T18:22:56Z","title":"SpeechBrain: A General-Purpose Speech Toolkit","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.04624","snapshot_observed_at":"2026-07-14T18:13:32.966335Z","title":"SpeechBrain: A general-purpose speech toolkit, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.09675","last_updated":"2026-06-06T20:41:26Z","snapshot_observed_at":"2026-08-03T04:29:49.664720Z","submitted_at":"2026-06-06T20:41:26Z","title":"Gender Gap Analysis in News and Talk Online Radio Broadcast","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-14T18:13:32.966335Z"},"links":{"cited_paper":"/paper/2106.04624","citing_paper":"/paper/2607.09675"},"observation_digest":"sha256:bddbd542021844ecee736b226baed10b32f510af3202c6afb82e31ca2c8f131d","observation_id":"02c95dd8-0ba1-4995-b20c-5122bb44e192","resolution":{"observed_at":"2026-07-14T18:13:32.966335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04624","last_updated":"2021-06-08T18:22:56Z","snapshot_observed_at":"2026-08-04T07:20:14.379561Z","submitted_at":"2021-06-08T18:22:56Z","title":"SpeechBrain: A General-Purpose Speech Toolkit","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.04624","snapshot_observed_at":"2026-08-01T20:47:01.794889Z","title":"Available: https://arxiv.org/abs/2106.04624","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16532","last_updated":"2026-07-17T22:13:02Z","snapshot_observed_at":"2026-08-03T09:09:17.114585Z","submitted_at":"2026-07-17T22:13:02Z","title":"AMECxSV: Adaptive Metadata-Driven Embedding-Fusion Calibration for X-Lingual Speaker Verification","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-01T20:47:01.794889Z"},"links":{"cited_paper":"/paper/2106.04624","citing_paper":"/paper/2607.16532"},"observation_digest":"sha256:bf89c4f0d77ffa96f55f9219d9482f6ca68fbb5a805866d5a2ec8d8be5fa0ecb","observation_id":"24215b28-f5b4-4b50-b952-df5106a09a86","resolution":{"observed_at":"2026-08-01T20:47:01.794889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04624","last_updated":"2021-06-08T18:22:56Z","snapshot_observed_at":"2026-08-04T07:20:14.379561Z","submitted_at":"2021-06-08T18:22:56Z","title":"SpeechBrain: A General-Purpose Speech Toolkit","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.04624","snapshot_observed_at":"2026-08-01T07:37:18.250178Z","title":"SpeechBrain: A General-Purpose Speech Toolkit,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.21393","last_updated":"2026-07-23T14:55:24Z","snapshot_observed_at":"2026-08-04T17:28:01.926355Z","submitted_at":"2026-07-23T14:55:24Z","title":"From Read Speech to Spoken Digits: A Task-Specific Evaluation of Speech Privacy With Informed Attackers","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T07:37:18.250178Z"},"links":{"cited_paper":"/paper/2106.04624","citing_paper":"/paper/2607.21393"},"observation_digest":"sha256:18433e278f3ab57096df963bd777f7cf67ecb1da5fd44d9ddc4bc4c1a14f28d8","observation_id":"836c1f18-2ec3-4ce6-b6b3-f52efceae5e4","resolution":{"observed_at":"2026-08-01T07:37:18.250178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04624","last_updated":"2021-06-08T18:22:56Z","snapshot_observed_at":"2026-08-04T07:20:14.379561Z","submitted_at":"2021-06-08T18:22:56Z","title":"SpeechBrain: A General-Purpose Speech Toolkit","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.04624","snapshot_observed_at":"2026-07-31T23:27:05.730485Z","title":"SpeechBrain: A general-purpose speech toolkit,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.23961","last_updated":"2026-07-27T03:17:21Z","snapshot_observed_at":"2026-08-02T05:50:53.812343Z","submitted_at":"2026-07-27T03:17:21Z","title":"Leveraging Gradient Reversal Loss and Multitask Learning for Datasets-Aware Audio Deepfake Detection","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-07-31T23:27:05.730485Z"},"links":{"cited_paper":"/paper/2106.04624","citing_paper":"/paper/2607.23961"},"observation_digest":"sha256:d6d910e22f0352318e8af5e613206c957cab8537ad927aefcf42ab12a4c809b8","observation_id":"43581c37-f2a4-4509-babf-e337a3a127d3","resolution":{"observed_at":"2026-07-31T23:27:05.730485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04624","last_updated":"2021-06-08T18:22:56Z","snapshot_observed_at":"2026-08-04T07:20:14.379561Z","submitted_at":"2021-06-08T18:22:56Z","title":"SpeechBrain: A General-Purpose Speech Toolkit","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.04624","snapshot_observed_at":"2026-07-31T16:58:29.335057Z","title":"arXiv (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.28129","last_updated":"2026-07-30T12:37:58Z","snapshot_observed_at":"2026-08-05T13:15:12.601747Z","submitted_at":"2026-07-30T12:37:58Z","title":"Face and Voice Cross-modal Association with Learning Convex Feature Embedding","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-07-31T16:58:29.335057Z"},"links":{"cited_paper":"/paper/2106.04624","citing_paper":"/paper/2607.28129"},"observation_digest":"sha256:b77955ed4943a52e7ef4fa7758c63ad79444aa3134ce8c3178b73f8d93d32e6c","observation_id":"d5a6f97a-d528-47aa-9b47-c52229f6fb69","resolution":{"observed_at":"2026-07-31T16:58:29.335057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04624","last_updated":"2021-06-08T18:22:56Z","snapshot_observed_at":"2026-08-04T07:20:14.379561Z","submitted_at":"2021-06-08T18:22:56Z","title":"SpeechBrain: A General-Purpose Speech Toolkit","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.04624","snapshot_observed_at":"2026-08-03T09:46:28.964740Z","title":"Speechbrain: A general-purpose speech toolkit,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.29299","last_updated":"2026-07-31T11:15:22Z","snapshot_observed_at":"2026-08-05T20:25:15.701279Z","submitted_at":"2026-07-31T11:15:22Z","title":"Leveraging Beam Search Information for Confidence Estimation in E2E ASR","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T09:46:28.964740Z"},"links":{"cited_paper":"/paper/2106.04624","citing_paper":"/paper/2607.29299"},"observation_digest":"sha256:e94a4538f57f1965f1a283288908bae6df46f68460c661a35cbeb8ab54253181","observation_id":"21b7b645-460b-4af0-bb54-72671c7b5029","resolution":{"observed_at":"2026-08-03T09:46:28.964740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04624","last_updated":"2021-06-08T18:22:56Z","snapshot_observed_at":"2026-08-04T07:20:14.379561Z","submitted_at":"2021-06-08T18:22:56Z","title":"SpeechBrain: A General-Purpose Speech Toolkit","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.04624","snapshot_observed_at":"2026-08-04T20:44:56.274017Z","title":"Ravanelli, T","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.01796","last_updated":"2026-08-03T07:04:51Z","snapshot_observed_at":"2026-08-05T19:51:28.308184Z","submitted_at":"2026-08-03T07:04:51Z","title":"Multi-Backbone Self-Supervised Ensembles for Audio Deepfake Detection and a Cross-Track Analysis of Generation-Detection Asymmetry","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T20:44:56.274017Z"},"links":{"cited_paper":"/paper/2106.04624","citing_paper":"/paper/2608.01796"},"observation_digest":"sha256:ebd3120ad58b37682bc735e0c33686c90f11c8eb3b2a32db91792a5e282dcea4","observation_id":"b7040812-3e7f-4077-a96f-54d202f54a14","resolution":{"observed_at":"2026-08-04T20:44:56.274017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04624","last_updated":"2021-06-08T18:22:56Z","snapshot_observed_at":"2026-08-04T07:20:14.379561Z","submitted_at":"2021-06-08T18:22:56Z","title":"SpeechBrain: A General-Purpose Speech Toolkit","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.04624","snapshot_observed_at":"2026-08-05T15:52:34.585187Z","title":"Speechbrain: A general-purpose speech toolkit,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.03623","last_updated":"2026-08-04T13:12:41Z","snapshot_observed_at":"2026-08-05T20:02:11.362031Z","submitted_at":"2026-08-04T13:12:41Z","title":"Speaker Verification Under Real Classroom Conditions for English Speech","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T15:52:34.585187Z"},"links":{"cited_paper":"/paper/2106.04624","citing_paper":"/paper/2608.03623"},"observation_digest":"sha256:3f9cb9f7557ac1c41a34b18e5c15f52426bc6902918797da1339685a6772fd4a","observation_id":"bcaad713-9f58-4df8-a603-773df50a24d9","resolution":{"observed_at":"2026-08-05T15:52:34.585187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2106.04624/citation-record","integrity":"/paper/2106.04624/integrity","json":"/paper/2106.04624/citation-record.json","paper":"/paper/2106.04624"},"outbound":[],"paper":{"arxiv_id":"2106.04624","last_updated":"2021-06-08T18:22:56Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-04T07:20:14.379561Z","submitted_at":"2021-06-08T18:22:56Z","title":"SpeechBrain: A General-Purpose Speech Toolkit"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 48 inbound Pith citation observations for arXiv:2106.04624."}