{"as_of":"2026-08-08T17:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4dcf49b9b35ef46f36bb5a34b1d780f054ab2ef08bbd7e3e776e466c141f6186","coverage":[{"denominator":46,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T12:36:19.265120Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T12:36:14.939053Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T12:36:19.393272Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.21642","last_updated":"2025-08-25T08:17:22Z","snapshot_observed_at":"2026-08-06T12:36:14.281703Z","submitted_at":"2025-07-29T09:58:45Z","title":"Whilter: A Whisper-based Data Filter for \"In-the-Wild\" Speech Corpora Using Utterance-level Multi-Task Classification","version":2},"cited_work":{"arxiv_id":"2507.21642","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.21642","snapshot_observed_at":"2026-08-06T12:36:19.393272Z","title":"Whilter: A Whisper-based Data Filter for \"In-the-Wild\" Speech Corpora Using Utterance-level Multi-Task Classification","venue":"cs.SD","work_id":"7be0e27d-1854-47e0-bbee-e1cb8e1d5c8d","year":2025},"citing_paper":{"arxiv_id":"2507.21642","last_updated":"2025-08-25T08:17:22Z","snapshot_observed_at":"2026-08-06T12:36:14.281703Z","submitted_at":"2025-07-29T09:58:45Z","title":"Whilter: A Whisper-based Data Filter for \"In-the-Wild\" Speech Corpora Using Utterance-level Multi-Task Classification","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T12:36:14.939053Z"},"links":{"cited_paper":"/paper/2507.21642","citing_paper":"/paper/2507.21642"},"observation_digest":"sha256:2859543338d8995375a184a26a473905707d3f26e6810d154475a87c6a305f22","observation_id":"d39270fe-4d4d-49d2-aa0c-7197b77f5b29","resolution":{"observed_at":"2026-08-06T12:36:19.486175Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.21642/citation-record","integrity":"/paper/2507.21642/integrity","json":"/paper/2507.21642/citation-record.json","paper":"/paper/2507.21642"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:36:20.344771Z","title":"In-the-wild (ITW) refers to data that is not recorded or collected in a highly controlled environ- ment [1]","venue":null,"work_id":"ad0911f1-e2bf-4ce7-a374-020788552899","year":null},"citing_paper":{"arxiv_id":"2507.21642","last_updated":"2025-08-25T08:17:22Z","snapshot_observed_at":"2026-08-06T12:36:14.281703Z","submitted_at":"2025-07-29T09:58:45Z","title":"Whilter: A Whisper-based Data Filter for \"In-the-Wild\" Speech Corpora Using Utterance-level Multi-Task Classification","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T12:36:14.694066Z"},"links":{"citing_paper":"/paper/2507.21642"},"observation_digest":"sha256:7af5bd227eef59eba8643b98f02632cdc808e066f0449a9958e12311b0c4526e","observation_id":"0d7fdc80-86a8-45d4-8f83-7ff408980450","resolution":{"observed_at":"2026-08-06T12:36:20.347827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21642","last_updated":"2025-08-25T08:17:22Z","snapshot_observed_at":"2026-08-06T12:36:14.281703Z","submitted_at":"2025-07-29T09:58:45Z","title":"Whilter: A Whisper-based Data Filter for \"In-the-Wild\" Speech Corpora Using Utterance-level Multi-Task Classification","version":2},"cited_work":{"arxiv_id":"2507.21642","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.21642","snapshot_observed_at":"2026-08-06T12:36:19.393272Z","title":"Whilter: A Whisper-based Data Filter for \"In-the-Wild\" Speech Corpora Using Utterance-level Multi-Task Classification","venue":"cs.SD","work_id":"7be0e27d-1854-47e0-bbee-e1cb8e1d5c8d","year":2025},"citing_paper":{"arxiv_id":"2507.21642","last_updated":"2025-08-25T08:17:22Z","snapshot_observed_at":"2026-08-06T12:36:14.281703Z","submitted_at":"2025-07-29T09:58:45Z","title":"Whilter: A Whisper-based Data Filter for \"In-the-Wild\" Speech Corpora Using Utterance-level Multi-Task Classification","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T12:36:14.939053Z"},"links":{"cited_paper":"/paper/2507.21642","citing_paper":"/paper/2507.21642"},"observation_digest":"sha256:2859543338d8995375a184a26a473905707d3f26e6810d154475a87c6a305f22","observation_id":"d39270fe-4d4d-49d2-aa0c-7197b77f5b29","resolution":{"observed_at":"2026-08-06T12:36:19.486175Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:36:20.317126Z","title":"For the first training stage, simple filename and label pairs are derived from non-ITW datasets","venue":null,"work_id":"f62b751b-5b9f-4c77-b39e-f2023656340e","year":2018},"citing_paper":{"arxiv_id":"2507.21642","last_updated":"2025-08-25T08:17:22Z","snapshot_observed_at":"2026-08-06T12:36:14.281703Z","submitted_at":"2025-07-29T09:58:45Z","title":"Whilter: A Whisper-based Data Filter for \"In-the-Wild\" Speech Corpora Using Utterance-level Multi-Task Classification","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T12:36:15.203573Z"},"links":{"citing_paper":"/paper/2507.21642"},"observation_digest":"sha256:2ef5eb9f48c9e980893e5b7d0a6ab0f1dd7e2abb6d05acc2a57e900fe59fe79f","observation_id":"3d8a8247-85f7-42fe-9e62-1715c538b78f","resolution":{"observed_at":"2026-08-06T12:36:20.320435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:36:20.308429Z","title":null,"venue":null,"work_id":"8dcf3f18-c6a1-4155-a72e-e799c12d961d","year":null},"citing_paper":{"arxiv_id":"2507.21642","last_updated":"2025-08-25T08:17:22Z","snapshot_observed_at":"2026-08-06T12:36:14.281703Z","submitted_at":"2025-07-29T09:58:45Z","title":"Whilter: A Whisper-based Data Filter for \"In-the-Wild\" Speech Corpora Using Utterance-level Multi-Task Classification","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T12:36:15.367337Z"},"links":{"citing_paper":"/paper/2507.21642"},"observation_digest":"sha256:b5758e86b0ba34fc8d0cd97b3ffed7b6a48a9a22cce797878384c578a84c01e2","observation_id":"deb1ed1e-34e7-4258-87eb-c7cb1c86c98d","resolution":{"observed_at":"2026-08-06T12:36:20.311411Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:36:20.299381Z","title":null,"venue":null,"work_id":"58113d2a-505e-4a95-97fe-51bfb29c514a","year":null},"citing_paper":{"arxiv_id":"2507.21642","last_updated":"2025-08-25T08:17:22Z","snapshot_observed_at":"2026-08-06T12:36:14.281703Z","submitted_at":"2025-07-29T09:58:45Z","title":"Whilter: A Whisper-based Data Filter for \"In-the-Wild\" Speech Corpora Using Utterance-level Multi-Task Classification","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T12:36:15.474633Z"},"links":{"citing_paper":"/paper/2507.21642"},"observation_digest":"sha256:6fbb482af8e268508a5bf519ac2ae864cacc97c484c499ccb6cf94e68af34328","observation_id":"18f3e325-9386-4531-9dd6-f7eb3020ba32","resolution":{"observed_at":"2026-08-06T12:36:20.302330Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:36:20.290309Z","title":"noisiness","venue":null,"work_id":"71b08c82-7fe6-4213-ba67-300f9825b368","year":null},"citing_paper":{"arxiv_id":"2507.21642","last_updated":"2025-08-25T08:17:22Z","snapshot_observed_at":"2026-08-06T12:36:14.281703Z","submitted_at":"2025-07-29T09:58:45Z","title":"Whilter: A Whisper-based Data Filter for \"In-the-Wild\" Speech Corpora Using Utterance-level Multi-Task Classification","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T12:36:15.633256Z"},"links":{"citing_paper":"/paper/2507.21642"},"observation_digest":"sha256:505cfd11b9a740c6461fad3e30360c854984502ad02492a39b34f66dfeeff58b","observation_id":"b202d257-f806-44c3-a2b5-8e725b0e3ef8","resolution":{"observed_at":"2026-08-06T12:36:20.293300Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:36:20.280469Z","title":"It was shown that the AITW dataset can be used to train classifiers on multispeaker, foreign language, background music, noise and synthetic speech labels","venue":null,"work_id":"5244bbc4-a89b-4688-984a-311fdd01ccf4","year":null},"citing_paper":{"arxiv_id":"2507.21642","last_updated":"2025-08-25T08:17:22Z","snapshot_observed_at":"2026-08-06T12:36:14.281703Z","submitted_at":"2025-07-29T09:58:45Z","title":"Whilter: A Whisper-based Data Filter for \"In-the-Wild\" Speech Corpora Using Utterance-level Multi-Task Classification","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T12:36:15.759015Z"},"links":{"citing_paper":"/paper/2507.21642"},"observation_digest":"sha256:d022deb5d956c42ddf0fb1740c600319a297a469ef7bf7c0448f568e367495fe","observation_id":"0eab6f77-b80c-489d-b6d9-13c2aa1b0544","resolution":{"observed_at":"2026-08-06T12:36:20.284045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:36:20.210024Z","title":"An open-source speaker gender detection framework for moni- toring gender equality,","venue":null,"work_id":"f644ee9e-9c92-4c09-a8c8-768c134c2182","year":2018},"citing_paper":{"arxiv_id":"2507.21642","last_updated":"2025-08-25T08:17:22Z","snapshot_observed_at":"2026-08-06T12:36:14.281703Z","submitted_at":"2025-07-29T09:58:45Z","title":"Whilter: A Whisper-based Data Filter for \"In-the-Wild\" Speech Corpora Using Utterance-level Multi-Task Classification","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T12:36:17.012882Z"},"links":{"citing_paper":"/paper/2507.21642"},"observation_digest":"sha256:1ffb6a69754413577d8a923cfbf2c59e8d45a3794a1d1915d8a17f36778eb6bd","observation_id":"662c5dbe-1be9-445e-801f-2669df316465","resolution":{"observed_at":"2026-08-06T12:36:20.213158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:36:20.200863Z","title":"Label Studio: Data labeling software,","venue":null,"work_id":"aaeb50b1-7d87-423f-8827-c33e8cd3f1cb","year":2020},"citing_paper":{"arxiv_id":"2507.21642","last_updated":"2025-08-25T08:17:22Z","snapshot_observed_at":"2026-08-06T12:36:14.281703Z","submitted_at":"2025-07-29T09:58:45Z","title":"Whilter: A Whisper-based Data Filter for \"In-the-Wild\" Speech Corpora Using Utterance-level Multi-Task Classification","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T12:36:17.188737Z"},"links":{"citing_paper":"/paper/2507.21642"},"observation_digest":"sha256:d04eac92683eabbe9130ca3e5f209a8d216aec19b72222dd138388e4b4465a36","observation_id":"f66a5262-6e0e-4108-a8df-557f08781bcd","resolution":{"observed_at":"2026-08-06T12:36:20.203845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:36:20.271125Z","title":"V oxceleb2: Deep speaker recognition,","venue":null,"work_id":"72b1f064-9b00-4364-af20-f1d2c372f6b4","year":2018},"citing_paper":{"arxiv_id":"2507.21642","last_updated":"2025-08-25T08:17:22Z","snapshot_observed_at":"2026-08-06T12:36:14.281703Z","submitted_at":"2025-07-29T09:58:45Z","title":"Whilter: A Whisper-based Data Filter for \"In-the-Wild\" Speech Corpora Using Utterance-level Multi-Task Classification","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T12:36:15.952302Z"},"links":{"citing_paper":"/paper/2507.21642"},"observation_digest":"sha256:af422085867d57ad68f59afe21f8ff75c1a8febdd01392ea44ae6947f2a9e980","observation_id":"80080ab1-ade4-4845-89ee-65c9459317ce","resolution":{"observed_at":"2026-08-06T12:36:20.274372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:36:20.260331Z","title":"YODAS: Youtube-Oriented Dataset for Audio and Speech,","venue":null,"work_id":"94655b14-8fac-44f1-93ec-dc99408382bd","year":2023},"citing_paper":{"arxiv_id":"2507.21642","last_updated":"2025-08-25T08:17:22Z","snapshot_observed_at":"2026-08-06T12:36:14.281703Z","submitted_at":"2025-07-29T09:58:45Z","title":"Whilter: A Whisper-based Data Filter for \"In-the-Wild\" Speech Corpora Using Utterance-level Multi-Task Classification","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T12:36:16.062098Z"},"links":{"citing_paper":"/paper/2507.21642"},"observation_digest":"sha256:5776456bd75777ca714a43faf1af7e38ea143628da3066ed69984f6c91bb8116","observation_id":"7f0c58ca-f948-4e55-ad21-a87f4cf104a9","resolution":{"observed_at":"2026-08-06T12:36:20.263840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05361","last_updated":"2024-09-07T15:08:24Z","snapshot_observed_at":"2026-08-07T13:19:22.496186Z","submitted_at":"2024-07-07T13:24:54Z","title":"Emilia: An Extensive, Multilingual, and Diverse Speech Dataset for Large-Scale Speech Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05361","snapshot_observed_at":"2026-08-06T12:36:16.250981Z","title":"Emilia: An extensive, multilingual, and diverse speech dataset for large-scale speech generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21642","last_updated":"2025-08-25T08:17:22Z","snapshot_observed_at":"2026-08-06T12:36:14.281703Z","submitted_at":"2025-07-29T09:58:45Z","title":"Whilter: A Whisper-based Data Filter for \"In-the-Wild\" Speech Corpora Using Utterance-level Multi-Task Classification","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T12:36:16.250981Z"},"links":{"cited_paper":"/paper/2407.05361","citing_paper":"/paper/2507.21642"},"observation_digest":"sha256:fbb1f5d4986b7c9898a7c22f5b3d091380f99007493cdaacf61bf4297d66a7b1","observation_id":"d4a39cdd-a493-4d96-90f3-f2082407f8dd","resolution":{"observed_at":"2026-08-06T12:36:16.250981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:36:20.249642Z","title":"Speak, read and prompt: High-fidelity text-to-speech with min- imal supervision,","venue":null,"work_id":"50e8efb0-7ecc-4561-a87d-99d5412219c4","year":2023},"citing_paper":{"arxiv_id":"2507.21642","last_updated":"2025-08-25T08:17:22Z","snapshot_observed_at":"2026-08-06T12:36:14.281703Z","submitted_at":"2025-07-29T09:58:45Z","title":"Whilter: A Whisper-based Data Filter for \"In-the-Wild\" Speech Corpora Using Utterance-level Multi-Task Classification","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T12:36:16.377864Z"},"links":{"citing_paper":"/paper/2507.21642"},"observation_digest":"sha256:b1f8a2154de44c290dafc250db36d190ba12296673aece0f87d538dffa5ae3b0","observation_id":"d42dd31b-d7a2-4b0c-ac1c-20430aa0225f","resolution":{"observed_at":"2026-08-06T12:36:20.253100Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:36:20.335726Z","title":"synthetic speech and non-target languages in many cases)","venue":null,"work_id":"aa20aceb-bda3-489b-b092-063f121ec7b0","year":null},"citing_paper":{"arxiv_id":"2507.21642","last_updated":"2025-08-25T08:17:22Z","snapshot_observed_at":"2026-08-06T12:36:14.281703Z","submitted_at":"2025-07-29T09:58:45Z","title":"Whilter: A Whisper-based Data Filter for \"In-the-Wild\" Speech Corpora Using Utterance-level Multi-Task Classification","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T12:36:14.761813Z"},"links":{"citing_paper":"/paper/2507.21642"},"observation_digest":"sha256:a47e1f7642d5bec20a0c676b8680c27eb4d4e665919e5518a4816839a1d66c0c","observation_id":"4e3daa7b-011d-4649-8449-6688a6aeeeb6","resolution":{"observed_at":"2026-08-06T12:36:20.339065Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:36:20.238780Z","title":"mhubert-147: A compact multilingual hubert model,","venue":null,"work_id":"0efd53e4-2959-4c3e-8c68-dd0fb3dea9ad","year":2024},"citing_paper":{"arxiv_id":"2507.21642","last_updated":"2025-08-25T08:17:22Z","snapshot_observed_at":"2026-08-06T12:36:14.281703Z","submitted_at":"2025-07-29T09:58:45Z","title":"Whilter: A Whisper-based Data Filter for \"In-the-Wild\" Speech Corpora Using Utterance-level Multi-Task Classification","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T12:36:16.582222Z"},"links":{"citing_paper":"/paper/2507.21642"},"observation_digest":"sha256:7c1a0f69ce097383e369d575e784caa3cc184cf93c9d1db8104c7b852c22fae1","observation_id":"788c4853-3cc5-42c1-b3fe-f9e889214510","resolution":{"observed_at":"2026-08-06T12:36:20.242353Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:36:20.228902Z","title":"Sentence level intelligibility eval- uation for mandarin text-to-speech systems using semantically unpredictable sentences,","venue":null,"work_id":"d264e554-1b1b-461e-8ed8-fd856e5cb009","year":2007},"citing_paper":{"arxiv_id":"2507.21642","last_updated":"2025-08-25T08:17:22Z","snapshot_observed_at":"2026-08-06T12:36:14.281703Z","submitted_at":"2025-07-29T09:58:45Z","title":"Whilter: A Whisper-based Data Filter for \"In-the-Wild\" Speech Corpora Using Utterance-level Multi-Task Classification","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T12:36:16.739548Z"},"links":{"citing_paper":"/paper/2507.21642"},"observation_digest":"sha256:ea9c7b17c057d5fc6874d10548e7439320dc79ed6c7e78190cc2ce7795d501b6","observation_id":"3a99ca04-b170-4b91-9a1c-1a49d79b0ac9","resolution":{"observed_at":"2026-08-06T12:36:20.232020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:36:20.219482Z","title":"Data-filtering methods for self-training of auto- matic speech recognition systems,","venue":null,"work_id":"c0949fce-44c6-4354-9f91-820b1d556950","year":2021},"citing_paper":{"arxiv_id":"2507.21642","last_updated":"2025-08-25T08:17:22Z","snapshot_observed_at":"2026-08-06T12:36:14.281703Z","submitted_at":"2025-07-29T09:58:45Z","title":"Whilter: A Whisper-based Data Filter for \"In-the-Wild\" Speech Corpora Using Utterance-level Multi-Task Classification","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T12:36:16.856553Z"},"links":{"citing_paper":"/paper/2507.21642"},"observation_digest":"sha256:79fe9a21bcfb29374eb57c1ab391cc547b5100470b337edb37f3022cd17dcce0","observation_id":"8095009c-91eb-4157-b76f-2d882ec09be2","resolution":{"observed_at":"2026-08-06T12:36:20.222623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:36:20.023303Z","title":"Attention is All you Need,","venue":null,"work_id":"ee1daff2-1141-481c-970b-40d499faa6d6","year":2017},"citing_paper":{"arxiv_id":"2507.21642","last_updated":"2025-08-25T08:17:22Z","snapshot_observed_at":"2026-08-06T12:36:14.281703Z","submitted_at":"2025-07-29T09:58:45Z","title":"Whilter: A Whisper-based Data Filter for \"In-the-Wild\" Speech Corpora Using Utterance-level Multi-Task Classification","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T12:36:17.993141Z"},"links":{"citing_paper":"/paper/2507.21642"},"observation_digest":"sha256:ad5dcf47650e06eefacb229004d4b47156d3cb216e93560d19947436462df949","observation_id":"dfd21f4b-5d2b-4ef0-ac35-e1014274d4fb","resolution":{"observed_at":"2026-08-06T12:36:20.026366Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:36:20.097745Z","title":"pyannote.audio 2.1 speaker diarization pipeline: prin- ciple, benchmark, and recipe,","venue":null,"work_id":"8016c9d4-8fbc-4933-ad24-e0629419db81","year":2023},"citing_paper":{"arxiv_id":"2507.21642","last_updated":"2025-08-25T08:17:22Z","snapshot_observed_at":"2026-08-06T12:36:14.281703Z","submitted_at":"2025-07-29T09:58:45Z","title":"Whilter: A Whisper-based Data Filter for \"In-the-Wild\" Speech Corpora Using Utterance-level Multi-Task Classification","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T12:36:17.257923Z"},"links":{"citing_paper":"/paper/2507.21642"},"observation_digest":"sha256:8228fba49c0b6aaaab712acd8ec0c4525469fe4d18fffb1c90bef77ab2a96beb","observation_id":"b9c5a3b8-08c8-40f9-9502-6c92053cb87b","resolution":{"observed_at":"2026-08-06T12:36:20.194492Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:36:20.089352Z","title":"FoR: A dataset for synthetic speech detection,","venue":null,"work_id":"e7225bfe-b76d-41d2-a4cc-fcd6b1632ca8","year":2019},"citing_paper":{"arxiv_id":"2507.21642","last_updated":"2025-08-25T08:17:22Z","snapshot_observed_at":"2026-08-06T12:36:14.281703Z","submitted_at":"2025-07-29T09:58:45Z","title":"Whilter: A Whisper-based Data Filter for \"In-the-Wild\" Speech Corpora Using Utterance-level Multi-Task Classification","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T12:36:17.347739Z"},"links":{"citing_paper":"/paper/2507.21642"},"observation_digest":"sha256:83687aad50b3e3e3f8655868f3c8ad3a07243917d892374d271e271dc75a6d4e","observation_id":"6c8d09a5-d94e-415b-ae78-4a814d3773de","resolution":{"observed_at":"2026-08-06T12:36:20.092229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:36:20.080273Z","title":"AASIST: Audio Anti-Spoofing Us- ing Integrated Spectro-Temporal Graph Attention Networks,","venue":null,"work_id":"abac8eb6-a252-423b-8767-70939191b4b5","year":2022},"citing_paper":{"arxiv_id":"2507.21642","last_updated":"2025-08-25T08:17:22Z","snapshot_observed_at":"2026-08-06T12:36:14.281703Z","submitted_at":"2025-07-29T09:58:45Z","title":"Whilter: A Whisper-based Data Filter for \"In-the-Wild\" Speech Corpora Using Utterance-level Multi-Task Classification","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T12:36:17.436804Z"},"links":{"citing_paper":"/paper/2507.21642"},"observation_digest":"sha256:081608b2c3743ba1fd9f94d27711ab053a8d4e7246e2c5dcf278a38d47269020","observation_id":"9a699321-9cf0-4061-93d0-a07c96283c51","resolution":{"observed_at":"2026-08-06T12:36:20.083301Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:36:20.326373Z","title":"This as- sumption is validated later in our results, cf","venue":null,"work_id":"496f6d25-97b0-4bc5-b70b-14a64a4d35a2","year":null},"citing_paper":{"arxiv_id":"2507.21642","last_updated":"2025-08-25T08:17:22Z","snapshot_observed_at":"2026-08-06T12:36:14.281703Z","submitted_at":"2025-07-29T09:58:45Z","title":"Whilter: A Whisper-based Data Filter for \"In-the-Wild\" Speech Corpora Using Utterance-level Multi-Task Classification","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T12:36:15.048489Z"},"links":{"citing_paper":"/paper/2507.21642"},"observation_digest":"sha256:e767da5be4614f6e370795147b42e06ebeda50c86cafccad4f756c42c4c90fa6","observation_id":"d2e535ba-d3a9-4939-8abf-99a1931349bd","resolution":{"observed_at":"2026-08-06T12:36:20.329846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:36:20.070650Z","title":"Robust speech recognition via large-scale weak su- pervision,","venue":null,"work_id":"3c35ea3a-f4a7-4a91-b01a-0ad7285a765b","year":2023},"citing_paper":{"arxiv_id":"2507.21642","last_updated":"2025-08-25T08:17:22Z","snapshot_observed_at":"2026-08-06T12:36:14.281703Z","submitted_at":"2025-07-29T09:58:45Z","title":"Whilter: A Whisper-based Data Filter for \"In-the-Wild\" Speech Corpora Using Utterance-level Multi-Task Classification","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T12:36:17.518641Z"},"links":{"citing_paper":"/paper/2507.21642"},"observation_digest":"sha256:13c895d736ff1204d873c5c7da8fb94e2ead519d134f47342eccff67a7619166","observation_id":"431ed380-c6a3-4748-9ba2-f678217b81d3","resolution":{"observed_at":"2026-08-06T12:36:20.073766Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:36:20.061320Z","title":"Perceive and predict: Self-supervised speech representation based loss func- tions for speech enhancement,","venue":null,"work_id":"df3574db-ee99-4b6e-aa27-0b150c881304","year":2023},"citing_paper":{"arxiv_id":"2507.21642","last_updated":"2025-08-25T08:17:22Z","snapshot_observed_at":"2026-08-06T12:36:14.281703Z","submitted_at":"2025-07-29T09:58:45Z","title":"Whilter: A Whisper-based Data Filter for \"In-the-Wild\" Speech Corpora Using Utterance-level Multi-Task Classification","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T12:36:17.608036Z"},"links":{"citing_paper":"/paper/2507.21642"},"observation_digest":"sha256:13132ecef10c27de6dbe3ac8e65c824712e26e5118dd2214dc8b986b8980b96f","observation_id":"7a73256a-16f2-4004-b601-e7a39733765d","resolution":{"observed_at":"2026-08-06T12:36:20.064610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:36:20.051826Z","title":"Transcription-free fine-tuning of speech separation models for noisy and reverberant multi-speaker automatic speech recognition,","venue":null,"work_id":"7da7b6f1-86b4-4d3c-8b32-b8356d815aa7","year":2024},"citing_paper":{"arxiv_id":"2507.21642","last_updated":"2025-08-25T08:17:22Z","snapshot_observed_at":"2026-08-06T12:36:14.281703Z","submitted_at":"2025-07-29T09:58:45Z","title":"Whilter: A Whisper-based Data Filter for \"In-the-Wild\" Speech Corpora Using Utterance-level Multi-Task Classification","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T12:36:17.687623Z"},"links":{"citing_paper":"/paper/2507.21642"},"observation_digest":"sha256:3cf4a0dd6d77ca377376828c37f66e8269b5fa90b7a90030090223a7cb63d620","observation_id":"1d4fe041-0f67-4bbe-9392-c30dc86605ce","resolution":{"observed_at":"2026-08-06T12:36:20.055009Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:36:20.042184Z","title":"Non-intrusive speech intelligibility pre- diction for hearing-impaired users using intermediate asr features and human memory models,","venue":null,"work_id":"5e2b3b48-0f17-4880-855b-e341d7d4f0c4","year":2024},"citing_paper":{"arxiv_id":"2507.21642","last_updated":"2025-08-25T08:17:22Z","snapshot_observed_at":"2026-08-06T12:36:14.281703Z","submitted_at":"2025-07-29T09:58:45Z","title":"Whilter: A Whisper-based Data Filter for \"In-the-Wild\" Speech Corpora Using Utterance-level Multi-Task Classification","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T12:36:17.818034Z"},"links":{"citing_paper":"/paper/2507.21642"},"observation_digest":"sha256:4a9198969ede89a9a4b0fbee4feeb4d75ba6d70d1c594a364f2217b99ec80200","observation_id":"4bd74790-bffe-434a-8f27-88d484b90167","resolution":{"observed_at":"2026-08-06T12:36:20.045407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:36:20.033125Z","title":"Heterogeneity over homogeneity: Investigating multilingual speech pre-trained models for detecting audio deepfake,","venue":null,"work_id":"b4757f05-c04e-406c-99d8-ed437dd83071","year":2024},"citing_paper":{"arxiv_id":"2507.21642","last_updated":"2025-08-25T08:17:22Z","snapshot_observed_at":"2026-08-06T12:36:14.281703Z","submitted_at":"2025-07-29T09:58:45Z","title":"Whilter: A Whisper-based Data Filter for \"In-the-Wild\" Speech Corpora Using Utterance-level Multi-Task Classification","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T12:36:17.904511Z"},"links":{"citing_paper":"/paper/2507.21642"},"observation_digest":"sha256:c47a67dc01a8b03cef39eadb620481dc03b1c1172591d70f517d5b0cf15a9663","observation_id":"9a794ed0-4674-4f02-afdc-075e8d938a42","resolution":{"observed_at":"2026-08-06T12:36:20.036295Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:36:20.012746Z","title":"Nisqa: A deep cnn-self-attention model for multidimensional speech quality pre- diction with crowdsourced datasets,","venue":null,"work_id":"4679ddc4-cafa-4045-afc4-d84e879849dd","year":2021},"citing_paper":{"arxiv_id":"2507.21642","last_updated":"2025-08-25T08:17:22Z","snapshot_observed_at":"2026-08-06T12:36:14.281703Z","submitted_at":"2025-07-29T09:58:45Z","title":"Whilter: A Whisper-based Data Filter for \"In-the-Wild\" Speech Corpora Using Utterance-level Multi-Task Classification","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T12:36:18.073975Z"},"links":{"citing_paper":"/paper/2507.21642"},"observation_digest":"sha256:a3c5ddda58a38b5e0867d299e81591018b828985db0c83f5c53d08dbc803a6e6","observation_id":"f78d6fe7-9e8c-4e81-9b18-d2446077e1d7","resolution":{"observed_at":"2026-08-06T12:36:20.016269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:36:20.001982Z","title":"Hallucination in perceptual metric-driven speech enhancement networks,","venue":null,"work_id":"4ad891f2-2b57-4f65-94d8-7d41493c5d67","year":2024},"citing_paper":{"arxiv_id":"2507.21642","last_updated":"2025-08-25T08:17:22Z","snapshot_observed_at":"2026-08-06T12:36:14.281703Z","submitted_at":"2025-07-29T09:58:45Z","title":"Whilter: A Whisper-based Data Filter for \"In-the-Wild\" Speech Corpora Using Utterance-level Multi-Task Classification","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T12:36:18.121425Z"},"links":{"citing_paper":"/paper/2507.21642"},"observation_digest":"sha256:671c1a99d4dffbb3333c2276e354f51059a4833ed66a895562b52cd896755b8d","observation_id":"19dd9b2a-49d7-4688-a944-9e8599a75257","resolution":{"observed_at":"2026-08-06T12:36:20.005475Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:36:19.991392Z","title":"An overview of multi-task learning in deep neural networks,","venue":null,"work_id":"15258b53-d4a8-48e8-ac94-e23e3d73edc4","year":2017},"citing_paper":{"arxiv_id":"2507.21642","last_updated":"2025-08-25T08:17:22Z","snapshot_observed_at":"2026-08-06T12:36:14.281703Z","submitted_at":"2025-07-29T09:58:45Z","title":"Whilter: A Whisper-based Data Filter for \"In-the-Wild\" Speech Corpora Using Utterance-level Multi-Task Classification","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T12:36:18.183181Z"},"links":{"citing_paper":"/paper/2507.21642"},"observation_digest":"sha256:1f14cebb5e2b38c9fbed193c9ba11ef985b5c5e50c09a43e38a774fd96661b9f","observation_id":"e2518e7a-a00f-478f-abe5-525e202aa34b","resolution":{"observed_at":"2026-08-06T12:36:19.994398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:36:19.982355Z","title":"BEATs: Audio pre-training with acoustic to- kenizers,","venue":null,"work_id":"7be0b56f-c4e4-4935-ae9a-607cc889b077","year":2023},"citing_paper":{"arxiv_id":"2507.21642","last_updated":"2025-08-25T08:17:22Z","snapshot_observed_at":"2026-08-06T12:36:14.281703Z","submitted_at":"2025-07-29T09:58:45Z","title":"Whilter: A Whisper-based Data Filter for \"In-the-Wild\" Speech Corpora Using Utterance-level Multi-Task Classification","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T12:36:18.246729Z"},"links":{"citing_paper":"/paper/2507.21642"},"observation_digest":"sha256:ce142e36e029e05a2d6df355164f54a2e20a9f4ee9500a64d9b3a34801df8543","observation_id":"05818646-6738-4a57-9ddd-199d562323d4","resolution":{"observed_at":"2026-08-06T12:36:19.985310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:36:19.972772Z","title":"Large-scale contrastive language-audio pretraining with feature fusion and keyword-to-caption augmentation,","venue":null,"work_id":"af3c457f-5483-409b-b714-c75fac220e13","year":2023},"citing_paper":{"arxiv_id":"2507.21642","last_updated":"2025-08-25T08:17:22Z","snapshot_observed_at":"2026-08-06T12:36:14.281703Z","submitted_at":"2025-07-29T09:58:45Z","title":"Whilter: A Whisper-based Data Filter for \"In-the-Wild\" Speech Corpora Using Utterance-level Multi-Task Classification","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T12:36:18.331090Z"},"links":{"citing_paper":"/paper/2507.21642"},"observation_digest":"sha256:3902ded3e073d555f5280229da28f85143e1d13206ecab93039a91a643ce0bc6","observation_id":"aebc4646-88f0-4a16-b3e8-57bcbf75fec7","resolution":{"observed_at":"2026-08-06T12:36:19.976010Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:36:19.963233Z","title":"Wavesplit: End-to-end speech separation by speaker clustering,","venue":null,"work_id":"13ee3c36-9f64-47f6-bd6e-acde65d120f0","year":2021},"citing_paper":{"arxiv_id":"2507.21642","last_updated":"2025-08-25T08:17:22Z","snapshot_observed_at":"2026-08-06T12:36:14.281703Z","submitted_at":"2025-07-29T09:58:45Z","title":"Whilter: A Whisper-based Data Filter for \"In-the-Wild\" Speech Corpora Using Utterance-level Multi-Task Classification","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T12:36:18.453605Z"},"links":{"citing_paper":"/paper/2507.21642"},"observation_digest":"sha256:605ed167b61beb0beac373f6582b3fc91d31f31b9bfce29290779a99aa378b51","observation_id":"014a8bb2-4168-48c3-a442-168f1bee4121","resolution":{"observed_at":"2026-08-06T12:36:19.966245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:36:18.476532Z","title":"The AMI Meeting Corpus: A Pre- announcement,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2507.21642","last_updated":"2025-08-25T08:17:22Z","snapshot_observed_at":"2026-08-06T12:36:14.281703Z","submitted_at":"2025-07-29T09:58:45Z","title":"Whilter: A Whisper-based Data Filter for \"In-the-Wild\" Speech Corpora Using Utterance-level Multi-Task Classification","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T12:36:18.476532Z"},"links":{"citing_paper":"/paper/2507.21642"},"observation_digest":"sha256:45f86b4faa9f56c7a536e64377c0e36cf8a4968fa039da274aafd08e2b45f85d","observation_id":"fb1510eb-4c64-47b5-aada-3fdee4d7de85","resolution":{"observed_at":"2026-08-06T12:36:18.476532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:36:19.946872Z","title":"M2Met: The ICASSP 2022 Multi-Channel Multi-Party Meeting Transcription Challenge,","venue":null,"work_id":"3af4b062-c5f3-4340-a7a2-445c61cfcce8","year":2022},"citing_paper":{"arxiv_id":"2507.21642","last_updated":"2025-08-25T08:17:22Z","snapshot_observed_at":"2026-08-06T12:36:14.281703Z","submitted_at":"2025-07-29T09:58:45Z","title":"Whilter: A Whisper-based Data Filter for \"In-the-Wild\" Speech Corpora Using Utterance-level Multi-Task Classification","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T12:36:18.591304Z"},"links":{"citing_paper":"/paper/2507.21642"},"observation_digest":"sha256:18c89013a71fc9b2b90abe06d55bc31e8b7930c72ea0f514aa1802f6bbd50d83","observation_id":"e2ccdfa0-b169-4d5b-b4b3-0a34d3d08f00","resolution":{"observed_at":"2026-08-06T12:36:19.950665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:36:19.937204Z","title":"MLS: A Large-Scale Multilingual Dataset for Speech Research,","venue":null,"work_id":"6497e772-4331-467f-8795-e62dd189d5bf","year":2020},"citing_paper":{"arxiv_id":"2507.21642","last_updated":"2025-08-25T08:17:22Z","snapshot_observed_at":"2026-08-06T12:36:14.281703Z","submitted_at":"2025-07-29T09:58:45Z","title":"Whilter: A Whisper-based Data Filter for \"In-the-Wild\" Speech Corpora Using Utterance-level Multi-Task Classification","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T12:36:18.612570Z"},"links":{"citing_paper":"/paper/2507.21642"},"observation_digest":"sha256:b015d45674878a6c96a2ae515c3e43a43910458a83593f30bf0a416d20fb6223","observation_id":"5a0b28c5-50c1-44f0-bc0d-ddb1dd0f03e8","resolution":{"observed_at":"2026-08-06T12:36:19.940318Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1510.08484","last_updated":"2015-10-28T20:59:04Z","snapshot_observed_at":"2026-07-06T04:34:36.474437Z","submitted_at":"2015-10-28T20:59:04Z","title":"MUSAN: A Music, Speech, and Noise Corpus","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1510.08484","snapshot_observed_at":"2026-08-06T12:36:18.698419Z","title":"MUSAN: A Music, Speech, and Noise Corpus,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.21642","last_updated":"2025-08-25T08:17:22Z","snapshot_observed_at":"2026-08-06T12:36:14.281703Z","submitted_at":"2025-07-29T09:58:45Z","title":"Whilter: A Whisper-based Data Filter for \"In-the-Wild\" Speech Corpora Using Utterance-level Multi-Task Classification","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T12:36:18.698419Z"},"links":{"cited_paper":"/paper/1510.08484","citing_paper":"/paper/2507.21642"},"observation_digest":"sha256:e77e67826b59b0607924a8fb1a8e918cc460083c9b49ee1f955c42f99bc691bf","observation_id":"79768340-eee1-4774-b730-8ef1af09d142","resolution":{"observed_at":"2026-08-06T12:36:18.698419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:36:19.927345Z","title":"An open dataset of synthetic speech,","venue":null,"work_id":"e27957a2-4470-4961-b440-4f30c65102c2","year":2023},"citing_paper":{"arxiv_id":"2507.21642","last_updated":"2025-08-25T08:17:22Z","snapshot_observed_at":"2026-08-06T12:36:14.281703Z","submitted_at":"2025-07-29T09:58:45Z","title":"Whilter: A Whisper-based Data Filter for \"In-the-Wild\" Speech Corpora Using Utterance-level Multi-Task Classification","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T12:36:18.763442Z"},"links":{"citing_paper":"/paper/2507.21642"},"observation_digest":"sha256:bfa3ea011b4137a1c07659c8d91d2d67312ee4cfebd92e2d9c29c413c5d21bba","observation_id":"153e9b18-4ea5-417b-b93c-d74ff886df1b","resolution":{"observed_at":"2026-08-06T12:36:19.930422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:36:19.917693Z","title":"OpenMIC-2018: An Open Dataset for Multiple Instrument Recognition,","venue":null,"work_id":"7157b2d2-fff5-4707-8260-95ac075822d1","year":2018},"citing_paper":{"arxiv_id":"2507.21642","last_updated":"2025-08-25T08:17:22Z","snapshot_observed_at":"2026-08-06T12:36:14.281703Z","submitted_at":"2025-07-29T09:58:45Z","title":"Whilter: A Whisper-based Data Filter for \"In-the-Wild\" Speech Corpora Using Utterance-level Multi-Task Classification","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T12:36:18.817911Z"},"links":{"citing_paper":"/paper/2507.21642"},"observation_digest":"sha256:57846b16ea74cded6b663fa670642c25676f25b3bdf36b0de4fcd1f187fa5938","observation_id":"3d43015b-4aec-426c-a567-8d67381e9d58","resolution":{"observed_at":"2026-08-06T12:36:19.920880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:36:19.907771Z","title":"Learning sound event classifiers from web audio with noisy labels,","venue":null,"work_id":"014effb1-0ef2-4825-bcc0-8a4108ce0c4e","year":2019},"citing_paper":{"arxiv_id":"2507.21642","last_updated":"2025-08-25T08:17:22Z","snapshot_observed_at":"2026-08-06T12:36:14.281703Z","submitted_at":"2025-07-29T09:58:45Z","title":"Whilter: A Whisper-based Data Filter for \"In-the-Wild\" Speech Corpora Using Utterance-level Multi-Task Classification","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T12:36:18.927422Z"},"links":{"citing_paper":"/paper/2507.21642"},"observation_digest":"sha256:b416c2a7a9fff5ca49c1f2b4617871c58cd5c59fbff68b29c076776169a93b77","observation_id":"94bc4d53-bd70-44fb-8698-49640fe024cb","resolution":{"observed_at":"2026-08-06T12:36:19.910904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:36:19.897244Z","title":"The Diverse Environments Multi-channel Acoustic Noise Database (DEMAND): A database of multichannel environmental noise recordings,","venue":null,"work_id":"a3b7de0f-0706-4991-a413-70405f1d376e","year":2013},"citing_paper":{"arxiv_id":"2507.21642","last_updated":"2025-08-25T08:17:22Z","snapshot_observed_at":"2026-08-06T12:36:14.281703Z","submitted_at":"2025-07-29T09:58:45Z","title":"Whilter: A Whisper-based Data Filter for \"In-the-Wild\" Speech Corpora Using Utterance-level Multi-Task Classification","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T12:36:18.964872Z"},"links":{"citing_paper":"/paper/2507.21642"},"observation_digest":"sha256:6ef6b7940a8a0f985878225d9572e4c95ef81029f57aae00f6df19ff31f5f067","observation_id":"071634a6-5ab4-47b2-82e3-4d333f345586","resolution":{"observed_at":"2026-08-06T12:36:19.900996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:36:19.886261Z","title":"Adam: A method for stochastic opti- mization,","venue":null,"work_id":"5e2a26a6-7e07-4412-9354-fff2f074343a","year":2015},"citing_paper":{"arxiv_id":"2507.21642","last_updated":"2025-08-25T08:17:22Z","snapshot_observed_at":"2026-08-06T12:36:14.281703Z","submitted_at":"2025-07-29T09:58:45Z","title":"Whilter: A Whisper-based Data Filter for \"In-the-Wild\" Speech Corpora Using Utterance-level Multi-Task Classification","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T12:36:19.040456Z"},"links":{"citing_paper":"/paper/2507.21642"},"observation_digest":"sha256:68b9a9adf553d22e185444164298454bd9b8d7c06543330182e8617c91fa718e","observation_id":"1bd364b6-7016-4a1a-b27a-88cae80a4116","resolution":{"observed_at":"2026-08-06T12:36:19.890136Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:36:19.876671Z","title":"Data augmen- tation for speech separation,","venue":null,"work_id":"cb68dafd-db82-4721-9db8-4b47bce57729","year":2023},"citing_paper":{"arxiv_id":"2507.21642","last_updated":"2025-08-25T08:17:22Z","snapshot_observed_at":"2026-08-06T12:36:14.281703Z","submitted_at":"2025-07-29T09:58:45Z","title":"Whilter: A Whisper-based Data Filter for \"In-the-Wild\" Speech Corpora Using Utterance-level Multi-Task Classification","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T12:36:19.120411Z"},"links":{"citing_paper":"/paper/2507.21642"},"observation_digest":"sha256:a1f2fb23c72b3f300d8b101ef650e1ca39eef74e761addf501461b421531c910","observation_id":"a5aa999c-6a45-46ea-9f94-54606eccca78","resolution":{"observed_at":"2026-08-06T12:36:19.879696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:36:19.866657Z","title":"Dnsmos: A non- intrusive perceptual objective speech quality metric to evaluate noise suppressors,","venue":null,"work_id":"e0a18a92-18c8-44e0-b921-a35965d21300","year":2021},"citing_paper":{"arxiv_id":"2507.21642","last_updated":"2025-08-25T08:17:22Z","snapshot_observed_at":"2026-08-06T12:36:14.281703Z","submitted_at":"2025-07-29T09:58:45Z","title":"Whilter: A Whisper-based Data Filter for \"In-the-Wild\" Speech Corpora Using Utterance-level Multi-Task Classification","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T12:36:19.139425Z"},"links":{"citing_paper":"/paper/2507.21642"},"observation_digest":"sha256:655dded8d6605c9fc71f111bf27f54057baea83f2875d593e75f2ee55aee6c26","observation_id":"e52c97ed-3e81-4024-aec6-8138acbdf9b0","resolution":{"observed_at":"2026-08-06T12:36:19.870112Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:36:19.783007Z","title":"Convolutional recurrent neural networks for poly- phonic sound event detection,","venue":null,"work_id":"3c9c66fd-77d3-4032-be59-bdf9108ed621","year":2017},"citing_paper":{"arxiv_id":"2507.21642","last_updated":"2025-08-25T08:17:22Z","snapshot_observed_at":"2026-08-06T12:36:14.281703Z","submitted_at":"2025-07-29T09:58:45Z","title":"Whilter: A Whisper-based Data Filter for \"In-the-Wild\" Speech Corpora Using Utterance-level Multi-Task Classification","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T12:36:19.156870Z"},"links":{"citing_paper":"/paper/2507.21642"},"observation_digest":"sha256:69e99a59ec1ed1cba6f35b34e53e5b7f0a6daac7b932e3736fc8e70fe813e05f","observation_id":"9b35680e-7f3d-4ca2-95a1-ec19dc7d79f5","resolution":{"observed_at":"2026-08-06T12:36:19.834641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:36:19.586542Z","title":"Mlaad: The multi- language audio anti-spoofing dataset,","venue":null,"work_id":"8e9b145c-0f1b-4b06-b50e-5eed0ed74351","year":2024},"citing_paper":{"arxiv_id":"2507.21642","last_updated":"2025-08-25T08:17:22Z","snapshot_observed_at":"2026-08-06T12:36:14.281703Z","submitted_at":"2025-07-29T09:58:45Z","title":"Whilter: A Whisper-based Data Filter for \"In-the-Wild\" Speech Corpora Using Utterance-level Multi-Task Classification","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T12:36:19.265120Z"},"links":{"citing_paper":"/paper/2507.21642"},"observation_digest":"sha256:bbd9e53f5181056a507ab53f650353deaf280d1bfca0857efb1ee5b3286ca46f","observation_id":"2a14e91f-c44d-491f-ab8d-9d88d3921049","resolution":{"observed_at":"2026-08-06T12:36:19.652398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.21642","last_updated":"2025-08-25T08:17:22Z","latest_version":2,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-06T12:36:14.281703Z","submitted_at":"2025-07-29T09:58:45Z","title":"Whilter: A Whisper-based Data Filter for \"In-the-Wild\" Speech Corpora Using Utterance-level Multi-Task Classification"},"reference_resolution":{"displayed":46,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":5,"verified_exact":0,"verified_fuzzy":40},"total_outbound_references":46},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 1 inbound Pith citation observation for arXiv:2507.21642."}