{"as_of":"2026-08-23T10:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f4103622d1ad9653bbb2ca7b2a6021ce551e9828a24726f776b40c1ec98f5599","coverage":[{"denominator":32,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:08:06.143496Z","state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:08:06.017812Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-10T10:19:19.988690Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.11514","last_updated":"2025-06-13T07:15:41Z","snapshot_observed_at":"2026-08-18T17:51:38.775368Z","submitted_at":"2025-06-13T07:15:41Z","title":"Efficient Speech Enhancement via Embeddings from Pre-trained Generative Audioencoders","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.11514","snapshot_observed_at":"2026-08-07T04:08:06.017812Z","title":"Most deep neu- ral network (DNN) based SE methods primarily rely on mask or signal prediction techniques with a deep-learning framework tailored towards the SE task [1]","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.11514","last_updated":"2025-06-13T07:15:41Z","snapshot_observed_at":"2026-08-18T17:51:38.775368Z","submitted_at":"2025-06-13T07:15:41Z","title":"Efficient Speech Enhancement via Embeddings from Pre-trained Generative Audioencoders","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:06.017812Z"},"links":{"cited_paper":"/paper/2506.11514","citing_paper":"/paper/2506.11514"},"observation_digest":"sha256:ad9dabc47e2daa40a596846c7a1e742db5d2f03d8b7db8ab9805bee7fe0bc2b5","observation_id":"1fb6ef98-4b73-41a4-8a9e-c6e92ab45acf","resolution":{"observed_at":"2026-08-07T04:08:06.017812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11514","last_updated":"2025-06-13T07:15:41Z","snapshot_observed_at":"2026-08-18T17:51:38.775368Z","submitted_at":"2025-06-13T07:15:41Z","title":"Efficient Speech Enhancement via Embeddings from Pre-trained Generative Audioencoders","version":1},"cited_work":{"arxiv_id":"2506.11514","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.11514","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Effi- cient speech enhancement via embeddings from pre-trained generative audioencoders","venue":null,"work_id":"16e770c5-2103-4127-99ad-b7b59ce25b0e","year":2025},"citing_paper":{"arxiv_id":"2604.14606","last_updated":"2026-07-20T08:55:18Z","snapshot_observed_at":"2026-08-12T23:58:03.604754Z","submitted_at":"2026-04-16T04:25:03Z","title":"UniPASE: A Generative Model for Universal Speech Enhancement with High Fidelity and Low Hallucinations","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T10:18:16.972414Z"},"links":{"cited_paper":"/paper/2506.11514","citing_paper":"/paper/2604.14606"},"observation_digest":"sha256:81021f9a6b72447317ef27c9ae5d407ecaf933399a0892d285577e5ffd5ee238","observation_id":"77e6b364-be2a-4fa2-bb82-994d17de1b2b","resolution":{"observed_at":"2026-05-10T10:19:19.991069Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11514","last_updated":"2025-06-13T07:15:41Z","snapshot_observed_at":"2026-08-18T17:51:38.775368Z","submitted_at":"2025-06-13T07:15:41Z","title":"Efficient Speech Enhancement via Embeddings from Pre-trained Generative Audioencoders","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.11514","snapshot_observed_at":"2026-08-02T16:16:36.656361Z","title":"Effi- cient speech enhancement via embeddings from pre-trained generative audioencoders,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.14606","last_updated":"2026-07-20T08:55:18Z","snapshot_observed_at":"2026-08-12T23:58:03.604754Z","submitted_at":"2026-04-16T04:25:03Z","title":"UniPASE: A Generative Model for Universal Speech Enhancement with High Fidelity and Low Hallucinations","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T16:16:36.656361Z"},"links":{"cited_paper":"/paper/2506.11514","citing_paper":"/paper/2604.14606"},"observation_digest":"sha256:644e73bd39ed13769013325a897ca00e98188029468a94b3eaff918eb04ae092","observation_id":"f4c60817-0e1c-417e-9df2-12aa3088217b","resolution":{"observed_at":"2026-08-02T16:16:36.656361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.11514/citation-record","integrity":"/paper/2506.11514/integrity","json":"/paper/2506.11514/citation-record.json","paper":"/paper/2506.11514"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.11514","last_updated":"2025-06-13T07:15:41Z","snapshot_observed_at":"2026-08-18T17:51:38.775368Z","submitted_at":"2025-06-13T07:15:41Z","title":"Efficient Speech Enhancement via Embeddings from Pre-trained Generative Audioencoders","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.11514","snapshot_observed_at":"2026-08-07T04:08:06.017812Z","title":"Most deep neu- ral network (DNN) based SE methods primarily rely on mask or signal prediction techniques with a deep-learning framework tailored towards the SE task [1]","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.11514","last_updated":"2025-06-13T07:15:41Z","snapshot_observed_at":"2026-08-18T17:51:38.775368Z","submitted_at":"2025-06-13T07:15:41Z","title":"Efficient Speech Enhancement via Embeddings from Pre-trained Generative Audioencoders","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:06.017812Z"},"links":{"cited_paper":"/paper/2506.11514","citing_paper":"/paper/2506.11514"},"observation_digest":"sha256:ad9dabc47e2daa40a596846c7a1e742db5d2f03d8b7db8ab9805bee7fe0bc2b5","observation_id":"1fb6ef98-4b73-41a4-8a9e-c6e92ab45acf","resolution":{"observed_at":"2026-08-07T04:08:06.017812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:06.583046Z","title":"Initially, the noisy speech is in- put into a pre-trained audioencoder, yielding a noisy embed- ding","venue":null,"work_id":"45e54e6c-eb23-4078-af07-af7d81a05ca1","year":null},"citing_paper":{"arxiv_id":"2506.11514","last_updated":"2025-06-13T07:15:41Z","snapshot_observed_at":"2026-08-18T17:51:38.775368Z","submitted_at":"2025-06-13T07:15:41Z","title":"Efficient Speech Enhancement via Embeddings from Pre-trained Generative Audioencoders","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:06.022875Z"},"links":{"citing_paper":"/paper/2506.11514"},"observation_digest":"sha256:b33ffb5059c5e91797ab386fbb226cfb77f6b6dd1421b50973f53ef66e8681bd","observation_id":"94af3400-db19-481f-aa01-a6bc7d313a5b","resolution":{"observed_at":"2026-08-07T04:08:06.587503Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:06.570844Z","title":null,"venue":null,"work_id":"d0cd2b6f-08e4-4dac-9e6b-b87fd1e61a54","year":2022},"citing_paper":{"arxiv_id":"2506.11514","last_updated":"2025-06-13T07:15:41Z","snapshot_observed_at":"2026-08-18T17:51:38.775368Z","submitted_at":"2025-06-13T07:15:41Z","title":"Efficient Speech Enhancement via Embeddings from Pre-trained Generative Audioencoders","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:06.026800Z"},"links":{"citing_paper":"/paper/2506.11514"},"observation_digest":"sha256:62f6a8c3f80ca68f73c57c00b4f631e0940a9ab7584a29da353015317ff8d782","observation_id":"b4b4b440-9b58-484d-96fe-ead2390b686c","resolution":{"observed_at":"2026-08-07T04:08:06.574670Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:06.558175Z","title":"Evaluation of Different Audioencoders Table 1 presents the evaluation results for both Valentini and the DNS1 test sets","venue":null,"work_id":"bfc2ebcd-7687-47bf-b2af-4c4a561d602a","year":null},"citing_paper":{"arxiv_id":"2506.11514","last_updated":"2025-06-13T07:15:41Z","snapshot_observed_at":"2026-08-18T17:51:38.775368Z","submitted_at":"2025-06-13T07:15:41Z","title":"Efficient Speech Enhancement via Embeddings from Pre-trained Generative Audioencoders","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:06.031169Z"},"links":{"citing_paper":"/paper/2506.11514"},"observation_digest":"sha256:0626603d6ff480c953380110e01111ba4ca991e6fe7deba2ffe65770e8e51801","observation_id":"194a25e2-3185-40aa-9539-6ba08f168309","resolution":{"observed_at":"2026-08-07T04:08:06.562295Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:06.545236Z","title":"However, we chose not to im- plement global fine-tuning due to several compelling considera- tions","venue":null,"work_id":"8fa73d04-be62-4487-851e-3da6083235f1","year":null},"citing_paper":{"arxiv_id":"2506.11514","last_updated":"2025-06-13T07:15:41Z","snapshot_observed_at":"2026-08-18T17:51:38.775368Z","submitted_at":"2025-06-13T07:15:41Z","title":"Efficient Speech Enhancement via Embeddings from Pre-trained Generative Audioencoders","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:06.035493Z"},"links":{"citing_paper":"/paper/2506.11514"},"observation_digest":"sha256:d4115116608574baf38a7ba7ecc1645d4935a78c9cb43b17d291ba79d21d8185","observation_id":"c2fc0189-b819-4ab8-8656-fae20c8e6be1","resolution":{"observed_at":"2026-08-07T04:08:06.549222Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:06.532116Z","title":"Sixty years of frequency-domain monaural speech en- hancement: From traditional to deep learning methods,","venue":null,"work_id":"7f515627-5617-47ed-ad6a-a2794acb4116","year":2023},"citing_paper":{"arxiv_id":"2506.11514","last_updated":"2025-06-13T07:15:41Z","snapshot_observed_at":"2026-08-18T17:51:38.775368Z","submitted_at":"2025-06-13T07:15:41Z","title":"Efficient Speech Enhancement via Embeddings from Pre-trained Generative Audioencoders","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:06.039635Z"},"links":{"citing_paper":"/paper/2506.11514"},"observation_digest":"sha256:572b043eece6f98bf4fc5b06147ccb34e2fa18f32faf08176a021b71e7206d9d","observation_id":"91b66f77-e406-4954-9188-4d184bf9c076","resolution":{"observed_at":"2026-08-07T04:08:06.536166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:06.518494Z","title":"Wavlm: Large-scale self- supervised pre-training for full stack speech processing,","venue":null,"work_id":"6363c990-a5d0-47ba-9e63-32a59190a8cf","year":2021},"citing_paper":{"arxiv_id":"2506.11514","last_updated":"2025-06-13T07:15:41Z","snapshot_observed_at":"2026-08-18T17:51:38.775368Z","submitted_at":"2025-06-13T07:15:41Z","title":"Efficient Speech Enhancement via Embeddings from Pre-trained Generative Audioencoders","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:06.043690Z"},"links":{"citing_paper":"/paper/2506.11514"},"observation_digest":"sha256:3d4ee107a70d9b8d5bf25b9f2696fc18b79636867d3f65cee2437715f9d21a1d","observation_id":"6a33cc81-233a-4239-b00d-ca0b57ef1ae9","resolution":{"observed_at":"2026-08-07T04:08:06.523004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:06.505397Z","title":"Investigating self-supervised learning for speech enhancement and separation,","venue":null,"work_id":"7a447d93-8b3e-4599-8d40-183a3cccabb7","year":2022},"citing_paper":{"arxiv_id":"2506.11514","last_updated":"2025-06-13T07:15:41Z","snapshot_observed_at":"2026-08-18T17:51:38.775368Z","submitted_at":"2025-06-13T07:15:41Z","title":"Efficient Speech Enhancement via Embeddings from Pre-trained Generative Audioencoders","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:06.047996Z"},"links":{"citing_paper":"/paper/2506.11514"},"observation_digest":"sha256:6c6f4298dfdb2de3923c6b579f03bdd83acd9242e5a23e17a3fd4de10db3ab9a","observation_id":"16e3ce00-193b-43c4-9cd4-dc2b0555c7d8","resolution":{"observed_at":"2026-08-07T04:08:06.509298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:06.492983Z","title":"Boosting self-supervised embeddings for speech en- hancement,","venue":null,"work_id":"a65e6e85-f0d2-4094-93e2-37db6d1ce342","year":2022},"citing_paper":{"arxiv_id":"2506.11514","last_updated":"2025-06-13T07:15:41Z","snapshot_observed_at":"2026-08-18T17:51:38.775368Z","submitted_at":"2025-06-13T07:15:41Z","title":"Efficient Speech Enhancement via Embeddings from Pre-trained Generative Audioencoders","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:06.051903Z"},"links":{"citing_paper":"/paper/2506.11514"},"observation_digest":"sha256:0e398a362f521f34c994e402a13c202fe08a707ff09f5da425ae4a979f5f7120","observation_id":"821a9334-7071-416b-90b2-b798b9e3be89","resolution":{"observed_at":"2026-08-07T04:08:06.496920Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:06.479105Z","title":"Hifi-gan-2: Studio-quality speech enhancement via generative adversarial networks condi- tioned on acoustic features,","venue":null,"work_id":"e37a04ef-101c-4098-8d47-8e604b138014","year":2021},"citing_paper":{"arxiv_id":"2506.11514","last_updated":"2025-06-13T07:15:41Z","snapshot_observed_at":"2026-08-18T17:51:38.775368Z","submitted_at":"2025-06-13T07:15:41Z","title":"Efficient Speech Enhancement via Embeddings from Pre-trained Generative Audioencoders","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:06.056333Z"},"links":{"citing_paper":"/paper/2506.11514"},"observation_digest":"sha256:3b09c68d243fc39402ac8321fb869213d8f04ca3a67042677773419d13a93031","observation_id":"9f083602-497a-453b-bdde-bdb018bfc50c","resolution":{"observed_at":"2026-08-07T04:08:06.483684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:06.465481Z","title":"Self- supervised learning for speech enhancement through synthesis,","venue":null,"work_id":"5f738a55-6c32-4cd0-9a82-a5e0a211a1b2","year":2023},"citing_paper":{"arxiv_id":"2506.11514","last_updated":"2025-06-13T07:15:41Z","snapshot_observed_at":"2026-08-18T17:51:38.775368Z","submitted_at":"2025-06-13T07:15:41Z","title":"Efficient Speech Enhancement via Embeddings from Pre-trained Generative Audioencoders","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:06.060093Z"},"links":{"citing_paper":"/paper/2506.11514"},"observation_digest":"sha256:4994f3c06e40cff5d1037b40ebfe5925416ccff8c0da2f0dc67f04b1ac097063","observation_id":"e0832bad-0498-4c6f-af4c-13bf0aa68a83","resolution":{"observed_at":"2026-08-07T04:08:06.469679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:06.452364Z","title":"Speech enhancement using self-supervised pre-trained model and vector quantization,","venue":null,"work_id":"08abeed1-364f-4e2d-989d-db9d533a4a03","year":2022},"citing_paper":{"arxiv_id":"2506.11514","last_updated":"2025-06-13T07:15:41Z","snapshot_observed_at":"2026-08-18T17:51:38.775368Z","submitted_at":"2025-06-13T07:15:41Z","title":"Efficient Speech Enhancement via Embeddings from Pre-trained Generative Audioencoders","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:06.064373Z"},"links":{"citing_paper":"/paper/2506.11514"},"observation_digest":"sha256:25a2fc15c882e41cd8a72972fe0ae6b093b493b7149a8c81a37167220e737f7a","observation_id":"8956349b-807f-4df5-940f-9aed9caa59a9","resolution":{"observed_at":"2026-08-07T04:08:06.456495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:06.439130Z","title":"Spectrum-aware neural vocoder based on self-supervised learning for speech en- hancement,","venue":null,"work_id":"93e30841-c05a-4459-933c-7a57de322d2c","year":2024},"citing_paper":{"arxiv_id":"2506.11514","last_updated":"2025-06-13T07:15:41Z","snapshot_observed_at":"2026-08-18T17:51:38.775368Z","submitted_at":"2025-06-13T07:15:41Z","title":"Efficient Speech Enhancement via Embeddings from Pre-trained Generative Audioencoders","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:06.068313Z"},"links":{"citing_paper":"/paper/2506.11514"},"observation_digest":"sha256:c87990a7a424020944fb626c9432b6f8df202f9c40454351f55aca1a9a79bcb9","observation_id":"fe672b60-c3fa-4c2c-8b61-e7df5057c781","resolution":{"observed_at":"2026-08-07T04:08:06.443339Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:06.425905Z","title":"Robust speech recognition via large-scale weak su- pervision,","venue":null,"work_id":"e876da9f-7aba-42a0-9160-a717c3cfcca6","year":2022},"citing_paper":{"arxiv_id":"2506.11514","last_updated":"2025-06-13T07:15:41Z","snapshot_observed_at":"2026-08-18T17:51:38.775368Z","submitted_at":"2025-06-13T07:15:41Z","title":"Efficient Speech Enhancement via Embeddings from Pre-trained Generative Audioencoders","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:06.072210Z"},"links":{"citing_paper":"/paper/2506.11514"},"observation_digest":"sha256:b9bc10b7d182fc8e0f2318ad46ec2bfb0cb10deaa792c511b288ed0a91513c9d","observation_id":"0600bf9b-ee11-4e26-a7ac-b8523019649c","resolution":{"observed_at":"2026-08-07T04:08:06.430102Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:06.412024Z","title":"Scaling up masked audio encoder learning for general audio clas- sification,","venue":null,"work_id":"3786d85e-3554-447c-baff-9e22f1a2a34e","year":2024},"citing_paper":{"arxiv_id":"2506.11514","last_updated":"2025-06-13T07:15:41Z","snapshot_observed_at":"2026-08-18T17:51:38.775368Z","submitted_at":"2025-06-13T07:15:41Z","title":"Efficient Speech Enhancement via Embeddings from Pre-trained Generative Audioencoders","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:06.075813Z"},"links":{"citing_paper":"/paper/2506.11514"},"observation_digest":"sha256:777b78eb0678ab29d55f871ba1d42bdf1af6298ad363ab637d53cac14dd0e6a9","observation_id":"78e45e2c-58f7-452f-8e0e-df3646513ad7","resolution":{"observed_at":"2026-08-07T04:08:06.416406Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:06.079650Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.11514","last_updated":"2025-06-13T07:15:41Z","snapshot_observed_at":"2026-08-18T17:51:38.775368Z","submitted_at":"2025-06-13T07:15:41Z","title":"Efficient Speech Enhancement via Embeddings from Pre-trained Generative Audioencoders","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:06.079650Z"},"links":{"citing_paper":"/paper/2506.11514"},"observation_digest":"sha256:0673a23552c2b90522d6a62bb257a28e03ce188d2f4a75de8f2a8e1c582ebb0b","observation_id":"8cbfa58e-d258-464d-8571-73b201d27bd7","resolution":{"observed_at":"2026-08-07T04:08:06.079650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00814","last_updated":"2024-05-29T14:21:47Z","snapshot_observed_at":"2026-08-18T17:50:53.134857Z","submitted_at":"2023-06-01T15:40:32Z","title":"Vocos: Closing the gap between time-domain and Fourier-based neural vocoders for high-quality audio synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.00814","snapshot_observed_at":"2026-08-07T04:08:06.083636Z","title":"V ocos: Closing the gap between time-domain and fourier-based neural vocoders for high-quality audio synthesis,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11514","last_updated":"2025-06-13T07:15:41Z","snapshot_observed_at":"2026-08-18T17:51:38.775368Z","submitted_at":"2025-06-13T07:15:41Z","title":"Efficient Speech Enhancement via Embeddings from Pre-trained Generative Audioencoders","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:06.083636Z"},"links":{"cited_paper":"/paper/2306.00814","citing_paper":"/paper/2506.11514"},"observation_digest":"sha256:31eb45c1a2d0ca8ef2ecbf9c80d48538f7f60b2445c143bdfb053d74f6b40622","observation_id":"b55dffe9-05b2-41cb-bde1-7f3dcca9ea0b","resolution":{"observed_at":"2026-08-07T04:08:06.083636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:06.389306Z","title":"A convnet for the 2020s,","venue":null,"work_id":"19dfcd85-29d0-4fff-9811-06bdf523c8c4","year":2022},"citing_paper":{"arxiv_id":"2506.11514","last_updated":"2025-06-13T07:15:41Z","snapshot_observed_at":"2026-08-18T17:51:38.775368Z","submitted_at":"2025-06-13T07:15:41Z","title":"Efficient Speech Enhancement via Embeddings from Pre-trained Generative Audioencoders","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:06.087859Z"},"links":{"citing_paper":"/paper/2506.11514"},"observation_digest":"sha256:685a9f80608b7a1daff779680ad9ac1cb056c5b15da8c224b9348f62126fd800","observation_id":"4e2f6a25-28f6-4f65-a319-759e50a6b672","resolution":{"observed_at":"2026-08-07T04:08:06.393348Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:06.376036Z","title":"Hifi-gan: Generative adversarial networks for efficient and high fidelity speech synthesis,","venue":null,"work_id":"fa975fe6-ded7-46b0-944c-4b5a1739ae96","year":2020},"citing_paper":{"arxiv_id":"2506.11514","last_updated":"2025-06-13T07:15:41Z","snapshot_observed_at":"2026-08-18T17:51:38.775368Z","submitted_at":"2025-06-13T07:15:41Z","title":"Efficient Speech Enhancement via Embeddings from Pre-trained Generative Audioencoders","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:06.092022Z"},"links":{"citing_paper":"/paper/2506.11514"},"observation_digest":"sha256:6e57f93296c9d1d8ef9153809ada1c189e0b71e68291a95653c5b0963c2d3a10","observation_id":"ad49f2c2-a813-4000-ba92-5c97d03bd89b","resolution":{"observed_at":"2026-08-07T04:08:06.380228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:06.363518Z","title":"Univnet: A neural vocoder with multi-resolution spectrogram discriminators for high-fidelity waveform generation,","venue":null,"work_id":"5c1320b7-9030-4691-9053-64c0c269eed3","year":2021},"citing_paper":{"arxiv_id":"2506.11514","last_updated":"2025-06-13T07:15:41Z","snapshot_observed_at":"2026-08-18T17:51:38.775368Z","submitted_at":"2025-06-13T07:15:41Z","title":"Efficient Speech Enhancement via Embeddings from Pre-trained Generative Audioencoders","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:06.095941Z"},"links":{"citing_paper":"/paper/2506.11514"},"observation_digest":"sha256:077ea2a67afc953ac736d06b9e34261e19fd53fca86cb72c209b8dac95e9febb","observation_id":"015f427d-71f2-40dc-a315-0d46202708e9","resolution":{"observed_at":"2026-08-07T04:08:06.367512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:06.350803Z","title":"Icassp 2022 deep noise suppression challenge,","venue":null,"work_id":"61b1549b-59e9-4dc0-a159-62debcae6341","year":2022},"citing_paper":{"arxiv_id":"2506.11514","last_updated":"2025-06-13T07:15:41Z","snapshot_observed_at":"2026-08-18T17:51:38.775368Z","submitted_at":"2025-06-13T07:15:41Z","title":"Efficient Speech Enhancement via Embeddings from Pre-trained Generative Audioencoders","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:06.100807Z"},"links":{"citing_paper":"/paper/2506.11514"},"observation_digest":"sha256:62475fb4233843e5b0c03b46555e59f7528d662e47fe600ce1d2641d75b71a9b","observation_id":"4e644d89-d490-4625-a027-58817d7c87e1","resolution":{"observed_at":"2026-08-07T04:08:06.354996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:06.105272Z","title":"Common voice: A massively-multilingual speech corpus,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.11514","last_updated":"2025-06-13T07:15:41Z","snapshot_observed_at":"2026-08-18T17:51:38.775368Z","submitted_at":"2025-06-13T07:15:41Z","title":"Efficient Speech Enhancement via Embeddings from Pre-trained Generative Audioencoders","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:06.105272Z"},"links":{"citing_paper":"/paper/2506.11514"},"observation_digest":"sha256:48717fa40855ccaaed89afe61c771f4a1a426ade2f67067b46443ee1d4b71964","observation_id":"005203e4-c15e-4811-856e-2cf7679a06ae","resolution":{"observed_at":"2026-08-07T04:08:06.105272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:06.328702Z","title":"The interspeech 2020 deep noise suppression challenge: Datasets, subjective testing framework, and challenge results,","venue":null,"work_id":"b0e2c77e-d3b8-44d8-b535-79d9f6534eaf","year":2020},"citing_paper":{"arxiv_id":"2506.11514","last_updated":"2025-06-13T07:15:41Z","snapshot_observed_at":"2026-08-18T17:51:38.775368Z","submitted_at":"2025-06-13T07:15:41Z","title":"Efficient Speech Enhancement via Embeddings from Pre-trained Generative Audioencoders","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:06.109077Z"},"links":{"citing_paper":"/paper/2506.11514"},"observation_digest":"sha256:08873a7529b16917dd8e22b21afd01549b5142e6fa24b459e28026090f7a278c","observation_id":"177b6447-70a6-4449-bf7a-42d62939e550","resolution":{"observed_at":"2026-08-07T04:08:06.332913Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:06.112729Z","title":"Noisy speech database for training speech enhancement algorithms and tts models,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.11514","last_updated":"2025-06-13T07:15:41Z","snapshot_observed_at":"2026-08-18T17:51:38.775368Z","submitted_at":"2025-06-13T07:15:41Z","title":"Efficient Speech Enhancement via Embeddings from Pre-trained Generative Audioencoders","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:06.112729Z"},"links":{"citing_paper":"/paper/2506.11514"},"observation_digest":"sha256:91144035f52dd4620b5cd8742afb4a89fc089a0b4b0e2b87f22a5348597acbec","observation_id":"4d0a91ee-a820-488a-9f06-5800ad7b1933","resolution":{"observed_at":"2026-08-07T04:08:06.112729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:06.305379Z","title":"An al- gorithm for intelligibility prediction of time–frequency weighted noisy speech,","venue":null,"work_id":"5cac0ed4-fe29-4b5c-a6a0-78ef2fa6eac5","year":2011},"citing_paper":{"arxiv_id":"2506.11514","last_updated":"2025-06-13T07:15:41Z","snapshot_observed_at":"2026-08-18T17:51:38.775368Z","submitted_at":"2025-06-13T07:15:41Z","title":"Efficient Speech Enhancement via Embeddings from Pre-trained Generative Audioencoders","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:06.116431Z"},"links":{"citing_paper":"/paper/2506.11514"},"observation_digest":"sha256:1f73300da25698d12aadccc4f0e83a3143c2de1fc0092b2c141d02eb340ddbfd","observation_id":"f08c71a4-10d8-4eda-b6ca-fda006edfadb","resolution":{"observed_at":"2026-08-07T04:08:06.309820Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:06.290750Z","title":"Perceptual eval- uation of speech quality (pesq)-a new method for speech quality assessment of telephone networks and codecs,","venue":null,"work_id":"e2326f48-7156-4a1f-949a-c7fbbb54abf2","year":2001},"citing_paper":{"arxiv_id":"2506.11514","last_updated":"2025-06-13T07:15:41Z","snapshot_observed_at":"2026-08-18T17:51:38.775368Z","submitted_at":"2025-06-13T07:15:41Z","title":"Efficient Speech Enhancement via Embeddings from Pre-trained Generative Audioencoders","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:06.120228Z"},"links":{"citing_paper":"/paper/2506.11514"},"observation_digest":"sha256:8d00bdc4b4cba50ab6c48d4174444e5a479ab25c5d0c8c60f2e97658faa15e78","observation_id":"8687c7b8-5ffd-4cfe-bec6-099e4f21ea80","resolution":{"observed_at":"2026-08-07T04:08:06.295494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:06.275738Z","title":"Dnsmos p.835: A non- intrusive perceptual objective speech quality metric to evaluate noise suppressors,","venue":null,"work_id":"74890050-9e02-43eb-9520-abf412f6ca7d","year":2022},"citing_paper":{"arxiv_id":"2506.11514","last_updated":"2025-06-13T07:15:41Z","snapshot_observed_at":"2026-08-18T17:51:38.775368Z","submitted_at":"2025-06-13T07:15:41Z","title":"Efficient Speech Enhancement via Embeddings from Pre-trained Generative Audioencoders","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:06.123903Z"},"links":{"citing_paper":"/paper/2506.11514"},"observation_digest":"sha256:3eaca334a2a433ff17f52e12338e4d14c636bf983159cf17f259a75ec6eac116","observation_id":"57492f85-3f4b-4f85-9444-402d7b3764e1","resolution":{"observed_at":"2026-08-07T04:08:06.280596Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:06.262390Z","title":"Nisqa: A deep cnn-self-attention model for multidimensional speech quality pre- diction with crowdsourced datasets,","venue":null,"work_id":"0af8f4a3-42fb-49fd-a56b-e5b61c27edc0","year":2021},"citing_paper":{"arxiv_id":"2506.11514","last_updated":"2025-06-13T07:15:41Z","snapshot_observed_at":"2026-08-18T17:51:38.775368Z","submitted_at":"2025-06-13T07:15:41Z","title":"Efficient Speech Enhancement via Embeddings from Pre-trained Generative Audioencoders","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:06.127704Z"},"links":{"citing_paper":"/paper/2506.11514"},"observation_digest":"sha256:395cf201128e145b639a48e5b7f08e057bf1b49ad0c9b5b2959f5985a126ad00","observation_id":"15e528b2-7e8b-4eae-b1ad-105d3314341e","resolution":{"observed_at":"2026-08-07T04:08:06.266520Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:06.249187Z","title":"Ecapa-tdnn: Emphasized channel attention, propagation and aggregation in tdnn based speaker verification,","venue":null,"work_id":"b48661d4-5805-47da-8329-71e2dd929370","year":2020},"citing_paper":{"arxiv_id":"2506.11514","last_updated":"2025-06-13T07:15:41Z","snapshot_observed_at":"2026-08-18T17:51:38.775368Z","submitted_at":"2025-06-13T07:15:41Z","title":"Efficient Speech Enhancement via Embeddings from Pre-trained Generative Audioencoders","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:06.132112Z"},"links":{"citing_paper":"/paper/2506.11514"},"observation_digest":"sha256:f5643223ceb2395ad36be4013e38bcf62729457dec1c8f64a72512eaf6471d6c","observation_id":"ad22ee1e-d929-40c3-9c52-12ed827488c8","resolution":{"observed_at":"2026-08-07T04:08:06.253228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04624","last_updated":"2021-06-08T18:22:56Z","snapshot_observed_at":"2026-08-18T17:51:41.801692Z","submitted_at":"2021-06-08T18:22:56Z","title":"SpeechBrain: A General-Purpose Speech Toolkit","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.04624","snapshot_observed_at":"2026-08-07T04:08:06.135814Z","title":"Speechbrain: A general-purpose speech toolkit,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.11514","last_updated":"2025-06-13T07:15:41Z","snapshot_observed_at":"2026-08-18T17:51:38.775368Z","submitted_at":"2025-06-13T07:15:41Z","title":"Efficient Speech Enhancement via Embeddings from Pre-trained Generative Audioencoders","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:06.135814Z"},"links":{"cited_paper":"/paper/2106.04624","citing_paper":"/paper/2506.11514"},"observation_digest":"sha256:e1033aa9aa7173d1469830ac3ddf90da1d583e61afaf4c104ac344b2bf310d6f","observation_id":"547890db-6148-43a1-bb24-5a7551e09fc2","resolution":{"observed_at":"2026-08-07T04:08:06.135814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:06.235159Z","title":"Real time speech en- hancement in the waveform domain,","venue":null,"work_id":"db52b89b-f6ed-45ed-ae0f-3f7d052f6e7f","year":2020},"citing_paper":{"arxiv_id":"2506.11514","last_updated":"2025-06-13T07:15:41Z","snapshot_observed_at":"2026-08-18T17:51:38.775368Z","submitted_at":"2025-06-13T07:15:41Z","title":"Efficient Speech Enhancement via Embeddings from Pre-trained Generative Audioencoders","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:06.139729Z"},"links":{"citing_paper":"/paper/2506.11514"},"observation_digest":"sha256:62f5a2fd6d73e53398f71bf27f79fa76763965a682b280ba1ec8b138fc3e0a1d","observation_id":"e729d878-91b3-4dd4-b71b-e68afae2f094","resolution":{"observed_at":"2026-08-07T04:08:06.239477Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:06.218625Z","title":"P.808 : Subjective evaluation of speech quality with a crowdsourcing approach,","venue":null,"work_id":"71c7d698-9aa8-4db9-b7fd-c3bbf75af0eb","year":2015},"citing_paper":{"arxiv_id":"2506.11514","last_updated":"2025-06-13T07:15:41Z","snapshot_observed_at":"2026-08-18T17:51:38.775368Z","submitted_at":"2025-06-13T07:15:41Z","title":"Efficient Speech Enhancement via Embeddings from Pre-trained Generative Audioencoders","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:06.143496Z"},"links":{"citing_paper":"/paper/2506.11514"},"observation_digest":"sha256:a3feee94d9025a6f79683f036e7a02a39c2417362aae33cf12d7ada249897d8c","observation_id":"9a4e8460-b046-440e-8539-0933f6079dc0","resolution":{"observed_at":"2026-08-07T04:08:06.225129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.11514","last_updated":"2025-06-13T07:15:41Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-18T17:51:38.775368Z","submitted_at":"2025-06-13T07:15:41Z","title":"Efficient Speech Enhancement via Embeddings from Pre-trained Generative Audioencoders"},"reference_resolution":{"displayed":32,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":7,"verified_exact":0,"verified_fuzzy":25},"total_outbound_references":32},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 32 of 32 outbound references and 3 inbound Pith citation observations for arXiv:2506.11514."}