{"as_of":"2026-08-23T05:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:92f4688c9ecbad1795b3e1e689db9275b70984f509fe6d51e3df9ee67f8cc21f","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":51,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T00:00:56.674087Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T12:57:07.566849Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2005.11262","last_updated":"2020-05-22T16:26:54Z","snapshot_observed_at":"2026-08-15T22:07:29.787968Z","submitted_at":"2020-05-22T16:26:54Z","title":"LibriMix: An Open-Source Dataset for Generalizable Speech Separation","version":1},"cited_work":{"arxiv_id":"2005.11262","doi":null,"metadata_source":"pith","pith_arxiv_id":"2005.11262","snapshot_observed_at":"2026-07-10T12:57:07.566849Z","title":"LibriMix: An open-source dataset for generalizable speech separation","venue":"eess.AS","work_id":"53c02064-c23e-434f-825d-3b1af09a75aa","year":2020},"citing_paper":{"arxiv_id":"2310.13289","last_updated":"2024-04-08T06:12:52Z","snapshot_observed_at":"2026-08-21T12:15:18.108504Z","submitted_at":"2023-10-20T05:41:57Z","title":"SALMONN: Towards Generic Hearing Abilities for Large Language Models","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-18T02:29:46.242983Z"},"links":{"cited_paper":"/paper/2005.11262","citing_paper":"/paper/2310.13289"},"observation_digest":"sha256:f38a1ca6c07f5c0ee7304eeafaf9659c2d67987eeeb612ab8638daad05806a67","observation_id":"f06a28ed-bbef-477f-a65c-e419aab2f783","resolution":{"observed_at":"2026-05-18T02:29:46.414801Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.11262","last_updated":"2020-05-22T16:26:54Z","snapshot_observed_at":"2026-08-15T22:07:29.787968Z","submitted_at":"2020-05-22T16:26:54Z","title":"LibriMix: An Open-Source Dataset for Generalizable Speech Separation","version":1},"cited_work":{"arxiv_id":"2005.11262","doi":null,"metadata_source":"pith","pith_arxiv_id":"2005.11262","snapshot_observed_at":"2026-07-10T12:57:07.566849Z","title":"LibriMix: An open-source dataset for generalizable speech separation","venue":"eess.AS","work_id":"53c02064-c23e-434f-825d-3b1af09a75aa","year":2020},"citing_paper":{"arxiv_id":"2406.14294","last_updated":"2026-04-21T15:27:17Z","snapshot_observed_at":"2026-08-21T09:03:34.163087Z","submitted_at":"2024-06-20T13:23:27Z","title":"DASB - Discrete Audio and Speech Benchmark","version":4},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-24T00:26:57.419537Z"},"links":{"cited_paper":"/paper/2005.11262","citing_paper":"/paper/2406.14294"},"observation_digest":"sha256:412f45688e9dceccb5783c571fc96a52af64a48854494c12d0e6e873b69ac25a","observation_id":"5332612a-c249-475b-b45f-46194f927f85","resolution":{"observed_at":"2026-05-24T00:28:39.512180Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.11262","last_updated":"2020-05-22T16:26:54Z","snapshot_observed_at":"2026-08-15T22:07:29.787968Z","submitted_at":"2020-05-22T16:26:54Z","title":"LibriMix: An Open-Source Dataset for Generalizable Speech Separation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.11262","snapshot_observed_at":"2026-08-12T21:44:06.821525Z","title":"LibriMix: An Open-Source Dataset for Generalizable Speech Separation,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2411.08375","last_updated":"2024-11-13T06:55:18Z","snapshot_observed_at":"2026-08-18T17:07:31.351154Z","submitted_at":"2024-11-13T06:55:18Z","title":"Developing an Effective Training Dataset to Enhance the Performance of AI-based Speaker Separation Systems","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T21:44:06.821525Z"},"links":{"cited_paper":"/paper/2005.11262","citing_paper":"/paper/2411.08375"},"observation_digest":"sha256:f0f33dad55295052f4c800c6bd91463d60b4387ab2ec7dc199f6d935a38739d0","observation_id":"22292930-4f3e-4ae9-bc5d-9aee646b3d76","resolution":{"observed_at":"2026-08-12T21:44:06.821525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.11262","last_updated":"2020-05-22T16:26:54Z","snapshot_observed_at":"2026-08-15T22:07:29.787968Z","submitted_at":"2020-05-22T16:26:54Z","title":"LibriMix: An Open-Source Dataset for Generalizable Speech Separation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.11262","snapshot_observed_at":"2026-08-12T16:47:25.997599Z","title":"Librimix: An open-source dataset for generalizable speech separation,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2411.14489","last_updated":"2024-11-20T11:37:14Z","snapshot_observed_at":"2026-08-15T22:08:18.123890Z","submitted_at":"2024-11-20T11:37:14Z","title":"GhostRNN: Reducing State Redundancy in RNN with Cheap Operations","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T16:47:25.997599Z"},"links":{"cited_paper":"/paper/2005.11262","citing_paper":"/paper/2411.14489"},"observation_digest":"sha256:08dc74cb2c998aa779d568f4f04bbeb86418815801bb33a45f7b6fa3cefdc75b","observation_id":"7619ca74-a52c-444c-9310-ace1ec8b0838","resolution":{"observed_at":"2026-08-12T16:47:25.997599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.11262","last_updated":"2020-05-22T16:26:54Z","snapshot_observed_at":"2026-08-15T22:07:29.787968Z","submitted_at":"2020-05-22T16:26:54Z","title":"LibriMix: An Open-Source Dataset for Generalizable Speech Separation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.11262","snapshot_observed_at":"2026-08-12T11:53:09.715229Z","title":"Librimix: An open-source dataset for generalizable speech separation","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.17846","last_updated":"2024-11-26T19:57:40Z","snapshot_observed_at":"2026-08-22T05:47:35.658228Z","submitted_at":"2024-11-26T19:57:40Z","title":"Disentangled-Transformer: An Explainable End-to-End Automatic Speech Recognition Model with Speech Content-Context Separation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T11:53:09.715229Z"},"links":{"cited_paper":"/paper/2005.11262","citing_paper":"/paper/2411.17846"},"observation_digest":"sha256:8184e561267ce452f0242668b7e431320b4d9c73b4a7f9bf3b8a68d09d401016","observation_id":"1c55b051-41f8-4025-b770-15c63041707e","resolution":{"observed_at":"2026-08-12T11:53:09.715229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.11262","last_updated":"2020-05-22T16:26:54Z","snapshot_observed_at":"2026-08-15T22:07:29.787968Z","submitted_at":"2020-05-22T16:26:54Z","title":"LibriMix: An Open-Source Dataset for Generalizable Speech Separation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.11262","snapshot_observed_at":"2026-08-12T11:12:18.051999Z","title":"Librimix: An open-source dataset for generalizable speech separation,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2411.18497","last_updated":"2024-11-27T16:38:34Z","snapshot_observed_at":"2026-08-19T20:53:28.293828Z","submitted_at":"2024-11-27T16:38:34Z","title":"Multiple Choice Learning for Efficient Speech Separation with Many Speakers","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T11:12:18.051999Z"},"links":{"cited_paper":"/paper/2005.11262","citing_paper":"/paper/2411.18497"},"observation_digest":"sha256:934d702b8ce2b46cb22188963bb8f9111e374231968e4e0f5403852a79f87559","observation_id":"06a52b33-ee20-4967-bd55-5f50280b74fd","resolution":{"observed_at":"2026-08-12T11:12:18.051999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.11262","last_updated":"2020-05-22T16:26:54Z","snapshot_observed_at":"2026-08-15T22:07:29.787968Z","submitted_at":"2020-05-22T16:26:54Z","title":"LibriMix: An Open-Source Dataset for Generalizable Speech Separation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.11262","snapshot_observed_at":"2026-08-11T20:38:17.114106Z","title":"LibriMix: An open-source dataset for generalizable speech separation,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2412.05589","last_updated":"2024-12-07T08:53:37Z","snapshot_observed_at":"2026-08-17T03:35:48.801522Z","submitted_at":"2024-12-07T08:53:37Z","title":"SQ-Whisper: Speaker-Querying based Whisper Model for Target-Speaker ASR","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T20:38:17.114106Z"},"links":{"cited_paper":"/paper/2005.11262","citing_paper":"/paper/2412.05589"},"observation_digest":"sha256:42236db2a32e7cf0faeeb809523e1e7b04fc2d24258d4808e3484612434e55b2","observation_id":"076ef45a-78c9-4184-bbc0-9457f5f1c265","resolution":{"observed_at":"2026-08-11T20:38:17.114106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.11262","last_updated":"2020-05-22T16:26:54Z","snapshot_observed_at":"2026-08-15T22:07:29.787968Z","submitted_at":"2020-05-22T16:26:54Z","title":"LibriMix: An Open-Source Dataset for Generalizable Speech Separation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.11262","snapshot_observed_at":"2026-08-11T14:05:25.840587Z","title":"LibriMix: An open-source dataset for generalizable speech separation,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2412.12512","last_updated":"2024-12-17T04:06:53Z","snapshot_observed_at":"2026-08-12T06:01:15.050371Z","submitted_at":"2024-12-17T04:06:53Z","title":"Libri2Vox Dataset: Target Speaker Extraction with Diverse Speaker Conditions and Synthetic Data","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T14:05:25.840587Z"},"links":{"cited_paper":"/paper/2005.11262","citing_paper":"/paper/2412.12512"},"observation_digest":"sha256:0efc0439185b7747cb2107f37fb358567cf6f5813208157a10af9c8e7a3f8c7e","observation_id":"da9cba9c-7934-4220-bc05-bfe2a49c4a1f","resolution":{"observed_at":"2026-08-11T14:05:25.840587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.11262","last_updated":"2020-05-22T16:26:54Z","snapshot_observed_at":"2026-08-15T22:07:29.787968Z","submitted_at":"2020-05-22T16:26:54Z","title":"LibriMix: An Open-Source Dataset for Generalizable Speech Separation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.11262","snapshot_observed_at":"2026-08-11T11:52:02.153325Z","title":"Librimix: An open-source dataset for generalizable speech separation,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2412.14890","last_updated":"2024-12-19T14:21:51Z","snapshot_observed_at":"2026-08-15T22:08:17.555534Z","submitted_at":"2024-12-19T14:21:51Z","title":"Scale This, Not That: Investigating Key Dataset Attributes for Efficient Speech Enhancement Scaling","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:02.153325Z"},"links":{"cited_paper":"/paper/2005.11262","citing_paper":"/paper/2412.14890"},"observation_digest":"sha256:e75359acc730a1309bd2b5dc87f39ce726c45174e2da82c7ab49f2efe5186f5a","observation_id":"9b206c6c-41e4-4e62-9b8a-9e0cee88fcb7","resolution":{"observed_at":"2026-08-11T11:52:02.153325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.11262","last_updated":"2020-05-22T16:26:54Z","snapshot_observed_at":"2026-08-15T22:07:29.787968Z","submitted_at":"2020-05-22T16:26:54Z","title":"LibriMix: An Open-Source Dataset for Generalizable Speech Separation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.11262","snapshot_observed_at":"2026-08-10T21:18:15.115417Z","title":"Librimix: An open-source dataset for generalizable speech separation,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2501.05332","last_updated":"2025-01-09T15:58:37Z","snapshot_observed_at":"2026-08-17T21:00:47.299648Z","submitted_at":"2025-01-09T15:58:37Z","title":"AnCoGen: Analysis, Control and Generation of Speech with a Masked Autoencoder","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:15.115417Z"},"links":{"cited_paper":"/paper/2005.11262","citing_paper":"/paper/2501.05332"},"observation_digest":"sha256:f969f81dd3fc8efac630983f81036eecce643e0cd194907a36aebd526c1689d9","observation_id":"2f270ae9-7702-4761-bae5-017a66649232","resolution":{"observed_at":"2026-08-10T21:18:15.115417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.11262","last_updated":"2020-05-22T16:26:54Z","snapshot_observed_at":"2026-08-15T22:07:29.787968Z","submitted_at":"2020-05-22T16:26:54Z","title":"LibriMix: An Open-Source Dataset for Generalizable Speech Separation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.11262","snapshot_observed_at":"2026-08-10T20:14:00.691235Z","title":"LibriMix: An open-source dataset for generalizable speech separation,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2501.09169","last_updated":"2025-01-15T21:43:49Z","snapshot_observed_at":"2026-08-18T03:49:15.307316Z","submitted_at":"2025-01-15T21:43:49Z","title":"Beyond Speaker Identity: Text Guided Target Speech Extraction","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:00.691235Z"},"links":{"cited_paper":"/paper/2005.11262","citing_paper":"/paper/2501.09169"},"observation_digest":"sha256:551c4f17f1fa87a8044c6743a81cc5ccd03804825a08868aed4cc5761feb2828","observation_id":"2335e1c5-3911-4214-a303-5b7847321c5f","resolution":{"observed_at":"2026-08-10T20:14:00.691235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.11262","last_updated":"2020-05-22T16:26:54Z","snapshot_observed_at":"2026-08-15T22:07:29.787968Z","submitted_at":"2020-05-22T16:26:54Z","title":"LibriMix: An Open-Source Dataset for Generalizable Speech Separation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.11262","snapshot_observed_at":"2026-08-10T17:51:53.013194Z","title":"LibriMix: An open-source dataset for generalizable speech separation,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2501.11837","last_updated":"2025-01-21T02:48:00Z","snapshot_observed_at":"2026-08-16T17:52:46.418873Z","submitted_at":"2025-01-21T02:48:00Z","title":"30+ Years of Source Separation Research: Achievements and Future Challenges","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-10T17:51:53.013194Z"},"links":{"cited_paper":"/paper/2005.11262","citing_paper":"/paper/2501.11837"},"observation_digest":"sha256:2eac6b36d0845ad9e7a288a6e82a8cbba7daccadbcecaf1ea9d7bb4d7d7d5e88","observation_id":"8a1bfd48-365e-4c1f-a900-2edd009a2537","resolution":{"observed_at":"2026-08-10T17:51:53.013194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.11262","last_updated":"2020-05-22T16:26:54Z","snapshot_observed_at":"2026-08-15T22:07:29.787968Z","submitted_at":"2020-05-22T16:26:54Z","title":"LibriMix: An Open-Source Dataset for Generalizable Speech Separation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.11262","snapshot_observed_at":"2026-08-09T05:54:18.471270Z","title":"Librimix: An open-source dataset for generalizable speech separation","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-18T17:13:14.270187Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.471270Z"},"links":{"cited_paper":"/paper/2005.11262","citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:7a5954fe65f1c1918f0f29ebb0528313ce4d690bf0a9692369c6f82bf1a2c06e","observation_id":"81187307-ea8b-4b5f-8e4b-937abbb286a9","resolution":{"observed_at":"2026-08-09T05:54:18.471270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.11262","last_updated":"2020-05-22T16:26:54Z","snapshot_observed_at":"2026-08-15T22:07:29.787968Z","submitted_at":"2020-05-22T16:26:54Z","title":"LibriMix: An Open-Source Dataset for Generalizable Speech Separation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.11262","snapshot_observed_at":"2026-08-16T00:00:56.674087Z","title":"Librimix: An open-source dataset for generalizable speech separation.CoRR, abs/2005.11262,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.03273","last_updated":"2025-05-26T07:01:19Z","snapshot_observed_at":"2026-08-20T00:13:42.436149Z","submitted_at":"2025-05-06T08:04:37Z","title":"SepALM: Audio Language Models Are Error Correctors for Robust Speech Separation","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-16T00:00:56.674087Z"},"links":{"cited_paper":"/paper/2005.11262","citing_paper":"/paper/2505.03273"},"observation_digest":"sha256:707c0b0d9ccabd6487bca0e76c9ebed8958d3b20a1ef0768f99cadcc59c17a11","observation_id":"5722bfab-470e-4d5b-a8d8-f126a78667b0","resolution":{"observed_at":"2026-08-16T00:00:56.674087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.11262","last_updated":"2020-05-22T16:26:54Z","snapshot_observed_at":"2026-08-15T22:07:29.787968Z","submitted_at":"2020-05-22T16:26:54Z","title":"LibriMix: An Open-Source Dataset for Generalizable Speech Separation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.11262","snapshot_observed_at":"2026-08-15T22:40:24.353352Z","title":"LibriMix: An open-source dataset for generalizable speech separation,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.06660","last_updated":"2025-05-10T14:23:37Z","snapshot_observed_at":"2026-08-15T22:34:33.223713Z","submitted_at":"2025-05-10T14:23:37Z","title":"TS-SUPERB: A Target Speech Processing Benchmark for Speech Self-Supervised Learning Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T22:40:24.353352Z"},"links":{"cited_paper":"/paper/2005.11262","citing_paper":"/paper/2505.06660"},"observation_digest":"sha256:444a1af4129f40f71f1b80d333d283879658f65e2389a2d70e5996b7386cb9a3","observation_id":"8ef09ace-19ae-419c-9c2c-3c6142c2b8d0","resolution":{"observed_at":"2026-08-15T22:40:24.353352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.11262","last_updated":"2020-05-22T16:26:54Z","snapshot_observed_at":"2026-08-15T22:07:29.787968Z","submitted_at":"2020-05-22T16:26:54Z","title":"LibriMix: An Open-Source Dataset for Generalizable Speech Separation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.11262","snapshot_observed_at":"2026-08-15T21:03:17.999940Z","title":"arXiv:2005.11262","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.10975","last_updated":"2026-05-27T20:17:05Z","snapshot_observed_at":"2026-08-19T08:21:18.467991Z","submitted_at":"2025-05-16T08:21:59Z","title":"Survey of End-to-End Multi-Speaker Automatic Speech Recognition for Monaural Audio","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T21:03:17.999940Z"},"links":{"cited_paper":"/paper/2005.11262","citing_paper":"/paper/2505.10975"},"observation_digest":"sha256:ac9800ea3576966fe904e8973b9961cf942fd4defb255fd6a4bebf53671f9583","observation_id":"80573499-0b52-463e-9876-63d12850ee2c","resolution":{"observed_at":"2026-08-15T21:03:17.999940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.11262","last_updated":"2020-05-22T16:26:54Z","snapshot_observed_at":"2026-08-15T22:07:29.787968Z","submitted_at":"2020-05-22T16:26:54Z","title":"LibriMix: An Open-Source Dataset for Generalizable Speech Separation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.11262","snapshot_observed_at":"2026-08-15T20:46:07.504201Z","title":"Librimix: An open-source dataset for generalizable speech separation.arXiv preprint arXiv:2005.11262, 2020","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.12079","last_updated":"2025-05-17T16:44:38Z","snapshot_observed_at":"2026-08-20T00:02:15.465307Z","submitted_at":"2025-05-17T16:44:38Z","title":"SepPrune: Structured Pruning for Efficient Deep Speech Separation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T20:46:07.504201Z"},"links":{"cited_paper":"/paper/2005.11262","citing_paper":"/paper/2505.12079"},"observation_digest":"sha256:9d6cac6f8fc8a512587b8cee339bbf8a96fd3f48e3e36e0c3d15c3215d1155b2","observation_id":"28cd140d-fb11-42d0-9430-6f8f5f4c2bbc","resolution":{"observed_at":"2026-08-15T20:46:07.504201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.11262","last_updated":"2020-05-22T16:26:54Z","snapshot_observed_at":"2026-08-15T22:07:29.787968Z","submitted_at":"2020-05-22T16:26:54Z","title":"LibriMix: An Open-Source Dataset for Generalizable Speech Separation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.11262","snapshot_observed_at":"2026-08-15T20:43:27.359520Z","title":"LibriMix: An open-source dataset for generalizable speech separation,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.12288","last_updated":"2026-07-12T11:39:40Z","snapshot_observed_at":"2026-08-15T22:08:19.121467Z","submitted_at":"2025-05-18T08:01:12Z","title":"Unified Architecture and Unsupervised Speech Disentanglement for Speaker Embedding-Free Enrollment in Personalized Speech Enhancement","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:27.359520Z"},"links":{"cited_paper":"/paper/2005.11262","citing_paper":"/paper/2505.12288"},"observation_digest":"sha256:77c802d0a1c9b3f6505d8305cff5608972b9eee43b286427995eeb1ad257d04b","observation_id":"6771830a-7bab-4547-bc47-dae05fc4360c","resolution":{"observed_at":"2026-08-15T20:43:27.359520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.11262","last_updated":"2020-05-22T16:26:54Z","snapshot_observed_at":"2026-08-15T22:07:29.787968Z","submitted_at":"2020-05-22T16:26:54Z","title":"LibriMix: An Open-Source Dataset for Generalizable Speech Separation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.11262","snapshot_observed_at":"2026-08-15T20:23:17.354936Z","title":"Librimix: An open-source dataset for generalizable speech separation,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.13094","last_updated":"2025-05-19T13:25:51Z","snapshot_observed_at":"2026-08-23T05:51:30.966000Z","submitted_at":"2025-05-19T13:25:51Z","title":"Time-Frequency-Based Attention Cache Memory Model for Real-Time Speech Separation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T20:23:17.354936Z"},"links":{"cited_paper":"/paper/2005.11262","citing_paper":"/paper/2505.13094"},"observation_digest":"sha256:b8535cd18f56e023e03e46427c4fc75dddfae0c075cea9e4cbefdab038f13560","observation_id":"991ebbc0-4aa7-47a7-8982-912d1144ade2","resolution":{"observed_at":"2026-08-15T20:23:17.354936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.11262","last_updated":"2020-05-22T16:26:54Z","snapshot_observed_at":"2026-08-15T22:07:29.787968Z","submitted_at":"2020-05-22T16:26:54Z","title":"LibriMix: An Open-Source Dataset for Generalizable Speech Separation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.11262","snapshot_observed_at":"2026-08-07T15:38:39.245802Z","title":"Librimix: An open-source dataset for generalizable speech separation,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.14517","last_updated":"2025-05-20T15:43:55Z","snapshot_observed_at":"2026-08-22T00:53:32.465523Z","submitted_at":"2025-05-20T15:43:55Z","title":"Steering Deep Non-Linear Spatially Selective Filters for Weakly Guided Extraction of Moving Speakers in Dynamic Scenarios","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:39.245802Z"},"links":{"cited_paper":"/paper/2005.11262","citing_paper":"/paper/2505.14517"},"observation_digest":"sha256:e528d5dbf954fc979e34ec1800021b1b11d8f157b26d04d4d62008ee13055b0f","observation_id":"3b9ba10c-8545-4541-a349-57e46c218f8d","resolution":{"observed_at":"2026-08-07T15:38:39.245802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.11262","last_updated":"2020-05-22T16:26:54Z","snapshot_observed_at":"2026-08-15T22:07:29.787968Z","submitted_at":"2020-05-22T16:26:54Z","title":"LibriMix: An Open-Source Dataset for Generalizable Speech Separation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.11262","snapshot_observed_at":"2026-08-07T14:22:07.278378Z","title":"Librimix: An open-source dataset for generalizable speech separation,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-16T21:46:14.592221Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.278378Z"},"links":{"cited_paper":"/paper/2005.11262","citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:383eb5a294786b2c778edd3699fccf84c4cc5c481e0b467ab799704e8dd0a68e","observation_id":"ff992483-89bd-4c28-8710-1079063a1ac4","resolution":{"observed_at":"2026-08-07T14:22:07.278378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.11262","last_updated":"2020-05-22T16:26:54Z","snapshot_observed_at":"2026-08-15T22:07:29.787968Z","submitted_at":"2020-05-22T16:26:54Z","title":"LibriMix: An Open-Source Dataset for Generalizable Speech Separation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.11262","snapshot_observed_at":"2026-08-07T13:28:29.445402Z","title":"Librimix: An open-source dataset for generalizable speech separation,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.21805","last_updated":"2025-05-27T22:21:58Z","snapshot_observed_at":"2026-08-15T22:09:03.130742Z","submitted_at":"2025-05-27T22:21:58Z","title":"An Investigation on Speaker Augmentation for End-to-End Speaker Extraction","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T13:28:29.445402Z"},"links":{"cited_paper":"/paper/2005.11262","citing_paper":"/paper/2505.21805"},"observation_digest":"sha256:855aaa3b0a2bbd91efcb91915b7061a7e407d97d249761f7e8a05aae91c55634","observation_id":"62add7c9-64bb-4ba3-98ad-d7324cb2cdc9","resolution":{"observed_at":"2026-08-07T13:28:29.445402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.11262","last_updated":"2020-05-22T16:26:54Z","snapshot_observed_at":"2026-08-15T22:07:29.787968Z","submitted_at":"2020-05-22T16:26:54Z","title":"LibriMix: An Open-Source Dataset for Generalizable Speech Separation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.11262","snapshot_observed_at":"2026-08-07T13:02:17.367614Z","title":"Librimix: An open-source dataset for generalizable speech separation,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.23036","last_updated":"2025-05-29T03:22:59Z","snapshot_observed_at":"2026-08-17T17:33:02.515564Z","submitted_at":"2025-05-29T03:22:59Z","title":"AISHELL-5: The First Open-Source In-Car Multi-Channel Multi-Speaker Speech Dataset for Automatic Speech Diarization and Recognition","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:17.367614Z"},"links":{"cited_paper":"/paper/2005.11262","citing_paper":"/paper/2505.23036"},"observation_digest":"sha256:7a2c826200d27197a6f5cbafcafe9bc9c6ec734d26da308f1014a23625fdf6bc","observation_id":"fdbc0bb6-2d51-466e-966c-b009ac9d16e8","resolution":{"observed_at":"2026-08-07T13:02:17.367614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.11262","last_updated":"2020-05-22T16:26:54Z","snapshot_observed_at":"2026-08-15T22:07:29.787968Z","submitted_at":"2020-05-22T16:26:54Z","title":"LibriMix: An Open-Source Dataset for Generalizable Speech Separation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.11262","snapshot_observed_at":"2026-08-07T12:09:31.011992Z","title":"Librimix: An open-source dataset for generalizable speech separation,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2506.12059","last_updated":"2025-05-31T07:26:44Z","snapshot_observed_at":"2026-08-20T06:08:30.989810Z","submitted_at":"2025-05-31T07:26:44Z","title":"CMT-LLM: Contextual Multi-Talker ASR Utilizing Large Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:31.011992Z"},"links":{"cited_paper":"/paper/2005.11262","citing_paper":"/paper/2506.12059"},"observation_digest":"sha256:dbc186f7f98a8e1fac23ee7c46563e5e74ad11242976471aafbc029ea255504f","observation_id":"c9f657fd-e3a5-423d-b32a-b959443a57b8","resolution":{"observed_at":"2026-08-07T12:09:31.011992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.11262","last_updated":"2020-05-22T16:26:54Z","snapshot_observed_at":"2026-08-15T22:07:29.787968Z","submitted_at":"2020-05-22T16:26:54Z","title":"LibriMix: An Open-Source Dataset for Generalizable Speech Separation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.11262","snapshot_observed_at":"2026-08-07T00:50:17.251656Z","title":"Librimix: An open-source dataset for generalizable speech separation,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2506.12672","last_updated":"2025-06-15T00:37:27Z","snapshot_observed_at":"2026-08-17T17:17:47.794238Z","submitted_at":"2025-06-15T00:37:27Z","title":"SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:17.251656Z"},"links":{"cited_paper":"/paper/2005.11262","citing_paper":"/paper/2506.12672"},"observation_digest":"sha256:5ab4603ae0a389357c6fb84a34d279a8fb59feef6caf285efdac25464478e903","observation_id":"0123293d-e901-4c82-8787-7cce00d2debe","resolution":{"observed_at":"2026-08-07T00:50:17.251656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.11262","last_updated":"2020-05-22T16:26:54Z","snapshot_observed_at":"2026-08-15T22:07:29.787968Z","submitted_at":"2020-05-22T16:26:54Z","title":"LibriMix: An Open-Source Dataset for Generalizable Speech Separation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.11262","snapshot_observed_at":"2026-08-07T00:30:35.412898Z","title":"Librimix: An open-source dataset for generalizable speech separation,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2506.13709","last_updated":"2025-06-16T17:19:04Z","snapshot_observed_at":"2026-08-21T11:44:22.271869Z","submitted_at":"2025-06-16T17:19:04Z","title":"SpeechRefiner: Towards Perceptual Quality Refinement for Front-End Algorithms","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T00:30:35.412898Z"},"links":{"cited_paper":"/paper/2005.11262","citing_paper":"/paper/2506.13709"},"observation_digest":"sha256:3037a47e9409114ed0753c93bbf7892e8b0e53642ef4d2778bbc9c9fa61c112e","observation_id":"e503fbd7-3814-4625-8716-bed84fe69c16","resolution":{"observed_at":"2026-08-07T00:30:35.412898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.11262","last_updated":"2020-05-22T16:26:54Z","snapshot_observed_at":"2026-08-15T22:07:29.787968Z","submitted_at":"2020-05-22T16:26:54Z","title":"LibriMix: An Open-Source Dataset for Generalizable Speech Separation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.11262","snapshot_observed_at":"2026-08-06T20:28:04.990163Z","title":"Available: https://arxiv.org/abs/2005.11262","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2507.02791","last_updated":"2025-07-05T07:54:28Z","snapshot_observed_at":"2026-08-22T04:08:37.817304Z","submitted_at":"2025-07-03T16:54:56Z","title":"Self-Steering Deep Non-Linear Spatially Selective Filters for Efficient Extraction of Moving Speakers under Weak Guidance","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-06T20:28:04.990163Z"},"links":{"cited_paper":"/paper/2005.11262","citing_paper":"/paper/2507.02791"},"observation_digest":"sha256:4d01553690e6aa55679ad60130900014c65348104f80489c428b67ac2a369881","observation_id":"077f8369-e5bf-44e9-827e-6f8abc59379a","resolution":{"observed_at":"2026-08-06T20:28:04.990163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.11262","last_updated":"2020-05-22T16:26:54Z","snapshot_observed_at":"2026-08-15T22:07:29.787968Z","submitted_at":"2020-05-22T16:26:54Z","title":"LibriMix: An Open-Source Dataset for Generalizable Speech Separation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.11262","snapshot_observed_at":"2026-08-06T16:41:24.033479Z","title":"LibriMix: An open-source dataset for generalizable speech separation,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-16T23:23:39.503713Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:24.033479Z"},"links":{"cited_paper":"/paper/2005.11262","citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:85486dd00b33074e2031082d702caf197148153d76c549678dccacc32cb6af14","observation_id":"203a6940-1875-4995-8852-f38d58673943","resolution":{"observed_at":"2026-08-06T16:41:24.033479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.11262","last_updated":"2020-05-22T16:26:54Z","snapshot_observed_at":"2026-08-15T22:07:29.787968Z","submitted_at":"2020-05-22T16:26:54Z","title":"LibriMix: An Open-Source Dataset for Generalizable Speech Separation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.11262","snapshot_observed_at":"2026-08-05T15:00:13.980353Z","title":"Librimix: An open-source dataset for generalizable speech separation","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2508.20660","last_updated":"2025-08-28T11:07:36Z","snapshot_observed_at":"2026-08-16T00:28:53.748581Z","submitted_at":"2025-08-28T11:07:36Z","title":"CodecBench: A Comprehensive Benchmark for Acoustic and Semantic Evaluation","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-05T15:00:13.980353Z"},"links":{"cited_paper":"/paper/2005.11262","citing_paper":"/paper/2508.20660"},"observation_digest":"sha256:8263c68a841bda7b8af6f65f193a7ead086da2dfefbacc850fbc296b87f12296","observation_id":"9db2a1b1-70dc-40ce-a056-72781458b97b","resolution":{"observed_at":"2026-08-05T15:00:13.980353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.11262","last_updated":"2020-05-22T16:26:54Z","snapshot_observed_at":"2026-08-15T22:07:29.787968Z","submitted_at":"2020-05-22T16:26:54Z","title":"LibriMix: An Open-Source Dataset for Generalizable Speech Separation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.11262","snapshot_observed_at":"2026-08-05T12:59:06.244600Z","title":"Librimix: An open-source dataset for generalizable speech separation,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2509.04488","last_updated":"2025-09-01T03:10:14Z","snapshot_observed_at":"2026-08-19T04:11:37.786762Z","submitted_at":"2025-09-01T03:10:14Z","title":"Serialized Output Prompting for Large Language Model-based Multi-Talker Speech Recognition","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T12:59:06.244600Z"},"links":{"cited_paper":"/paper/2005.11262","citing_paper":"/paper/2509.04488"},"observation_digest":"sha256:832bb8502a4941ec2fea805cb22399a5621369289e175d683bd776992fb78da9","observation_id":"adcecf9c-1444-4687-98b4-4c2002d9ab09","resolution":{"observed_at":"2026-08-05T12:59:06.244600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.11262","last_updated":"2020-05-22T16:26:54Z","snapshot_observed_at":"2026-08-15T22:07:29.787968Z","submitted_at":"2020-05-22T16:26:54Z","title":"LibriMix: An Open-Source Dataset for Generalizable Speech Separation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.11262","snapshot_observed_at":"2026-08-03T14:20:49.173085Z","title":"Librimix: An open-source dataset for generalizable speech separation,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2512.20978","last_updated":"2026-06-06T11:42:51Z","snapshot_observed_at":"2026-08-19T07:59:48.925532Z","submitted_at":"2025-12-24T06:13:02Z","title":"GenTSE: Enhancing Target Speaker Extraction via a Coarse-to-Fine Generative Language Model","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T14:20:49.173085Z"},"links":{"cited_paper":"/paper/2005.11262","citing_paper":"/paper/2512.20978"},"observation_digest":"sha256:5536f3b58ffab6051311fb2a064cf6550cec0e23db38642c6f2546e32d177165","observation_id":"1ff0967b-a56b-49f1-bc60-e249b3c5b830","resolution":{"observed_at":"2026-08-03T14:20:49.173085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.11262","last_updated":"2020-05-22T16:26:54Z","snapshot_observed_at":"2026-08-15T22:07:29.787968Z","submitted_at":"2020-05-22T16:26:54Z","title":"LibriMix: An Open-Source Dataset for Generalizable Speech Separation","version":1},"cited_work":{"arxiv_id":"2005.11262","doi":null,"metadata_source":"pith","pith_arxiv_id":"2005.11262","snapshot_observed_at":"2026-07-10T12:57:07.566849Z","title":"LibriMix: An open-source dataset for generalizable speech separation","venue":"eess.AS","work_id":"53c02064-c23e-434f-825d-3b1af09a75aa","year":2020},"citing_paper":{"arxiv_id":"2601.06006","last_updated":"2026-05-20T16:34:38Z","snapshot_observed_at":"2026-08-16T19:38:36.827978Z","submitted_at":"2026-01-09T18:41:12Z","title":"Discriminative-Generative Target Speaker Extraction with Decoder-Only Language Models","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-21T15:42:57.766341Z"},"links":{"cited_paper":"/paper/2005.11262","citing_paper":"/paper/2601.06006"},"observation_digest":"sha256:47279a0d6ed049d126d246fe32bc1edb98c7e64c8b26e29cd52b087d3bb30c93","observation_id":"ae1d01cb-8ea0-452f-b3a7-5ec4ae79accc","resolution":{"observed_at":"2026-05-21T15:44:14.744479Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.11262","last_updated":"2020-05-22T16:26:54Z","snapshot_observed_at":"2026-08-15T22:07:29.787968Z","submitted_at":"2020-05-22T16:26:54Z","title":"LibriMix: An Open-Source Dataset for Generalizable Speech Separation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.11262","snapshot_observed_at":"2026-08-03T03:30:39.487256Z","title":"Librimix: An open-source dataset for generaliz- able speech separation.arXiv preprint arXiv:2005.11262,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2602.07977","last_updated":"2026-06-07T08:01:33Z","snapshot_observed_at":"2026-08-16T17:36:50.896425Z","submitted_at":"2026-02-08T14:06:11Z","title":"Detect, Attend and Extract: Keyword Guided Target Speaker Extraction","version":2},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-03T03:30:39.487256Z"},"links":{"cited_paper":"/paper/2005.11262","citing_paper":"/paper/2602.07977"},"observation_digest":"sha256:b0ef7b8c6a805c3bf91a5b1ee6a3b92c8f80d1358b3e38db491c9a70a72e82aa","observation_id":"1842cc52-26a7-4b0a-a006-3a66ab9697b2","resolution":{"observed_at":"2026-08-03T03:30:39.487256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.11262","last_updated":"2020-05-22T16:26:54Z","snapshot_observed_at":"2026-08-15T22:07:29.787968Z","submitted_at":"2020-05-22T16:26:54Z","title":"LibriMix: An Open-Source Dataset for Generalizable Speech Separation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.11262","snapshot_observed_at":"2026-08-02T22:51:20.971040Z","title":"Librimix: An open-source dataset for generalizable speech separation,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2602.15519","last_updated":"2026-06-08T11:40:00Z","snapshot_observed_at":"2026-08-09T04:37:03.295131Z","submitted_at":"2026-02-17T11:47:56Z","title":"Enroll-on-Wakeup: A First Comparative Study of Target Speech Extraction for Seamless Interaction in Real Noisy Human-Machine Dialogue Scenarios","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T22:51:20.971040Z"},"links":{"cited_paper":"/paper/2005.11262","citing_paper":"/paper/2602.15519"},"observation_digest":"sha256:fa2ebb5165eb9a9cc3755e9e5d33b9ffcbfc3397f1296d4e927b399821d97392","observation_id":"d6923ac0-1294-4bbd-abdd-8ff6941e1c84","resolution":{"observed_at":"2026-08-02T22:51:20.971040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.11262","last_updated":"2020-05-22T16:26:54Z","snapshot_observed_at":"2026-08-15T22:07:29.787968Z","submitted_at":"2020-05-22T16:26:54Z","title":"LibriMix: An Open-Source Dataset for Generalizable Speech Separation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.11262","snapshot_observed_at":"2026-08-02T17:38:16.051420Z","title":"Available: https://arxiv.org/abs/2005.11262","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2603.23723","last_updated":"2026-07-16T11:10:40Z","snapshot_observed_at":"2026-08-03T20:26:05.507379Z","submitted_at":"2026-03-24T21:19:45Z","title":"Autoregressive Guidance of Deep Spatially Selective Filters using Bayesian Tracking for Efficient Extraction of Moving Speakers","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-02T17:38:16.051420Z"},"links":{"cited_paper":"/paper/2005.11262","citing_paper":"/paper/2603.23723"},"observation_digest":"sha256:bb25c84d9c5518523daa98a685d54c85504088f680377ab292fd564c0557b5fd","observation_id":"3b04f370-561f-4dec-bdea-985215ab7392","resolution":{"observed_at":"2026-08-02T17:38:16.051420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.11262","last_updated":"2020-05-22T16:26:54Z","snapshot_observed_at":"2026-08-15T22:07:29.787968Z","submitted_at":"2020-05-22T16:26:54Z","title":"LibriMix: An Open-Source Dataset for Generalizable Speech Separation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.11262","snapshot_observed_at":"2026-07-13T17:09:15.281290Z","title":"Librimix: An open-source dataset for generalizable speech separation,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2603.27205","last_updated":"2026-06-21T01:18:38Z","snapshot_observed_at":"2026-08-17T23:48:43.606503Z","submitted_at":"2026-03-28T09:14:41Z","title":"Beyond Acoustic Prefixes: Persistent Grounding in Serialized Acoustic Memory for LLM-Based Multi-Talker Speech Recognition","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-13T17:09:15.281290Z"},"links":{"cited_paper":"/paper/2005.11262","citing_paper":"/paper/2603.27205"},"observation_digest":"sha256:c43472f5670b118ec199910c59a1a6599986b8c685b92f898d9c9c4b6eb2f1f6","observation_id":"0c96491e-fe24-43bd-b84e-8ec4658d6f12","resolution":{"observed_at":"2026-07-13T17:09:15.281290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.11262","last_updated":"2020-05-22T16:26:54Z","snapshot_observed_at":"2026-08-15T22:07:29.787968Z","submitted_at":"2020-05-22T16:26:54Z","title":"LibriMix: An Open-Source Dataset for Generalizable Speech Separation","version":1},"cited_work":{"arxiv_id":"2005.11262","doi":null,"metadata_source":"pith","pith_arxiv_id":"2005.11262","snapshot_observed_at":"2026-07-10T12:57:07.566849Z","title":"LibriMix: An open-source dataset for generalizable speech separation","venue":"eess.AS","work_id":"53c02064-c23e-434f-825d-3b1af09a75aa","year":2020},"citing_paper":{"arxiv_id":"2604.08415","last_updated":"2026-04-09T16:13:25Z","snapshot_observed_at":"2026-08-16T20:07:48.588394Z","submitted_at":"2026-04-09T16:13:25Z","title":"Ring Mixing with Auxiliary Signal-to-Consistency-Error Ratio Loss for Unsupervised Denoising in Speech Separation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T17:13:12.239842Z"},"links":{"cited_paper":"/paper/2005.11262","citing_paper":"/paper/2604.08415"},"observation_digest":"sha256:2f4ecca0338b2180777f2429d01fdae1cf701e2dff003a560afe1266fbd35734","observation_id":"3981a470-337e-43cd-8a41-68deb62186a7","resolution":{"observed_at":"2026-05-11T07:20:58.492645Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.11262","last_updated":"2020-05-22T16:26:54Z","snapshot_observed_at":"2026-08-15T22:07:29.787968Z","submitted_at":"2020-05-22T16:26:54Z","title":"LibriMix: An Open-Source Dataset for Generalizable Speech Separation","version":1},"cited_work":{"arxiv_id":"2005.11262","doi":null,"metadata_source":"pith","pith_arxiv_id":"2005.11262","snapshot_observed_at":"2026-07-10T12:57:07.566849Z","title":"LibriMix: An open-source dataset for generalizable speech separation","venue":"eess.AS","work_id":"53c02064-c23e-434f-825d-3b1af09a75aa","year":2020},"citing_paper":{"arxiv_id":"2604.27436","last_updated":"2026-04-30T05:21:09Z","snapshot_observed_at":"2026-07-06T23:12:52.141592Z","submitted_at":"2026-04-30T05:21:09Z","title":"BUT System Description for CHiME-9 MCoRec Challenge","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-07T10:13:38.938473Z"},"links":{"cited_paper":"/paper/2005.11262","citing_paper":"/paper/2604.27436"},"observation_digest":"sha256:9f394a513b3aa2cb913d9b150bd40e0dd79170a6e34e1417ab4dec9290d8cf26","observation_id":"721891be-e055-430e-bd64-185e1f06766a","resolution":{"observed_at":"2026-05-12T09:36:27.164475Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.11262","last_updated":"2020-05-22T16:26:54Z","snapshot_observed_at":"2026-08-15T22:07:29.787968Z","submitted_at":"2020-05-22T16:26:54Z","title":"LibriMix: An Open-Source Dataset for Generalizable Speech Separation","version":1},"cited_work":{"arxiv_id":"2005.11262","doi":null,"metadata_source":"pith","pith_arxiv_id":"2005.11262","snapshot_observed_at":"2026-07-10T12:57:07.566849Z","title":"LibriMix: An open-source dataset for generalizable speech separation","venue":"eess.AS","work_id":"53c02064-c23e-434f-825d-3b1af09a75aa","year":2020},"citing_paper":{"arxiv_id":"2605.11192","last_updated":"2026-05-11T19:58:14Z","snapshot_observed_at":"2026-08-18T20:31:27.815120Z","submitted_at":"2026-05-11T19:58:14Z","title":"Exploring Token-Space Manipulation in Latent Audio Tokenizers","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-13T02:40:05.812426Z"},"links":{"cited_paper":"/paper/2005.11262","citing_paper":"/paper/2605.11192"},"observation_digest":"sha256:c555c1ed1add558c9d51268e135ec83d9f3e13e681224f020f56cc0b87217264","observation_id":"0aa1a2e2-b0ae-4882-a625-91c5e647e3b5","resolution":{"observed_at":"2026-05-13T02:42:08.303081Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.11262","last_updated":"2020-05-22T16:26:54Z","snapshot_observed_at":"2026-08-15T22:07:29.787968Z","submitted_at":"2020-05-22T16:26:54Z","title":"LibriMix: An Open-Source Dataset for Generalizable Speech Separation","version":1},"cited_work":{"arxiv_id":"2005.11262","doi":null,"metadata_source":"pith","pith_arxiv_id":"2005.11262","snapshot_observed_at":"2026-07-10T12:57:07.566849Z","title":"LibriMix: An open-source dataset for generalizable speech separation","venue":"eess.AS","work_id":"53c02064-c23e-434f-825d-3b1af09a75aa","year":2020},"citing_paper":{"arxiv_id":"2605.15442","last_updated":"2026-05-14T21:53:10Z","snapshot_observed_at":"2026-08-16T22:49:25.391530Z","submitted_at":"2026-05-14T21:53:10Z","title":"Mind the Gap: Impact of Synthetic Conversational Data on Multi-Talker ASR and Speaker Diarization","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-19T14:39:27.382652Z"},"links":{"cited_paper":"/paper/2005.11262","citing_paper":"/paper/2605.15442"},"observation_digest":"sha256:0221d357994dc983b3c5c901004c2092bde2005dcce9a7ada81c6971743893e6","observation_id":"9f55dbf0-6b5c-417d-ada3-f299b4fc2c05","resolution":{"observed_at":"2026-05-19T14:42:37.472254Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.11262","last_updated":"2020-05-22T16:26:54Z","snapshot_observed_at":"2026-08-15T22:07:29.787968Z","submitted_at":"2020-05-22T16:26:54Z","title":"LibriMix: An Open-Source Dataset for Generalizable Speech Separation","version":1},"cited_work":{"arxiv_id":"2005.11262","doi":null,"metadata_source":"pith","pith_arxiv_id":"2005.11262","snapshot_observed_at":"2026-07-10T12:57:07.566849Z","title":"LibriMix: An open-source dataset for generalizable speech separation","venue":"eess.AS","work_id":"53c02064-c23e-434f-825d-3b1af09a75aa","year":2020},"citing_paper":{"arxiv_id":"2605.17225","last_updated":"2026-05-17T02:13:58Z","snapshot_observed_at":"2026-08-15T22:57:05.041517Z","submitted_at":"2026-05-17T02:13:58Z","title":"Can Large Audio Language Models Ignore Multilingual Distractors? An Evaluation of Their Selective Auditory Attention Capabilities","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-19T23:17:08.124240Z"},"links":{"cited_paper":"/paper/2005.11262","citing_paper":"/paper/2605.17225"},"observation_digest":"sha256:7d4b0d3508509871114993c687db9aafe4851ded296e3e4b81e96fb730d36200","observation_id":"2da88f1b-d49b-40b8-b43a-b83f9f52e565","resolution":{"observed_at":"2026-05-19T23:17:57.489331Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.11262","last_updated":"2020-05-22T16:26:54Z","snapshot_observed_at":"2026-08-15T22:07:29.787968Z","submitted_at":"2020-05-22T16:26:54Z","title":"LibriMix: An Open-Source Dataset for Generalizable Speech Separation","version":1},"cited_work":{"arxiv_id":"2005.11262","doi":null,"metadata_source":"pith","pith_arxiv_id":"2005.11262","snapshot_observed_at":"2026-07-10T12:57:07.566849Z","title":"LibriMix: An open-source dataset for generalizable speech separation","venue":"eess.AS","work_id":"53c02064-c23e-434f-825d-3b1af09a75aa","year":2020},"citing_paper":{"arxiv_id":"2606.23313","last_updated":"2026-06-22T13:26:29Z","snapshot_observed_at":"2026-08-09T15:51:59.239958Z","submitted_at":"2026-06-22T13:26:29Z","title":"Uncertainty-based Debiasing and Unlearning for Decontamination","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-06-26T05:57:44.576411Z"},"links":{"cited_paper":"/paper/2005.11262","citing_paper":"/paper/2606.23313"},"observation_digest":"sha256:4433def3c1fca63d08451261aa80d9c5367ae771af6088cb91bcd750a8f74891","observation_id":"2d52bf4d-6972-4fdd-bfa8-7298ca335a7e","resolution":{"observed_at":"2026-07-04T12:49:52.401615Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.11262","last_updated":"2020-05-22T16:26:54Z","snapshot_observed_at":"2026-08-15T22:07:29.787968Z","submitted_at":"2020-05-22T16:26:54Z","title":"LibriMix: An Open-Source Dataset for Generalizable Speech Separation","version":1},"cited_work":{"arxiv_id":"2005.11262","doi":null,"metadata_source":"pith","pith_arxiv_id":"2005.11262","snapshot_observed_at":"2026-07-10T12:57:07.566849Z","title":"LibriMix: An open-source dataset for generalizable speech separation","venue":"eess.AS","work_id":"53c02064-c23e-434f-825d-3b1af09a75aa","year":2020},"citing_paper":{"arxiv_id":"2606.23332","last_updated":"2026-06-22T13:41:24Z","snapshot_observed_at":"2026-08-04T14:09:25.194252Z","submitted_at":"2026-06-22T13:41:24Z","title":"Don't Listen to Me: A Lightweight, Low-Latency Model for Own-Voice Cancellation in Far-Field Speech Enhancement","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-26T06:49:46.425849Z"},"links":{"cited_paper":"/paper/2005.11262","citing_paper":"/paper/2606.23332"},"observation_digest":"sha256:87d26ab7ca573e5caa77df1e30f26ef63959278b4d765395276e66f05adfa9a2","observation_id":"65e970a6-19c2-4c65-a180-31bf8fa1ff0e","resolution":{"observed_at":"2026-07-04T12:29:51.684420Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.11262","last_updated":"2020-05-22T16:26:54Z","snapshot_observed_at":"2026-08-15T22:07:29.787968Z","submitted_at":"2020-05-22T16:26:54Z","title":"LibriMix: An Open-Source Dataset for Generalizable Speech Separation","version":1},"cited_work":{"arxiv_id":"2005.11262","doi":null,"metadata_source":"pith","pith_arxiv_id":"2005.11262","snapshot_observed_at":"2026-07-10T12:57:07.566849Z","title":"LibriMix: An open-source dataset for generalizable speech separation","venue":"eess.AS","work_id":"53c02064-c23e-434f-825d-3b1af09a75aa","year":2020},"citing_paper":{"arxiv_id":"2606.29897","last_updated":"2026-06-29T07:34:06Z","snapshot_observed_at":"2026-08-21T10:25:45.180079Z","submitted_at":"2026-06-29T07:34:06Z","title":"Child-Centric Voice Anonymization in Single and Multi-Speaker Speech via Domain-Adapted SSL Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-30T05:26:46.541637Z"},"links":{"cited_paper":"/paper/2005.11262","citing_paper":"/paper/2606.29897"},"observation_digest":"sha256:b8aee14f85febd4a3b0865078f78307576483cfed021c2e4267db95729f6e583","observation_id":"d84843c3-9065-4235-b6a2-c2ece42db3f2","resolution":{"observed_at":"2026-06-30T14:24:45.590969Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.11262","last_updated":"2020-05-22T16:26:54Z","snapshot_observed_at":"2026-08-15T22:07:29.787968Z","submitted_at":"2020-05-22T16:26:54Z","title":"LibriMix: An Open-Source Dataset for Generalizable Speech Separation","version":1},"cited_work":{"arxiv_id":"2005.11262","doi":null,"metadata_source":"pith","pith_arxiv_id":"2005.11262","snapshot_observed_at":"2026-07-10T12:57:07.566849Z","title":"LibriMix: An open-source dataset for generalizable speech separation","venue":"eess.AS","work_id":"53c02064-c23e-434f-825d-3b1af09a75aa","year":2020},"citing_paper":{"arxiv_id":"2607.06088","last_updated":"2026-07-07T10:00:23Z","snapshot_observed_at":"2026-08-14T21:33:54.034455Z","submitted_at":"2026-07-07T10:00:23Z","title":"Flow Matching-Based Speech Source Separation with Best-of-N Biometric Sampling","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-08T17:05:57.548636Z"},"links":{"cited_paper":"/paper/2005.11262","citing_paper":"/paper/2607.06088"},"observation_digest":"sha256:1961f72529562de8d57c167c9f485feb78dbb45743f924bb56e5c8990abec672","observation_id":"fb7266b1-5393-4087-bbb9-ed013a370ef5","resolution":{"observed_at":"2026-07-08T17:15:09.327729Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.11262","last_updated":"2020-05-22T16:26:54Z","snapshot_observed_at":"2026-08-15T22:07:29.787968Z","submitted_at":"2020-05-22T16:26:54Z","title":"LibriMix: An Open-Source Dataset for Generalizable Speech Separation","version":1},"cited_work":{"arxiv_id":"2005.11262","doi":null,"metadata_source":"pith","pith_arxiv_id":"2005.11262","snapshot_observed_at":"2026-07-10T12:57:07.566849Z","title":"LibriMix: An open-source dataset for generalizable speech separation","venue":"eess.AS","work_id":"53c02064-c23e-434f-825d-3b1af09a75aa","year":2020},"citing_paper":{"arxiv_id":"2607.08111","last_updated":"2026-07-09T04:51:11Z","snapshot_observed_at":"2026-08-18T20:44:39.711535Z","submitted_at":"2026-07-09T04:51:11Z","title":"PS4: Proxy-Supervised Joint Training for Real Target Speaker Extraction","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-10T12:54:17.490105Z"},"links":{"cited_paper":"/paper/2005.11262","citing_paper":"/paper/2607.08111"},"observation_digest":"sha256:88a10a092fe899551921d0ca341749e554a6ec601eac1f5041961d95b4107019","observation_id":"d613abed-a7c3-418e-9e39-ea4a1dba0775","resolution":{"observed_at":"2026-07-10T12:57:07.568338Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.11262","last_updated":"2020-05-22T16:26:54Z","snapshot_observed_at":"2026-08-15T22:07:29.787968Z","submitted_at":"2020-05-22T16:26:54Z","title":"LibriMix: An Open-Source Dataset for Generalizable Speech Separation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.11262","snapshot_observed_at":"2026-07-13T00:46:07.473150Z","title":"LibriMix: An open-source dataset for generalizable speech separation,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2607.09043","last_updated":"2026-07-10T02:18:02Z","snapshot_observed_at":"2026-08-20T07:23:51.419109Z","submitted_at":"2026-07-10T02:18:02Z","title":"Technical Report for MERL's Real-TSE Challenge Submission","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-13T00:46:07.473150Z"},"links":{"cited_paper":"/paper/2005.11262","citing_paper":"/paper/2607.09043"},"observation_digest":"sha256:8b54b2705cfc13b266302d0da6d3b844cc4336e2983dcf7f45946d9e96253d97","observation_id":"45de677f-dd71-40c4-8ab4-6bc719a5a567","resolution":{"observed_at":"2026-07-13T00:46:07.473150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.11262","last_updated":"2020-05-22T16:26:54Z","snapshot_observed_at":"2026-08-15T22:07:29.787968Z","submitted_at":"2020-05-22T16:26:54Z","title":"LibriMix: An Open-Source Dataset for Generalizable Speech Separation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.11262","snapshot_observed_at":"2026-08-01T23:55:29.954391Z","title":"LibriMix: An open-source dataset for generalizable speech separation,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2607.15198","last_updated":"2026-07-16T16:57:05Z","snapshot_observed_at":"2026-08-22T06:31:00.491469Z","submitted_at":"2026-07-16T16:57:05Z","title":"SLT 2026 REAL-TSE Challenge: Real-world Target Speaker Extraction from Conversational Recordings","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T23:55:29.954391Z"},"links":{"cited_paper":"/paper/2005.11262","citing_paper":"/paper/2607.15198"},"observation_digest":"sha256:8c299aa97a5818694b6889e256e544fa788afc65e5b5fd2b2ea69d0c9a337f8b","observation_id":"069e1799-3731-4254-ac16-51700c65bbc3","resolution":{"observed_at":"2026-08-01T23:55:29.954391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.11262","last_updated":"2020-05-22T16:26:54Z","snapshot_observed_at":"2026-08-15T22:07:29.787968Z","submitted_at":"2020-05-22T16:26:54Z","title":"LibriMix: An Open-Source Dataset for Generalizable Speech Separation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.11262","snapshot_observed_at":"2026-08-01T06:19:31.674770Z","title":"arXiv:2005.11262","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2607.21943","last_updated":"2026-07-29T05:22:33Z","snapshot_observed_at":"2026-08-18T23:16:57.387198Z","submitted_at":"2026-07-24T03:39:34Z","title":"Listen, Do Not Copy: Internalizing Audio-Grounded Scaffold Context for Robust Omni-Model Speech Understanding","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-01T06:19:31.674770Z"},"links":{"cited_paper":"/paper/2005.11262","citing_paper":"/paper/2607.21943"},"observation_digest":"sha256:f733473e4e19499d05bc2c5b054b566df34aaf2ecf45f4751a86721b40bf693f","observation_id":"432e0dbd-1837-496a-b54b-a55e0dda9d31","resolution":{"observed_at":"2026-08-01T06:19:31.674770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.11262","last_updated":"2020-05-22T16:26:54Z","snapshot_observed_at":"2026-08-15T22:07:29.787968Z","submitted_at":"2020-05-22T16:26:54Z","title":"LibriMix: An Open-Source Dataset for Generalizable Speech Separation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.11262","snapshot_observed_at":"2026-08-01T01:56:13.878197Z","title":"LibriMix: An open-source dataset for generalizable speech separation,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2607.27756","last_updated":"2026-07-30T06:53:15Z","snapshot_observed_at":"2026-08-20T09:56:48.839708Z","submitted_at":"2026-07-30T06:53:15Z","title":"Cocktail-Talker: Multi-Speaker Dialog Modeling in Noisy Social Environments with Turn Action GRPO","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T01:56:13.878197Z"},"links":{"cited_paper":"/paper/2005.11262","citing_paper":"/paper/2607.27756"},"observation_digest":"sha256:268051b05de89ecc4cd1fc3956b318aa720eec5b736f611ea47bd8844289a5dd","observation_id":"cb5b584b-f626-4d57-9d08-740ad6673e3d","resolution":{"observed_at":"2026-08-01T01:56:13.878197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.11262","last_updated":"2020-05-22T16:26:54Z","snapshot_observed_at":"2026-08-15T22:07:29.787968Z","submitted_at":"2020-05-22T16:26:54Z","title":"LibriMix: An Open-Source Dataset for Generalizable Speech Separation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.11262","snapshot_observed_at":"2026-08-04T19:02:40.730450Z","title":"arXiv:2005.11262","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2608.01881","last_updated":"2026-08-03T08:24:54Z","snapshot_observed_at":"2026-08-16T18:27:51.029961Z","submitted_at":"2026-08-03T08:24:54Z","title":"Hear, Invoke, and Understand: A Skill-Calling Multimodal Agent for Large Audio Language Models","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-04T19:02:40.730450Z"},"links":{"cited_paper":"/paper/2005.11262","citing_paper":"/paper/2608.01881"},"observation_digest":"sha256:c1552d8b11df08a4276bd05b8ed6359477b694bc3bcb253cbfc55b6391be82d6","observation_id":"d71e7252-bb08-46c4-9f06-f0a42d6c960f","resolution":{"observed_at":"2026-08-04T19:02:40.730450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2005.11262/citation-record","integrity":"/paper/2005.11262/integrity","json":"/paper/2005.11262/citation-record.json","paper":"/paper/2005.11262"},"outbound":[],"paper":{"arxiv_id":"2005.11262","last_updated":"2020-05-22T16:26:54Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-15T22:07:29.787968Z","submitted_at":"2020-05-22T16:26:54Z","title":"LibriMix: An Open-Source Dataset for Generalizable Speech Separation"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 51 inbound Pith citation observations for arXiv:2005.11262."}