{"as_of":"2026-08-18T16:23:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2d1011806bf2ce50d7f9d36f7c5f65dccd23ab7b3013bec78ab595759ad598bf","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T22:40:24.392435Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.06660/citation-record","integrity":"/paper/2505.06660/integrity","json":"/paper/2505.06660/citation-record.json","paper":"/paper/2505.06660"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:40:24.204405Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech representations,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.06660","last_updated":"2025-05-10T14:23:37Z","snapshot_observed_at":"2026-08-15T22:34:33.223713Z","submitted_at":"2025-05-10T14:23:37Z","title":"TS-SUPERB: A Target Speech Processing Benchmark for Speech Self-Supervised Learning Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T22:40:24.204405Z"},"links":{"citing_paper":"/paper/2505.06660"},"observation_digest":"sha256:f35b15eccd8c222eca064fcd9d70adccaea5afa741dcacfface67f4f3db9a8d6","observation_id":"a4a43ac7-760b-44d0-b53b-f966b60038ba","resolution":{"observed_at":"2026-08-15T22:40:24.204405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:40:24.996223Z","title":"data2vec: A general framework for self-supervised learning in speech, vision and language,","venue":null,"work_id":"28ae6622-134b-4749-84b2-764f0a2cb48b","year":2022},"citing_paper":{"arxiv_id":"2505.06660","last_updated":"2025-05-10T14:23:37Z","snapshot_observed_at":"2026-08-15T22:34:33.223713Z","submitted_at":"2025-05-10T14:23:37Z","title":"TS-SUPERB: A Target Speech Processing Benchmark for Speech Self-Supervised Learning Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T22:40:24.209788Z"},"links":{"citing_paper":"/paper/2505.06660"},"observation_digest":"sha256:70a444cd659a9f8bffe55a58947b9d6a5ea04abaeb6d9f429e1948a2f196b7e0","observation_id":"b9571a37-0c05-4f61-8f23-d6363d555009","resolution":{"observed_at":"2026-08-15T22:40:25.001821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:40:24.214457Z","title":"HuBERT: Self-supervised speech representation learning by masked prediction of hidden units,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.06660","last_updated":"2025-05-10T14:23:37Z","snapshot_observed_at":"2026-08-15T22:34:33.223713Z","submitted_at":"2025-05-10T14:23:37Z","title":"TS-SUPERB: A Target Speech Processing Benchmark for Speech Self-Supervised Learning Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T22:40:24.214457Z"},"links":{"citing_paper":"/paper/2505.06660"},"observation_digest":"sha256:2ccdd949411794bd4e8c901699759b6be7690e82a8a38daafaae964990d8e3b0","observation_id":"b0f78935-851b-4a39-814d-84436cb193be","resolution":{"observed_at":"2026-08-15T22:40:24.214457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:40:24.970894Z","title":"WavLM: Large-Scale Self-Supervised Pre- Training for Full Stack Speech Processing,","venue":null,"work_id":"008e91c4-8ea4-4a93-a6d5-2436e2f52ebd","year":2022},"citing_paper":{"arxiv_id":"2505.06660","last_updated":"2025-05-10T14:23:37Z","snapshot_observed_at":"2026-08-15T22:34:33.223713Z","submitted_at":"2025-05-10T14:23:37Z","title":"TS-SUPERB: A Target Speech Processing Benchmark for Speech Self-Supervised Learning Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T22:40:24.219308Z"},"links":{"citing_paper":"/paper/2505.06660"},"observation_digest":"sha256:6e300045a4ecca501837dc3d293c96a4732726838681f0ce6af19436fc7bcf37","observation_id":"33a2623f-c867-4d7a-ba00-785354b0ea7d","resolution":{"observed_at":"2026-08-15T22:40:24.975926Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:40:24.955460Z","title":"Parameter-efficient cross-language transfer learning for a language- modular audiovisual speech recognition,","venue":null,"work_id":"e45136ec-b65c-4597-8149-8efa74eb013e","year":2023},"citing_paper":{"arxiv_id":"2505.06660","last_updated":"2025-05-10T14:23:37Z","snapshot_observed_at":"2026-08-15T22:34:33.223713Z","submitted_at":"2025-05-10T14:23:37Z","title":"TS-SUPERB: A Target Speech Processing Benchmark for Speech Self-Supervised Learning Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T22:40:24.223954Z"},"links":{"citing_paper":"/paper/2505.06660"},"observation_digest":"sha256:937fcf76da3f2bf0b7b638915ea53217311775039ce6fb30515c1562e8c1c0a9","observation_id":"8290db7c-76d1-45b9-aeda-d4f28245f71e","resolution":{"observed_at":"2026-08-15T22:40:24.960330Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:40:24.941038Z","title":"Large-scale self-supervised speech representation learning for automatic speaker verification,","venue":null,"work_id":"f0c94631-742d-4655-8fd8-c87635aa5cb4","year":2022},"citing_paper":{"arxiv_id":"2505.06660","last_updated":"2025-05-10T14:23:37Z","snapshot_observed_at":"2026-08-15T22:34:33.223713Z","submitted_at":"2025-05-10T14:23:37Z","title":"TS-SUPERB: A Target Speech Processing Benchmark for Speech Self-Supervised Learning Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T22:40:24.229007Z"},"links":{"citing_paper":"/paper/2505.06660"},"observation_digest":"sha256:76e8406dd4f0ebd187866a4a337e24bbf9566fe3671c4e761fd4a3bc05b0c207","observation_id":"20e17d71-4f83-41a5-b9e1-d42cd83d24a2","resolution":{"observed_at":"2026-08-15T22:40:24.945863Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:40:24.927032Z","title":"An attention-based backend allowing efficient fine-tuning of transformer models for speaker verification,","venue":null,"work_id":"7db64979-e633-4576-8161-b25baaf49417","year":2023},"citing_paper":{"arxiv_id":"2505.06660","last_updated":"2025-05-10T14:23:37Z","snapshot_observed_at":"2026-08-15T22:34:33.223713Z","submitted_at":"2025-05-10T14:23:37Z","title":"TS-SUPERB: A Target Speech Processing Benchmark for Speech Self-Supervised Learning Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T22:40:24.234320Z"},"links":{"citing_paper":"/paper/2505.06660"},"observation_digest":"sha256:788bf2d0d10736607b308c87d55e18c2fd7472516f5eb1766cb8f7ceed451cf0","observation_id":"306ce19b-7f7e-4fe2-b6ad-6d10d5ec0452","resolution":{"observed_at":"2026-08-15T22:40:24.931615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:40:24.912452Z","title":"Exploring WavLM on speech enhancement,","venue":null,"work_id":"c4bdf6c6-71c6-442b-a719-23948426db5e","year":2023},"citing_paper":{"arxiv_id":"2505.06660","last_updated":"2025-05-10T14:23:37Z","snapshot_observed_at":"2026-08-15T22:34:33.223713Z","submitted_at":"2025-05-10T14:23:37Z","title":"TS-SUPERB: A Target Speech Processing Benchmark for Speech Self-Supervised Learning Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T22:40:24.238980Z"},"links":{"citing_paper":"/paper/2505.06660"},"observation_digest":"sha256:8f6e44c21853d33affeb223ed4585ed43ca0fbb854c5d92936e448dc30dafd97","observation_id":"9f99a535-9886-49f3-a6ea-9db015941a2e","resolution":{"observed_at":"2026-08-15T22:40:24.917358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:40:24.897299Z","title":"Boosting self-supervised embeddings for speech enhancement,","venue":null,"work_id":"ae5a2789-cae4-4f18-8e84-fa9d519cc6ba","year":2022},"citing_paper":{"arxiv_id":"2505.06660","last_updated":"2025-05-10T14:23:37Z","snapshot_observed_at":"2026-08-15T22:34:33.223713Z","submitted_at":"2025-05-10T14:23:37Z","title":"TS-SUPERB: A Target Speech Processing Benchmark for Speech Self-Supervised Learning Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T22:40:24.243815Z"},"links":{"citing_paper":"/paper/2505.06660"},"observation_digest":"sha256:fff0e8c7384a143d4a4c85ac4f1b9332e7efc3717c58f4f4e45555eea68f9e81","observation_id":"2e75c253-ff9b-4be7-8cf2-0bb9083a76b4","resolution":{"observed_at":"2026-08-15T22:40:24.902247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:40:24.881836Z","title":"SUPERB: Speech Processing Universal PERformance Benchmark,","venue":null,"work_id":"99171757-02ea-4eff-b3f4-de714d3294df","year":2021},"citing_paper":{"arxiv_id":"2505.06660","last_updated":"2025-05-10T14:23:37Z","snapshot_observed_at":"2026-08-15T22:34:33.223713Z","submitted_at":"2025-05-10T14:23:37Z","title":"TS-SUPERB: A Target Speech Processing Benchmark for Speech Self-Supervised Learning Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T22:40:24.250546Z"},"links":{"citing_paper":"/paper/2505.06660"},"observation_digest":"sha256:20de923e7fff2f39d6e839a31a7a6ee1443312793c8d113c399a358bf4605d77","observation_id":"26edc68d-4fa6-4c99-8607-a6fe4a773781","resolution":{"observed_at":"2026-08-15T22:40:24.886513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:40:24.867370Z","title":"SUPERB- SG: Enhanced speech processing universal PERformance benchmark for semantic and generative capabilities,","venue":null,"work_id":"adf96c5b-6187-41ac-9bc5-d5083b89c351","year":2022},"citing_paper":{"arxiv_id":"2505.06660","last_updated":"2025-05-10T14:23:37Z","snapshot_observed_at":"2026-08-15T22:34:33.223713Z","submitted_at":"2025-05-10T14:23:37Z","title":"TS-SUPERB: A Target Speech Processing Benchmark for Speech Self-Supervised Learning Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T22:40:24.255227Z"},"links":{"citing_paper":"/paper/2505.06660"},"observation_digest":"sha256:159d6d6929a73373565c3fb7c2e7089a8ae2b103c6eb53322a0019ed258d4594","observation_id":"11d1fed9-038d-4c20-8cac-a79827585a8c","resolution":{"observed_at":"2026-08-15T22:40:24.871869Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:40:24.852604Z","title":"ML- SUPERB: Multilingual Speech Universal PERformance Benchmark,","venue":null,"work_id":"0401e335-32c3-4b8b-a6e3-2136992efe72","year":2023},"citing_paper":{"arxiv_id":"2505.06660","last_updated":"2025-05-10T14:23:37Z","snapshot_observed_at":"2026-08-15T22:34:33.223713Z","submitted_at":"2025-05-10T14:23:37Z","title":"TS-SUPERB: A Target Speech Processing Benchmark for Speech Self-Supervised Learning Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T22:40:24.259889Z"},"links":{"citing_paper":"/paper/2505.06660"},"observation_digest":"sha256:f73d4c60656a9565e44381f7a3db7a4680ceca94f00b647994c33ed7dbe3b941","observation_id":"87432b7d-b762-460e-940d-a06f06588b04","resolution":{"observed_at":"2026-08-15T22:40:24.857310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:40:24.837377Z","title":"Min- isuperb: Lightweight benchmark for self-supervised speech models,","venue":null,"work_id":"5c61e889-92af-4641-aef7-ce19b4b4e076","year":2023},"citing_paper":{"arxiv_id":"2505.06660","last_updated":"2025-05-10T14:23:37Z","snapshot_observed_at":"2026-08-15T22:34:33.223713Z","submitted_at":"2025-05-10T14:23:37Z","title":"TS-SUPERB: A Target Speech Processing Benchmark for Speech Self-Supervised Learning Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T22:40:24.264233Z"},"links":{"citing_paper":"/paper/2505.06660"},"observation_digest":"sha256:fc2767f8a253de91c7f7d0becab1030b4ac12f458f632b08962de03221372a3d","observation_id":"584a7f1f-a16d-4c02-a804-9819e8cd7b1f","resolution":{"observed_at":"2026-08-15T22:40:24.842398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:40:24.822850Z","title":"A V- SUPERB: A multi-task evaluation benchmark for audio-visual represen- tation models,","venue":null,"work_id":"661c28fd-c1cd-497f-af54-ff3f07d496e0","year":2024},"citing_paper":{"arxiv_id":"2505.06660","last_updated":"2025-05-10T14:23:37Z","snapshot_observed_at":"2026-08-15T22:34:33.223713Z","submitted_at":"2025-05-10T14:23:37Z","title":"TS-SUPERB: A Target Speech Processing Benchmark for Speech Self-Supervised Learning Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T22:40:24.269175Z"},"links":{"citing_paper":"/paper/2505.06660"},"observation_digest":"sha256:2a6aef11bd0e4f9bf347a1204ad949990d6c7f15773cf33275a082a9b1b00489","observation_id":"a07cfdf3-701f-4141-ab37-bfe5cddc43b5","resolution":{"observed_at":"2026-08-15T22:40:24.827545Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13018","last_updated":"2024-03-12T07:13:02Z","snapshot_observed_at":"2026-08-16T14:16:56.732620Z","submitted_at":"2024-02-20T14:00:53Z","title":"EMO-SUPERB: An In-depth Look at Speech Emotion Recognition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13018","snapshot_observed_at":"2026-08-15T22:40:24.273702Z","title":"EMO-SUPERB: An in-depth look at speech emotion recognition,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.06660","last_updated":"2025-05-10T14:23:37Z","snapshot_observed_at":"2026-08-15T22:34:33.223713Z","submitted_at":"2025-05-10T14:23:37Z","title":"TS-SUPERB: A Target Speech Processing Benchmark for Speech Self-Supervised Learning Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T22:40:24.273702Z"},"links":{"cited_paper":"/paper/2402.13018","citing_paper":"/paper/2505.06660"},"observation_digest":"sha256:0e7f526cb59165a56728340aa0dcbfc54fd694450649b3840cd4dd61ebcd3e4e","observation_id":"5863b24c-52fa-4ae6-90a4-1501091c3c0b","resolution":{"observed_at":"2026-08-15T22:40:24.273702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:40:24.278655Z","title":"Neural target speech extraction: An overview,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.06660","last_updated":"2025-05-10T14:23:37Z","snapshot_observed_at":"2026-08-15T22:34:33.223713Z","submitted_at":"2025-05-10T14:23:37Z","title":"TS-SUPERB: A Target Speech Processing Benchmark for Speech Self-Supervised Learning Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T22:40:24.278655Z"},"links":{"citing_paper":"/paper/2505.06660"},"observation_digest":"sha256:dbe3bd343fddc060620cb90a88d2bba87f8bd122017b1523ced77d862d0f7b88","observation_id":"a505954a-4a3c-445e-a5fd-eb5471b1ff2d","resolution":{"observed_at":"2026-08-15T22:40:24.278655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:40:24.798804Z","title":"Personalized speech enhancement: New models and comprehensive evaluation,","venue":null,"work_id":"67c4de15-cd53-4b9d-8d3b-35d9fe4eb6c3","year":2022},"citing_paper":{"arxiv_id":"2505.06660","last_updated":"2025-05-10T14:23:37Z","snapshot_observed_at":"2026-08-15T22:34:33.223713Z","submitted_at":"2025-05-10T14:23:37Z","title":"TS-SUPERB: A Target Speech Processing Benchmark for Speech Self-Supervised Learning Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T22:40:24.283481Z"},"links":{"citing_paper":"/paper/2505.06660"},"observation_digest":"sha256:96b58c8867d723139bae2856dff22e401dd0913a1203c84d176d900f1c66a409","observation_id":"398f5d05-8de3-4bd0-89ec-86e8553024d8","resolution":{"observed_at":"2026-08-15T22:40:24.803295Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:40:24.784470Z","title":"Investigation of end-to-end speaker-attributed ASR for continuous multi-talker recordings,","venue":null,"work_id":"ed9e488d-116f-4774-8795-84a8299d8533","year":2021},"citing_paper":{"arxiv_id":"2505.06660","last_updated":"2025-05-10T14:23:37Z","snapshot_observed_at":"2026-08-15T22:34:33.223713Z","submitted_at":"2025-05-10T14:23:37Z","title":"TS-SUPERB: A Target Speech Processing Benchmark for Speech Self-Supervised Learning Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T22:40:24.287792Z"},"links":{"citing_paper":"/paper/2505.06660"},"observation_digest":"sha256:4bccf7187a51ede20114e6bde16b5316a39d0ec0771b8d23f007c9ed9540afc0","observation_id":"1192baa4-bb20-4471-9fad-ba5ef71e46d5","resolution":{"observed_at":"2026-08-15T22:40:24.789620Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:40:24.769199Z","title":"Personal V AD: Speaker-conditioned voice activity detection,","venue":null,"work_id":"f2f4d562-96c3-46d2-8cc1-f203029c4cfe","year":2020},"citing_paper":{"arxiv_id":"2505.06660","last_updated":"2025-05-10T14:23:37Z","snapshot_observed_at":"2026-08-15T22:34:33.223713Z","submitted_at":"2025-05-10T14:23:37Z","title":"TS-SUPERB: A Target Speech Processing Benchmark for Speech Self-Supervised Learning Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T22:40:24.291999Z"},"links":{"citing_paper":"/paper/2505.06660"},"observation_digest":"sha256:179c55447e0fd42a00670865117527f6ab79d531b199cb519b45701b367d36d9","observation_id":"e7aa850d-1acb-4ff7-ab8b-cdb40d837382","resolution":{"observed_at":"2026-08-15T22:40:24.774051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:40:24.754177Z","title":"Look once to hear: Target speech hearing with noisy examples,","venue":null,"work_id":"7e449639-8f07-4762-9ce9-5d76a8fa3ad7","year":2024},"citing_paper":{"arxiv_id":"2505.06660","last_updated":"2025-05-10T14:23:37Z","snapshot_observed_at":"2026-08-15T22:34:33.223713Z","submitted_at":"2025-05-10T14:23:37Z","title":"TS-SUPERB: A Target Speech Processing Benchmark for Speech Self-Supervised Learning Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T22:40:24.296467Z"},"links":{"citing_paper":"/paper/2505.06660"},"observation_digest":"sha256:6f54c25db445d05a678b6b87f82484bec04085d7c39c5c142bdf39db10488bdb","observation_id":"675fc2cf-73ab-4d85-9220-69b14f1eb7cd","resolution":{"observed_at":"2026-08-15T22:40:24.759180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.04175","last_updated":"2022-09-19T14:54:51Z","snapshot_observed_at":"2026-08-16T16:33:42.577188Z","submitted_at":"2022-09-09T08:21:41Z","title":"Streaming Target-Speaker ASR with Neural Transducer","version":2},"cited_work":{"arxiv_id":"2209.04175","doi":null,"metadata_source":"pith","pith_arxiv_id":"2209.04175","snapshot_observed_at":"2026-08-15T22:40:24.445198Z","title":"Streaming Target-Speaker ASR with Neural Transducer","venue":"eess.AS","work_id":"a4cd5992-ac35-4ffe-9a89-ab9c1a1f4630","year":2022},"citing_paper":{"arxiv_id":"2505.06660","last_updated":"2025-05-10T14:23:37Z","snapshot_observed_at":"2026-08-15T22:34:33.223713Z","submitted_at":"2025-05-10T14:23:37Z","title":"TS-SUPERB: A Target Speech Processing Benchmark for Speech Self-Supervised Learning Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T22:40:24.300777Z"},"links":{"cited_paper":"/paper/2209.04175","citing_paper":"/paper/2505.06660"},"observation_digest":"sha256:c3529ae4a544a236e1d45493b03242b9dbdd4e37d39db472b81ade0d86b68857","observation_id":"146998ed-4503-48c8-ae8e-43b58919e7f9","resolution":{"observed_at":"2026-08-15T22:40:24.452174Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:40:24.738652Z","title":"Target speech extraction with pre-trained self-supervised learning mod- els,","venue":null,"work_id":"b5dc8705-6dab-4bd1-8e86-2ccc73edd433","year":2024},"citing_paper":{"arxiv_id":"2505.06660","last_updated":"2025-05-10T14:23:37Z","snapshot_observed_at":"2026-08-15T22:34:33.223713Z","submitted_at":"2025-05-10T14:23:37Z","title":"TS-SUPERB: A Target Speech Processing Benchmark for Speech Self-Supervised Learning Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T22:40:24.305719Z"},"links":{"citing_paper":"/paper/2505.06660"},"observation_digest":"sha256:4224bbfaf548501745b8caa9bf3a7ff688c23ff9cbe05c8a84a5d337f773943e","observation_id":"5e94ae9e-7a86-4003-ba52-0f1b2aa5016e","resolution":{"observed_at":"2026-08-15T22:40:24.743535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:40:24.709749Z","title":"Improving speaker verification with self-pretrained trans- former models,","venue":null,"work_id":"fb1e63cd-5ebd-4f58-b835-55b07013a4a9","year":2023},"citing_paper":{"arxiv_id":"2505.06660","last_updated":"2025-05-10T14:23:37Z","snapshot_observed_at":"2026-08-15T22:34:33.223713Z","submitted_at":"2025-05-10T14:23:37Z","title":"TS-SUPERB: A Target Speech Processing Benchmark for Speech Self-Supervised Learning Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T22:40:24.314603Z"},"links":{"citing_paper":"/paper/2505.06660"},"observation_digest":"sha256:11b255ea3a01046cac251be5e30b1d0a8bc75cb6419a7b7be32f726943519a37","observation_id":"f5485c06-0134-4767-9267-42a6f9fe8399","resolution":{"observed_at":"2026-08-15T22:40:24.714291Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:40:24.695975Z","title":"Weakly-supervised speech pre-training: A case study on target speech recognition,","venue":null,"work_id":"2bb0224f-0980-4598-b0bf-f40229540556","year":2023},"citing_paper":{"arxiv_id":"2505.06660","last_updated":"2025-05-10T14:23:37Z","snapshot_observed_at":"2026-08-15T22:34:33.223713Z","submitted_at":"2025-05-10T14:23:37Z","title":"TS-SUPERB: A Target Speech Processing Benchmark for Speech Self-Supervised Learning Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T22:40:24.318965Z"},"links":{"citing_paper":"/paper/2505.06660"},"observation_digest":"sha256:b76bb3d52513745cb09dd95af18bb8f64edebda65a6fe151a3133110f0343e7e","observation_id":"2b429272-a3e1-4bce-9d1d-0b87a4ecd360","resolution":{"observed_at":"2026-08-15T22:40:24.700395Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:40:24.681054Z","title":"Towards learning a universal non-semantic representation of speech,","venue":null,"work_id":"e267295d-9922-40e8-a287-b1f97f506714","year":2020},"citing_paper":{"arxiv_id":"2505.06660","last_updated":"2025-05-10T14:23:37Z","snapshot_observed_at":"2026-08-15T22:34:33.223713Z","submitted_at":"2025-05-10T14:23:37Z","title":"TS-SUPERB: A Target Speech Processing Benchmark for Speech Self-Supervised Learning Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T22:40:24.323318Z"},"links":{"citing_paper":"/paper/2505.06660"},"observation_digest":"sha256:b5a8b0e1ed7022211f450ab8167eb62d5011a5faba0a715759c7d038d5fd7e79","observation_id":"d555c8ee-3c8b-4475-add5-a799bf5cc609","resolution":{"observed_at":"2026-08-15T22:40:24.686113Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:40:24.665713Z","title":"LeBenchmark: A reproducible framework for assessing self-supervised representation learning from speech,","venue":null,"work_id":"e729a69c-be1a-4134-9e65-18e37c645706","year":2021},"citing_paper":{"arxiv_id":"2505.06660","last_updated":"2025-05-10T14:23:37Z","snapshot_observed_at":"2026-08-15T22:34:33.223713Z","submitted_at":"2025-05-10T14:23:37Z","title":"TS-SUPERB: A Target Speech Processing Benchmark for Speech Self-Supervised Learning Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T22:40:24.327710Z"},"links":{"citing_paper":"/paper/2505.06660"},"observation_digest":"sha256:c8cbef81278365e76cca372655ca95601deb1c7ef8cfeb6a812f3d52bd18e98e","observation_id":"6ea2e9d7-439d-4733-9eb4-7659d32409e4","resolution":{"observed_at":"2026-08-15T22:40:24.670428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:40:24.650979Z","title":"LeBench- mark 2.0: A standardized, replicable and enhanced framework for self-supervised representations of French speech,","venue":null,"work_id":"f332d9e2-7b61-4a06-991a-a4f6db6e3377","year":2024},"citing_paper":{"arxiv_id":"2505.06660","last_updated":"2025-05-10T14:23:37Z","snapshot_observed_at":"2026-08-15T22:34:33.223713Z","submitted_at":"2025-05-10T14:23:37Z","title":"TS-SUPERB: A Target Speech Processing Benchmark for Speech Self-Supervised Learning Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T22:40:24.331845Z"},"links":{"citing_paper":"/paper/2505.06660"},"observation_digest":"sha256:2a0383d1f58b6002d3cb455681993712ea2c42bbe30ecbf1a65b5847f36e0c9c","observation_id":"1a6983d9-7974-45d8-a2f7-911c55357345","resolution":{"observed_at":"2026-08-15T22:40:24.655542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:40:24.636439Z","title":"HAER: Holis- tic evaluation of audio representations,","venue":null,"work_id":"213edaac-cfae-4353-b729-cc4e43a87502","year":2021},"citing_paper":{"arxiv_id":"2505.06660","last_updated":"2025-05-10T14:23:37Z","snapshot_observed_at":"2026-08-15T22:34:33.223713Z","submitted_at":"2025-05-10T14:23:37Z","title":"TS-SUPERB: A Target Speech Processing Benchmark for Speech Self-Supervised Learning Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T22:40:24.335960Z"},"links":{"citing_paper":"/paper/2505.06660"},"observation_digest":"sha256:113a0b39ea48e5f9c8d454e4452dc116d18db987b9a8c2933cac714205fb3015","observation_id":"362edf83-b403-48c5-b8a4-a8b295943a57","resolution":{"observed_at":"2026-08-15T22:40:24.641072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:40:24.621854Z","title":"XTREME-S: Evaluating cross-lingual speech representations,","venue":null,"work_id":"17297edc-748a-445f-97d1-b2ae2e45c011","year":2022},"citing_paper":{"arxiv_id":"2505.06660","last_updated":"2025-05-10T14:23:37Z","snapshot_observed_at":"2026-08-15T22:34:33.223713Z","submitted_at":"2025-05-10T14:23:37Z","title":"TS-SUPERB: A Target Speech Processing Benchmark for Speech Self-Supervised Learning Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T22:40:24.340470Z"},"links":{"citing_paper":"/paper/2505.06660"},"observation_digest":"sha256:c05b88fe647ad48e16762e4008462cc4fac10e5c5ebb239f3b1d8690d76f9100","observation_id":"9d71a648-273a-41a2-97a1-f6310443bfce","resolution":{"observed_at":"2026-08-15T22:40:24.626432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:40:24.605860Z","title":"Unveiling the linguistic capabilities of a self-supervised speech model through cross- lingual benchmark and layer-wise similarity analysis,","venue":null,"work_id":"49f0a91f-8748-40a2-a570-917e9cb5817c","year":2024},"citing_paper":{"arxiv_id":"2505.06660","last_updated":"2025-05-10T14:23:37Z","snapshot_observed_at":"2026-08-15T22:34:33.223713Z","submitted_at":"2025-05-10T14:23:37Z","title":"TS-SUPERB: A Target Speech Processing Benchmark for Speech Self-Supervised Learning Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T22:40:24.344836Z"},"links":{"citing_paper":"/paper/2505.06660"},"observation_digest":"sha256:7640f67f29cef9179c1b79da1b4cb1196f2cd1f1bfd004ba9e6fd7796426d374","observation_id":"8a372400-515e-48b2-a9f2-1c653362b07c","resolution":{"observed_at":"2026-08-15T22:40:24.611195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:40:24.723954Z","title":"Adapting self- supervised models to multi-talker speech recognition using speaker embeddings,","venue":null,"work_id":"3872642d-bdc2-47f4-850b-e734939246bb","year":2023},"citing_paper":{"arxiv_id":"2505.06660","last_updated":"2025-05-10T14:23:37Z","snapshot_observed_at":"2026-08-15T22:34:33.223713Z","submitted_at":"2025-05-10T14:23:37Z","title":"TS-SUPERB: A Target Speech Processing Benchmark for Speech Self-Supervised Learning Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T22:40:24.349060Z"},"links":{"citing_paper":"/paper/2505.06660"},"observation_digest":"sha256:104a8078f9ed6db22fbed2925c8a2ac40dff7cccd62ffa3d5b522d635dcc2c8e","observation_id":"9383147d-6d93-4388-b3f0-2e0a897ca058","resolution":{"observed_at":"2026-08-15T22:40:24.728813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.11262","last_updated":"2020-05-22T16:26:54Z","snapshot_observed_at":"2026-08-15T22:07:29.787968Z","submitted_at":"2020-05-22T16:26:54Z","title":"LibriMix: An Open-Source Dataset for Generalizable Speech Separation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.11262","snapshot_observed_at":"2026-08-15T22:40:24.353352Z","title":"LibriMix: An open-source dataset for generalizable speech separation,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.06660","last_updated":"2025-05-10T14:23:37Z","snapshot_observed_at":"2026-08-15T22:34:33.223713Z","submitted_at":"2025-05-10T14:23:37Z","title":"TS-SUPERB: A Target Speech Processing Benchmark for Speech Self-Supervised Learning Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T22:40:24.353352Z"},"links":{"cited_paper":"/paper/2005.11262","citing_paper":"/paper/2505.06660"},"observation_digest":"sha256:444a1af4129f40f71f1b80d333d283879658f65e2389a2d70e5996b7386cb9a3","observation_id":"8ef09ace-19ae-419c-9c2c-3c6142c2b8d0","resolution":{"observed_at":"2026-08-15T22:40:24.353352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:40:24.358081Z","title":"LibriSpeech: An ASR corpus based on public domain audio books,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.06660","last_updated":"2025-05-10T14:23:37Z","snapshot_observed_at":"2026-08-15T22:34:33.223713Z","submitted_at":"2025-05-10T14:23:37Z","title":"TS-SUPERB: A Target Speech Processing Benchmark for Speech Self-Supervised Learning Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T22:40:24.358081Z"},"links":{"citing_paper":"/paper/2505.06660"},"observation_digest":"sha256:fe27987e44404f12e44c318bd385b2709fedf5059e31c831fe94ba0ab89175bb","observation_id":"b7eaec12-e45c-43a3-b108-53cb58797a7d","resolution":{"observed_at":"2026-08-15T22:40:24.358081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:40:24.581296Z","title":"WHAM!: Extending speech separation to noisy environments,","venue":null,"work_id":"1c5e33b8-12a2-410d-8bb9-c2f966f3eaa7","year":2019},"citing_paper":{"arxiv_id":"2505.06660","last_updated":"2025-05-10T14:23:37Z","snapshot_observed_at":"2026-08-15T22:34:33.223713Z","submitted_at":"2025-05-10T14:23:37Z","title":"TS-SUPERB: A Target Speech Processing Benchmark for Speech Self-Supervised Learning Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T22:40:24.362573Z"},"links":{"citing_paper":"/paper/2505.06660"},"observation_digest":"sha256:37eb5d5c3c8e3eca1914696c75b0578f226f0fce10910f6d085f97896dec85a5","observation_id":"69f20a83-1c5e-4535-ab34-0071e6555db8","resolution":{"observed_at":"2026-08-15T22:40:24.585822Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:40:24.566239Z","title":"Continuous speech separation: Dataset and analysis,","venue":null,"work_id":"059bf50a-d2ef-404d-b079-17eb09815162","year":2020},"citing_paper":{"arxiv_id":"2505.06660","last_updated":"2025-05-10T14:23:37Z","snapshot_observed_at":"2026-08-15T22:34:33.223713Z","submitted_at":"2025-05-10T14:23:37Z","title":"TS-SUPERB: A Target Speech Processing Benchmark for Speech Self-Supervised Learning Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T22:40:24.366751Z"},"links":{"citing_paper":"/paper/2505.06660"},"observation_digest":"sha256:65b5f030e7bc2887801b72a5a4471fa30ef83263aef47b214530c510841e932f","observation_id":"2ce168fd-24bc-48b9-9e44-86d9ab45c703","resolution":{"observed_at":"2026-08-15T22:40:24.570910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:40:24.551623Z","title":"Probing self-supervised learning models with target speech extraction,","venue":null,"work_id":"401add1c-53ac-4aea-8595-4acfc9a4c5d9","year":2024},"citing_paper":{"arxiv_id":"2505.06660","last_updated":"2025-05-10T14:23:37Z","snapshot_observed_at":"2026-08-15T22:34:33.223713Z","submitted_at":"2025-05-10T14:23:37Z","title":"TS-SUPERB: A Target Speech Processing Benchmark for Speech Self-Supervised Learning Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T22:40:24.370977Z"},"links":{"citing_paper":"/paper/2505.06660"},"observation_digest":"sha256:a9706c9d46ea010a6ea2c057105a2fb6308c7424adf40dd2287941f72665f301","observation_id":"a73aa9e6-46eb-481a-a6a4-a72a2fd5ed01","resolution":{"observed_at":"2026-08-15T22:40:24.556020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:40:24.537372Z","title":"Listen only to me! How well can target speech extraction handle false alarms?","venue":null,"work_id":"4033becf-b020-43e1-9dff-e524eefe8d34","year":2022},"citing_paper":{"arxiv_id":"2505.06660","last_updated":"2025-05-10T14:23:37Z","snapshot_observed_at":"2026-08-15T22:34:33.223713Z","submitted_at":"2025-05-10T14:23:37Z","title":"TS-SUPERB: A Target Speech Processing Benchmark for Speech Self-Supervised Learning Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T22:40:24.375307Z"},"links":{"citing_paper":"/paper/2505.06660"},"observation_digest":"sha256:eb6faee88a73ae88393ca70188d0233b06d4ec85d47bcf6ada7418b78cd18076","observation_id":"807e7b3d-0129-449e-9502-9372bd976293","resolution":{"observed_at":"2026-08-15T22:40:24.541981Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:40:24.521985Z","title":"KenLM: Faster and smaller language model queries,","venue":null,"work_id":"5a934849-254c-482f-8355-caaadb6f182f","year":2011},"citing_paper":{"arxiv_id":"2505.06660","last_updated":"2025-05-10T14:23:37Z","snapshot_observed_at":"2026-08-15T22:34:33.223713Z","submitted_at":"2025-05-10T14:23:37Z","title":"TS-SUPERB: A Target Speech Processing Benchmark for Speech Self-Supervised Learning Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T22:40:24.379466Z"},"links":{"citing_paper":"/paper/2505.06660"},"observation_digest":"sha256:81897ccc71b64fa0f3981b548e044b4e492e0a7b7e16f1807a4b97e96504abd0","observation_id":"1d37a14c-3ba7-48e0-af82-8051fc4cfbc7","resolution":{"observed_at":"2026-08-15T22:40:24.526458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:40:24.507107Z","title":"Wav2Letter++: A fast open-source speech recognition system,","venue":null,"work_id":"af3ec4ec-8692-4c21-a19d-45867b8d5569","year":2019},"citing_paper":{"arxiv_id":"2505.06660","last_updated":"2025-05-10T14:23:37Z","snapshot_observed_at":"2026-08-15T22:34:33.223713Z","submitted_at":"2025-05-10T14:23:37Z","title":"TS-SUPERB: A Target Speech Processing Benchmark for Speech Self-Supervised Learning Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T22:40:24.383794Z"},"links":{"citing_paper":"/paper/2505.06660"},"observation_digest":"sha256:185ca6934ad2234133085ad831cf4b05b6315841b885b895bf6d308d1d4ef534","observation_id":"a3b660cb-319f-41d7-b0f8-3c5088f27e33","resolution":{"observed_at":"2026-08-15T22:40:24.511762Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:40:24.492089Z","title":"Improving speaker discrimination of target speech extraction with time-domain speakerbeam,","venue":null,"work_id":"b3d7f0cb-c29c-4f18-93b9-22879a31e30e","year":2020},"citing_paper":{"arxiv_id":"2505.06660","last_updated":"2025-05-10T14:23:37Z","snapshot_observed_at":"2026-08-15T22:34:33.223713Z","submitted_at":"2025-05-10T14:23:37Z","title":"TS-SUPERB: A Target Speech Processing Benchmark for Speech Self-Supervised Learning Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T22:40:24.388137Z"},"links":{"citing_paper":"/paper/2505.06660"},"observation_digest":"sha256:e92c7d3d44d130944eaf51b32e246afb76b68982a4bb5a836225438cec525c11","observation_id":"92d55267-af6d-4d5b-8a07-6fabe126b3de","resolution":{"observed_at":"2026-08-15T22:40:24.496993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:40:24.392435Z","title":"The proof and measurement of association between two things,","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2505.06660","last_updated":"2025-05-10T14:23:37Z","snapshot_observed_at":"2026-08-15T22:34:33.223713Z","submitted_at":"2025-05-10T14:23:37Z","title":"TS-SUPERB: A Target Speech Processing Benchmark for Speech Self-Supervised Learning Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T22:40:24.392435Z"},"links":{"citing_paper":"/paper/2505.06660"},"observation_digest":"sha256:fea648d9f657583dd67cdf6ec6737839ac5e099d2faddca550d7227b67949f33","observation_id":"67ae36e3-a184-4162-82f9-19c940895513","resolution":{"observed_at":"2026-08-15T22:40:24.392435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.06660","last_updated":"2025-05-10T14:23:37Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-15T22:34:33.223713Z","submitted_at":"2025-05-10T14:23:37Z","title":"TS-SUPERB: A Target Speech Processing Benchmark for Speech Self-Supervised Learning Models"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":7,"verified_exact":1,"verified_fuzzy":33},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 0 inbound Pith citation observations for arXiv:2505.06660."}