{"as_of":"2026-08-08T03:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cf446fa93250ac8e05ed66631b120de6a7973114fa9739b2b8f33e19915e5285","coverage":[{"denominator":51,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T17:58:41.063893Z","state":"measured"},{"denominator":52,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":52,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T17:58:34.654304Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T17:58:42.865534Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.09510","last_updated":"2025-08-09T08:29:03Z","snapshot_observed_at":"2026-08-06T17:51:32.335228Z","submitted_at":"2025-07-13T06:35:13Z","title":"Enhancing Target Speaker Extraction with Explicit Speaker Consistency Modeling","version":3},"cited_work":{"arxiv_id":"2507.09510","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.09510","snapshot_observed_at":"2026-08-06T17:58:42.865534Z","title":"Enhancing Target Speaker Extraction with Explicit Speaker Consistency Modeling","venue":"cs.SD","work_id":"f13c78f7-fb4f-4f03-9dd8-19fe2938fe5b","year":2025},"citing_paper":{"arxiv_id":"2507.09510","last_updated":"2025-08-09T08:29:03Z","snapshot_observed_at":"2026-08-06T17:51:32.335228Z","submitted_at":"2025-07-13T06:35:13Z","title":"Enhancing Target Speaker Extraction with Explicit Speaker Consistency Modeling","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T17:58:34.654304Z"},"links":{"cited_paper":"/paper/2507.09510","citing_paper":"/paper/2507.09510"},"observation_digest":"sha256:93c78a0f591799b905d777b44ba6d0b8c364b98ef3a36325bd66d433adce5f89","observation_id":"460796ea-b9b2-49bc-a537-08fdb67af52d","resolution":{"observed_at":"2026-08-06T17:58:42.987162Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.09510/citation-record","integrity":"/paper/2507.09510/integrity","json":"/paper/2507.09510/citation-record.json","paper":"/paper/2507.09510"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:58:52.895033Z","title":"The chal- lenge of isolating the target speech while ignoring other inter- ferences is known as the cocktail party problem [1]","venue":null,"work_id":"608374a6-9af3-465f-81da-f06a54c3a4e8","year":2017},"citing_paper":{"arxiv_id":"2507.09510","last_updated":"2025-08-09T08:29:03Z","snapshot_observed_at":"2026-08-06T17:51:32.335228Z","submitted_at":"2025-07-13T06:35:13Z","title":"Enhancing Target Speaker Extraction with Explicit Speaker Consistency Modeling","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T17:58:34.470611Z"},"links":{"citing_paper":"/paper/2507.09510"},"observation_digest":"sha256:45e7a63b1960ac915d9e94257c56add9cf7507925523a72d9b4ae431f66b6238","observation_id":"870e7914-99ff-4e70-b38b-98f092d64188","resolution":{"observed_at":"2026-08-06T17:58:53.038346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.09510","last_updated":"2025-08-09T08:29:03Z","snapshot_observed_at":"2026-08-06T17:51:32.335228Z","submitted_at":"2025-07-13T06:35:13Z","title":"Enhancing Target Speaker Extraction with Explicit Speaker Consistency Modeling","version":3},"cited_work":{"arxiv_id":"2507.09510","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.09510","snapshot_observed_at":"2026-08-06T17:58:42.865534Z","title":"Enhancing Target Speaker Extraction with Explicit Speaker Consistency Modeling","venue":"cs.SD","work_id":"f13c78f7-fb4f-4f03-9dd8-19fe2938fe5b","year":2025},"citing_paper":{"arxiv_id":"2507.09510","last_updated":"2025-08-09T08:29:03Z","snapshot_observed_at":"2026-08-06T17:51:32.335228Z","submitted_at":"2025-07-13T06:35:13Z","title":"Enhancing Target Speaker Extraction with Explicit Speaker Consistency Modeling","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T17:58:34.654304Z"},"links":{"cited_paper":"/paper/2507.09510","citing_paper":"/paper/2507.09510"},"observation_digest":"sha256:93c78a0f591799b905d777b44ba6d0b8c364b98ef3a36325bd66d433adce5f89","observation_id":"460796ea-b9b2-49bc-a537-08fdb67af52d","resolution":{"observed_at":"2026-08-06T17:58:42.987162Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:58:52.600540Z","title":"The proposed methods enhance overall performance, achieving state-of-the-art results","venue":null,"work_id":"00763e21-fea2-457d-ba90-f6f458aa5b1b","year":null},"citing_paper":{"arxiv_id":"2507.09510","last_updated":"2025-08-09T08:29:03Z","snapshot_observed_at":"2026-08-06T17:51:32.335228Z","submitted_at":"2025-07-13T06:35:13Z","title":"Enhancing Target Speaker Extraction with Explicit Speaker Consistency Modeling","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T17:58:34.551888Z"},"links":{"citing_paper":"/paper/2507.09510"},"observation_digest":"sha256:711b7f65a00aad35578c9c72c62e3b9ff91f21ffa270c1a5150651c3b8211004","observation_id":"5eb2f227-2ea8-410d-b8b2-2201a0991e5a","resolution":{"observed_at":"2026-08-06T17:58:52.741434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:58:52.300539Z","title":"Dataset We use the clean Libri2Mix [26] dataset with two-speaker mix- tures","venue":null,"work_id":"77a33258-0032-45f8-99f5-0e41232b602a","year":null},"citing_paper":{"arxiv_id":"2507.09510","last_updated":"2025-08-09T08:29:03Z","snapshot_observed_at":"2026-08-06T17:51:32.335228Z","submitted_at":"2025-07-13T06:35:13Z","title":"Enhancing Target Speaker Extraction with Explicit Speaker Consistency Modeling","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T17:58:34.793706Z"},"links":{"citing_paper":"/paper/2507.09510"},"observation_digest":"sha256:180d1b02d422f80233e1a64af36354613fdd3ee1e741e624d3520a2e0768676b","observation_id":"cab9f041-ad09-4942-af0c-63b64cb3edf0","resolution":{"observed_at":"2026-08-06T17:58:52.458594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:58:50.795496Z","title":null,"venue":null,"work_id":"0d00e850-dd89-4165-b294-2e3a8cbc641c","year":null},"citing_paper":{"arxiv_id":"2507.09510","last_updated":"2025-08-09T08:29:03Z","snapshot_observed_at":"2026-08-06T17:51:32.335228Z","submitted_at":"2025-07-13T06:35:13Z","title":"Enhancing Target Speaker Extraction with Explicit Speaker Consistency Modeling","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T17:58:35.711552Z"},"links":{"citing_paper":"/paper/2507.09510"},"observation_digest":"sha256:e459238d10702b7f479957832812a998a05e88c7816caa5727c34762eafa4c18","observation_id":"c075f8a8-3d53-4810-bb23-37fc9b388278","resolution":{"observed_at":"2026-08-06T17:58:50.898381Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:58:51.767266Z","title":"Comparative studies with proposed methods Table 1 presents the performance of BSRNN with proposed methods on Libri2Mix","venue":null,"work_id":"3dd1176e-c60f-46ca-a58d-ce729f0534b2","year":null},"citing_paper":{"arxiv_id":"2507.09510","last_updated":"2025-08-09T08:29:03Z","snapshot_observed_at":"2026-08-06T17:51:32.335228Z","submitted_at":"2025-07-13T06:35:13Z","title":"Enhancing Target Speaker Extraction with Explicit Speaker Consistency Modeling","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T17:58:35.033551Z"},"links":{"citing_paper":"/paper/2507.09510"},"observation_digest":"sha256:07d7b3aaecda134ec67d01de8a6eb0c7fa64e9196754a302b53c5fdc91e9554a","observation_id":"337e1f65-c57a-4676-86b4-feffcd802435","resolution":{"observed_at":"2026-08-06T17:58:51.893049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:58:51.522045Z","title":"and other metrics in all scenarios","venue":null,"work_id":"ac6e973e-970a-4d1c-a030-5a72e22cbc1b","year":null},"citing_paper":{"arxiv_id":"2507.09510","last_updated":"2025-08-09T08:29:03Z","snapshot_observed_at":"2026-08-06T17:51:32.335228Z","submitted_at":"2025-07-13T06:35:13Z","title":"Enhancing Target Speaker Extraction with Explicit Speaker Consistency Modeling","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T17:58:35.199613Z"},"links":{"citing_paper":"/paper/2507.09510"},"observation_digest":"sha256:04909562b50e35854f838143edcccdfd48e48e4527501b32df2b1d9ad8f7d247","observation_id":"db43320f-9074-446f-bf5f-854a9124fb86","resolution":{"observed_at":"2026-08-06T17:58:51.611443Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:58:51.273009Z","title":"For ResNet34 in pretrained mode, SI-SDR improved by 0.43 dB, accuracy by 1.56%, and Sim","venue":null,"work_id":"616cde51-c721-4407-8a30-cf3c02ac76e2","year":null},"citing_paper":{"arxiv_id":"2507.09510","last_updated":"2025-08-09T08:29:03Z","snapshot_observed_at":"2026-08-06T17:51:32.335228Z","submitted_at":"2025-07-13T06:35:13Z","title":"Enhancing Target Speaker Extraction with Explicit Speaker Consistency Modeling","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T17:58:35.317717Z"},"links":{"citing_paper":"/paper/2507.09510"},"observation_digest":"sha256:230c7560e989c2a2d04eb78ad829f0ff229171eed9399cfc5bfbc0b9b419459f","observation_id":"822d6794-86b9-46b5-8b5b-4d94271d6249","resolution":{"observed_at":"2026-08-06T17:58:51.397031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:58:51.024546Z","title":"However, a slight decrease in the Sim","venue":null,"work_id":"fd4014b1-effd-4ed6-aa73-0841fb0faf42","year":null},"citing_paper":{"arxiv_id":"2507.09510","last_updated":"2025-08-09T08:29:03Z","snapshot_observed_at":"2026-08-06T17:51:32.335228Z","submitted_at":"2025-07-13T06:35:13Z","title":"Enhancing Target Speaker Extraction with Explicit Speaker Consistency Modeling","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T17:58:35.445487Z"},"links":{"citing_paper":"/paper/2507.09510"},"observation_digest":"sha256:15d919c12043a829e6fd59486c823e39ec94afac88bfc3735e93c67e03df35c8","observation_id":"28f2b8ea-0ebd-44eb-9479-22d2da22a519","resolution":{"observed_at":"2026-08-06T17:58:51.118859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"9286.9286","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:58:42.659108Z","title":null,"venue":null,"work_id":"6a4c8d96-c9f9-43d8-aead-36fc3c217fe4","year":1915},"citing_paper":{"arxiv_id":"2507.09510","last_updated":"2025-08-09T08:29:03Z","snapshot_observed_at":"2026-08-06T17:51:32.335228Z","submitted_at":"2025-07-13T06:35:13Z","title":"Enhancing Target Speaker Extraction with Explicit Speaker Consistency Modeling","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T17:58:35.564318Z"},"links":{"citing_paper":"/paper/2507.09510"},"observation_digest":"sha256:926feab2dfe92f5d8ab0284cd700edd2c9001563681f8583e48e1f38d4b60413","observation_id":"f050ae84-64f6-4b44-bd57-609f7e050a6b","resolution":{"observed_at":"2026-08-06T17:58:42.746251Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/interspeech.2020-1397","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:58:41.481771Z","title":"Spex+: A complete time domain speaker extraction network,","venue":null,"work_id":"0a110c3e-a438-409f-ab6e-f11395bbf0fc","year":2020},"citing_paper":{"arxiv_id":"2507.09510","last_updated":"2025-08-09T08:29:03Z","snapshot_observed_at":"2026-08-06T17:51:32.335228Z","submitted_at":"2025-07-13T06:35:13Z","title":"Enhancing Target Speaker Extraction with Explicit Speaker Consistency Modeling","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T17:58:37.093240Z"},"links":{"citing_paper":"/paper/2507.09510"},"observation_digest":"sha256:37b1383418736ab78db3a9a1e36629c9616c27fb6fc81301ad713b9fc5c01ee6","observation_id":"57c6b5e7-099a-4b66-b1c0-2b9c376c295c","resolution":{"observed_at":"2026-08-06T17:58:41.640664Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:58:50.582118Z","title":"Some further experiments upon the recognition of speech, with one and with two ears,","venue":null,"work_id":"e49fe7a8-15e0-4014-ad69-26eec12fae14","year":1954},"citing_paper":{"arxiv_id":"2507.09510","last_updated":"2025-08-09T08:29:03Z","snapshot_observed_at":"2026-08-06T17:51:32.335228Z","submitted_at":"2025-07-13T06:35:13Z","title":"Enhancing Target Speaker Extraction with Explicit Speaker Consistency Modeling","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T17:58:35.827574Z"},"links":{"citing_paper":"/paper/2507.09510"},"observation_digest":"sha256:d2930010a1951467b8ee1b9d5b57412ef65bd489b1f48f51e5b81b1e58c7a2a6","observation_id":"4e26e3b0-37c9-44a3-aacb-3604a1ade830","resolution":{"observed_at":"2026-08-06T17:58:50.695497Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:58:50.291421Z","title":"The cocktail-party problem revisited: early process- ing and selection of multi-talker speech,","venue":null,"work_id":"938f5ee9-4538-495b-8103-ecb46a10361a","year":2015},"citing_paper":{"arxiv_id":"2507.09510","last_updated":"2025-08-09T08:29:03Z","snapshot_observed_at":"2026-08-06T17:51:32.335228Z","submitted_at":"2025-07-13T06:35:13Z","title":"Enhancing Target Speaker Extraction with Explicit Speaker Consistency Modeling","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T17:58:35.953626Z"},"links":{"citing_paper":"/paper/2507.09510"},"observation_digest":"sha256:b0c38ecdf3934b945b01469360d04337d6253af0c411effecbe40832fb12edc3","observation_id":"861f1f0d-d5cb-473c-8324-3503423679c5","resolution":{"observed_at":"2026-08-06T17:58:50.464346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:58:50.027196Z","title":"Speakerbeam: Speaker aware neural network for target speaker extraction in speech mixtures,","venue":null,"work_id":"9e717fcf-d87c-4e71-bfe8-00172c112142","year":2019},"citing_paper":{"arxiv_id":"2507.09510","last_updated":"2025-08-09T08:29:03Z","snapshot_observed_at":"2026-08-06T17:51:32.335228Z","submitted_at":"2025-07-13T06:35:13Z","title":"Enhancing Target Speaker Extraction with Explicit Speaker Consistency Modeling","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T17:58:36.061089Z"},"links":{"citing_paper":"/paper/2507.09510"},"observation_digest":"sha256:b4ca8d7060bbc458f2154ba981c3fb6b9cb663a7bcde31171f1d985c2cf0cd50","observation_id":"7d027329-0848-4d74-a6a2-05b65b530330","resolution":{"observed_at":"2026-08-06T17:58:50.159472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:58:49.808125Z","title":"Adaptive blind audio source extraction supervised by dom- inant speaker identification using x-vectors,","venue":null,"work_id":"4df5b244-d5a4-41f7-8660-ceeb528d51f3","year":2020},"citing_paper":{"arxiv_id":"2507.09510","last_updated":"2025-08-09T08:29:03Z","snapshot_observed_at":"2026-08-06T17:51:32.335228Z","submitted_at":"2025-07-13T06:35:13Z","title":"Enhancing Target Speaker Extraction with Explicit Speaker Consistency Modeling","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T17:58:36.196820Z"},"links":{"citing_paper":"/paper/2507.09510"},"observation_digest":"sha256:fd85032d842165ee5aec89bc2f2f47b6072b69484bb6a28cb1c0289a730cceb6","observation_id":"22189dbc-c058-4ea1-abee-5f7698904856","resolution":{"observed_at":"2026-08-06T17:58:49.916815Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:58:36.334856Z","title":"Looking to listen at the cocktail party: A speaker-independent audio-visual model for speech separation,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.09510","last_updated":"2025-08-09T08:29:03Z","snapshot_observed_at":"2026-08-06T17:51:32.335228Z","submitted_at":"2025-07-13T06:35:13Z","title":"Enhancing Target Speaker Extraction with Explicit Speaker Consistency Modeling","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T17:58:36.334856Z"},"links":{"citing_paper":"/paper/2507.09510"},"observation_digest":"sha256:7f6599e6a301e2bb49a483939d4a4e366d0406d6396c0204761be57c20c02f43","observation_id":"79c0e0c6-74b9-4def-8d3a-9f331e82fed9","resolution":{"observed_at":"2026-08-06T17:58:36.334856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:58:49.537373Z","title":"Audio-visual sound separation via hidden markov models,","venue":null,"work_id":"5fdb9505-cd28-4410-b1c9-92ee0a8aab80","year":2001},"citing_paper":{"arxiv_id":"2507.09510","last_updated":"2025-08-09T08:29:03Z","snapshot_observed_at":"2026-08-06T17:51:32.335228Z","submitted_at":"2025-07-13T06:35:13Z","title":"Enhancing Target Speaker Extraction with Explicit Speaker Consistency Modeling","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T17:58:36.449562Z"},"links":{"citing_paper":"/paper/2507.09510"},"observation_digest":"sha256:0ed9f9024f3e7244ada7159139f9566f3cb7bd2b5f5f2bfd62ecdb1a4997b80a","observation_id":"f6b3d310-16e3-40f0-a688-f132e61e3109","resolution":{"observed_at":"2026-08-06T17:58:49.657251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/interspeech.2019-2266","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:58:41.796323Z","title":"Neural spatial filter: Target speaker speech separation assisted with directional information,","venue":null,"work_id":"2ce91c55-854a-41fc-bbc7-e426b4246f60","year":2019},"citing_paper":{"arxiv_id":"2507.09510","last_updated":"2025-08-09T08:29:03Z","snapshot_observed_at":"2026-08-06T17:51:32.335228Z","submitted_at":"2025-07-13T06:35:13Z","title":"Enhancing Target Speaker Extraction with Explicit Speaker Consistency Modeling","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T17:58:36.579776Z"},"links":{"citing_paper":"/paper/2507.09510"},"observation_digest":"sha256:8a1a8e72b8fc9a8ccaa44d937cd508de03a76e7ce3894cd8af0745b09f0a6fe1","observation_id":"af15a8ea-4823-4eef-a39e-c93bd86e7267","resolution":{"observed_at":"2026-08-06T17:58:41.908685Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:58:49.252222Z","title":"V oice filter: Few- shot text-to-speech speaker adaptation using voice conversion as a post- processing module,","venue":null,"work_id":"1cfcfec6-3e8f-43e1-8ff2-36e7fe924144","year":2022},"citing_paper":{"arxiv_id":"2507.09510","last_updated":"2025-08-09T08:29:03Z","snapshot_observed_at":"2026-08-06T17:51:32.335228Z","submitted_at":"2025-07-13T06:35:13Z","title":"Enhancing Target Speaker Extraction with Explicit Speaker Consistency Modeling","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T17:58:36.727248Z"},"links":{"citing_paper":"/paper/2507.09510"},"observation_digest":"sha256:aff16d88a1fc758fb2ec3076debc5804788dda87df64e6eb1f44f8ac158d0672","observation_id":"0f880b43-d2f2-41c2-8626-efe03a73eef1","resolution":{"observed_at":"2026-08-06T17:58:49.408598Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:58:36.849729Z","title":"Single-channel speech extraction using speaker inventory and attention network,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.09510","last_updated":"2025-08-09T08:29:03Z","snapshot_observed_at":"2026-08-06T17:51:32.335228Z","submitted_at":"2025-07-13T06:35:13Z","title":"Enhancing Target Speaker Extraction with Explicit Speaker Consistency Modeling","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T17:58:36.849729Z"},"links":{"citing_paper":"/paper/2507.09510"},"observation_digest":"sha256:585e1abcde3727eb61d1fdf2d51e53cd693b0d4dbb3773106498d47a3c7199b1","observation_id":"5c1b3112-7e5e-434f-95f4-fe3f2eedf8d1","resolution":{"observed_at":"2026-08-06T17:58:36.849729Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:58:48.993955Z","title":"Target confusion in end- to-end speaker extraction: Analysis and approaches,","venue":null,"work_id":"b5125417-1478-45e5-8d8a-4663a467892b","year":2022},"citing_paper":{"arxiv_id":"2507.09510","last_updated":"2025-08-09T08:29:03Z","snapshot_observed_at":"2026-08-06T17:51:32.335228Z","submitted_at":"2025-07-13T06:35:13Z","title":"Enhancing Target Speaker Extraction with Explicit Speaker Consistency Modeling","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T17:58:36.966592Z"},"links":{"citing_paper":"/paper/2507.09510"},"observation_digest":"sha256:2bf8f1d079b7bc5fcdbe12d91bc94805a2987974abec7005250714791f55b3d9","observation_id":"0565405d-e347-4ded-91e0-f928a88263ed","resolution":{"observed_at":"2026-08-06T17:58:49.075349Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/interspeech.2021-1774","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:58:41.230995Z","title":"Sc-glowtts: an efficient zero-shot multi-speaker text-to-speech model,","venue":null,"work_id":"117c5da9-d9a9-4c1f-9e05-6683f4b4a5eb","year":2021},"citing_paper":{"arxiv_id":"2507.09510","last_updated":"2025-08-09T08:29:03Z","snapshot_observed_at":"2026-08-06T17:51:32.335228Z","submitted_at":"2025-07-13T06:35:13Z","title":"Enhancing Target Speaker Extraction with Explicit Speaker Consistency Modeling","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T17:58:38.645691Z"},"links":{"citing_paper":"/paper/2507.09510"},"observation_digest":"sha256:fa98f047b140cc0ae72362fcb95647c578e114d0e9499c6a4edbf950296b0ec0","observation_id":"f9a99aaa-3293-48a6-ae46-d0c273b5b740","resolution":{"observed_at":"2026-08-06T17:58:41.332281Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:58:48.698060Z","title":"X-sepformer: End-to-end speaker extraction network with explicit optimization on speaker confusion,","venue":null,"work_id":"02a757de-c27e-41a8-9e17-2e6c1f4cd065","year":2023},"citing_paper":{"arxiv_id":"2507.09510","last_updated":"2025-08-09T08:29:03Z","snapshot_observed_at":"2026-08-06T17:51:32.335228Z","submitted_at":"2025-07-13T06:35:13Z","title":"Enhancing Target Speaker Extraction with Explicit Speaker Consistency Modeling","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T17:58:37.191473Z"},"links":{"citing_paper":"/paper/2507.09510"},"observation_digest":"sha256:7950b87318d4453bc9f683d84118a8b8b4e05fe4bf188bd2b69e01e90551c485","observation_id":"6c39300c-79b4-4bd9-81f3-510e8762c787","resolution":{"observed_at":"2026-08-06T17:58:48.848806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:58:48.448053Z","title":"Speaker ex- traction with detection of presence and absence of target speakers,","venue":null,"work_id":"297e81b3-5c39-40ad-88bc-f04376c36753","year":2023},"citing_paper":{"arxiv_id":"2507.09510","last_updated":"2025-08-09T08:29:03Z","snapshot_observed_at":"2026-08-06T17:51:32.335228Z","submitted_at":"2025-07-13T06:35:13Z","title":"Enhancing Target Speaker Extraction with Explicit Speaker Consistency Modeling","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T17:58:37.334445Z"},"links":{"citing_paper":"/paper/2507.09510"},"observation_digest":"sha256:ffdbe9607e773355c295263b657c64d165f935eb72d54cc00a000ab0d6a48982","observation_id":"5b01aa03-ecc7-4709-9135-d444296e4cfd","resolution":{"observed_at":"2026-08-06T17:58:48.588117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:58:48.142205Z","title":"On the effectiveness of enrollment speech augmentation for target speaker extraction,","venue":null,"work_id":"10c24b27-afad-4941-b537-83251782bbe2","year":2024},"citing_paper":{"arxiv_id":"2507.09510","last_updated":"2025-08-09T08:29:03Z","snapshot_observed_at":"2026-08-06T17:51:32.335228Z","submitted_at":"2025-07-13T06:35:13Z","title":"Enhancing Target Speaker Extraction with Explicit Speaker Consistency Modeling","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T17:58:37.493824Z"},"links":{"citing_paper":"/paper/2507.09510"},"observation_digest":"sha256:ff20981a22fa9d9ee4ff7f677c8445b1043d4859315febb1ddc94cea28bffa1e","observation_id":"a27b6499-477a-4aa7-9b33-2cb633290a4c","resolution":{"observed_at":"2026-08-06T17:58:48.321486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:58:47.863580Z","title":"Selective hubert: Self- supervised pre-training for target speaker in clean and mixture speech,","venue":null,"work_id":"468febc1-525e-4ab0-83d4-7e3af7a3fb9c","year":2024},"citing_paper":{"arxiv_id":"2507.09510","last_updated":"2025-08-09T08:29:03Z","snapshot_observed_at":"2026-08-06T17:51:32.335228Z","submitted_at":"2025-07-13T06:35:13Z","title":"Enhancing Target Speaker Extraction with Explicit Speaker Consistency Modeling","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T17:58:37.612121Z"},"links":{"citing_paper":"/paper/2507.09510"},"observation_digest":"sha256:85b5651ec6d14ab65c8c891a887ff046fba18a2893ae68f5fd164c793c901077","observation_id":"65129ac3-5d07-47d4-a9ac-157856c1a130","resolution":{"observed_at":"2026-08-06T17:58:47.974497Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:58:47.285819Z","title":"Contrastive learning for target speaker extraction with attention-based fusion,","venue":null,"work_id":"744c28cb-d2f3-4e5c-a303-a1dfe459f3a9","year":2024},"citing_paper":{"arxiv_id":"2507.09510","last_updated":"2025-08-09T08:29:03Z","snapshot_observed_at":"2026-08-06T17:51:32.335228Z","submitted_at":"2025-07-13T06:35:13Z","title":"Enhancing Target Speaker Extraction with Explicit Speaker Consistency Modeling","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T17:58:37.916014Z"},"links":{"citing_paper":"/paper/2507.09510"},"observation_digest":"sha256:910a81b1998622c9eb04221cbb2008b20c7a1c6d5ffb64c60c769d6191d77167","observation_id":"7ec856e6-7044-4601-8c3e-eae9808aedd0","resolution":{"observed_at":"2026-08-06T17:58:47.452568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:58:46.957786Z","title":"Real-time personalised speech enhancement transformers with dynamic cross-attended speaker representations,","venue":null,"work_id":"bc1b40de-4ba1-4cfd-8c31-d690821ada9f","year":2023},"citing_paper":{"arxiv_id":"2507.09510","last_updated":"2025-08-09T08:29:03Z","snapshot_observed_at":"2026-08-06T17:51:32.335228Z","submitted_at":"2025-07-13T06:35:13Z","title":"Enhancing Target Speaker Extraction with Explicit Speaker Consistency Modeling","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T17:58:38.081178Z"},"links":{"citing_paper":"/paper/2507.09510"},"observation_digest":"sha256:35ac5548b0a1a9531d77ef1773ecbc0a5000dee4ec7c128b72906c315b83328c","observation_id":"5ec61414-d81e-4b3f-9672-5da76eb3834c","resolution":{"observed_at":"2026-08-06T17:58:47.148722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:58:46.647786Z","title":"Smma-net: An audio clue- based target speaker extraction network with spectrogram matching and mu- tual attention,","venue":null,"work_id":"ab3c9ae2-cdd2-420b-89b1-c69a62ac2709","year":2024},"citing_paper":{"arxiv_id":"2507.09510","last_updated":"2025-08-09T08:29:03Z","snapshot_observed_at":"2026-08-06T17:51:32.335228Z","submitted_at":"2025-07-13T06:35:13Z","title":"Enhancing Target Speaker Extraction with Explicit Speaker Consistency Modeling","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T17:58:38.291163Z"},"links":{"citing_paper":"/paper/2507.09510"},"observation_digest":"sha256:4ba9bf1fd0789edbc356042515d423546ceac5db4a46ed61533997ffd3d82d23","observation_id":"dc186a4c-5358-4844-a292-4e3437f233aa","resolution":{"observed_at":"2026-08-06T17:58:46.806035Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:58:46.313133Z","title":"Target speaker extraction by di- rectly exploiting contextual information in the time-frequency domain,","venue":null,"work_id":"cf657a89-867b-4b63-994c-3b7c708bae04","year":2024},"citing_paper":{"arxiv_id":"2507.09510","last_updated":"2025-08-09T08:29:03Z","snapshot_observed_at":"2026-08-06T17:51:32.335228Z","submitted_at":"2025-07-13T06:35:13Z","title":"Enhancing Target Speaker Extraction with Explicit Speaker Consistency Modeling","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T17:58:38.420322Z"},"links":{"citing_paper":"/paper/2507.09510"},"observation_digest":"sha256:0e9e324cc567320ad1c399c7d7dcbb45f2aa8966e653a4d2214fd1e35174a2c2","observation_id":"fbb47c09-a1a4-4457-b8f6-55b72c625c02","resolution":{"observed_at":"2026-08-06T17:58:46.475563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:58:46.064240Z","title":"Music source separation with band-split rnn,","venue":null,"work_id":"c78becff-c260-42b7-b086-267db16300eb","year":1901},"citing_paper":{"arxiv_id":"2507.09510","last_updated":"2025-08-09T08:29:03Z","snapshot_observed_at":"2026-08-06T17:51:32.335228Z","submitted_at":"2025-07-13T06:35:13Z","title":"Enhancing Target Speaker Extraction with Explicit Speaker Consistency Modeling","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T17:58:38.536836Z"},"links":{"citing_paper":"/paper/2507.09510"},"observation_digest":"sha256:a618c5c8ce5287c76d163927cccd0671e66472853096f9138df4a5b0eaf45e03","observation_id":"4d180dee-aad7-483b-85c5-dc9bd8c3c1cb","resolution":{"observed_at":"2026-08-06T17:58:46.199355Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:58:44.782107Z","title":"An algorithm for intelligibility prediction of time–frequency weighted noisy speech,","venue":null,"work_id":"ffb68dff-c97d-43f9-92de-21b073e7e101","year":2011},"citing_paper":{"arxiv_id":"2507.09510","last_updated":"2025-08-09T08:29:03Z","snapshot_observed_at":"2026-08-06T17:51:32.335228Z","submitted_at":"2025-07-13T06:35:13Z","title":"Enhancing Target Speaker Extraction with Explicit Speaker Consistency Modeling","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T17:58:40.037370Z"},"links":{"citing_paper":"/paper/2507.09510"},"observation_digest":"sha256:15385938684ecfea5aa5dbd840385525b74cf5195a3e4f01fa7842ebf2bd2193","observation_id":"c76a0f6f-7617-463d-b028-365e09664def","resolution":{"observed_at":"2026-08-06T17:58:44.836454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:58:45.922146Z","title":"In defence of metric learning for speaker recognition,","venue":null,"work_id":"28f9b221-091e-4f52-a29b-9526b10c4b60","year":2020},"citing_paper":{"arxiv_id":"2507.09510","last_updated":"2025-08-09T08:29:03Z","snapshot_observed_at":"2026-08-06T17:51:32.335228Z","submitted_at":"2025-07-13T06:35:13Z","title":"Enhancing Target Speaker Extraction with Explicit Speaker Consistency Modeling","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T17:58:38.754873Z"},"links":{"citing_paper":"/paper/2507.09510"},"observation_digest":"sha256:d063b9c7efc319a0fa3d304ff2a3490785d36de9c4fb4c076b7e6f96254878cf","observation_id":"f235ec62-893c-47f2-8c67-67648fa1cd8b","resolution":{"observed_at":"2026-08-06T17:58:45.995819Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:58:45.713586Z","title":"Centroid estimation with transformer-based speaker embedder for robust target speaker extraction,","venue":null,"work_id":"d60b2837-ed3f-467e-85e0-b1ef52b1e48d","year":2024},"citing_paper":{"arxiv_id":"2507.09510","last_updated":"2025-08-09T08:29:03Z","snapshot_observed_at":"2026-08-06T17:51:32.335228Z","submitted_at":"2025-07-13T06:35:13Z","title":"Enhancing Target Speaker Extraction with Explicit Speaker Consistency Modeling","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T17:58:38.870085Z"},"links":{"citing_paper":"/paper/2507.09510"},"observation_digest":"sha256:9e969d0760afcc37ab73f71df84df26e58516072c4ff8cd1243633eed11aaec5","observation_id":"ec33ac18-6273-44d0-a7e4-c91995132715","resolution":{"observed_at":"2026-08-06T17:58:45.802159Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:58:45.552642Z","title":"Sdr–half-baked or well done?","venue":null,"work_id":"9ee37dc4-a203-4481-acc2-228d92fd5696","year":2019},"citing_paper":{"arxiv_id":"2507.09510","last_updated":"2025-08-09T08:29:03Z","snapshot_observed_at":"2026-08-06T17:51:32.335228Z","submitted_at":"2025-07-13T06:35:13Z","title":"Enhancing Target Speaker Extraction with Explicit Speaker Consistency Modeling","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T17:58:39.010501Z"},"links":{"citing_paper":"/paper/2507.09510"},"observation_digest":"sha256:ffc87102f6e49a029adfc7f9ac4311291edef324407e915eae41dfc4e7befefc","observation_id":"7553ccb9-467f-4907-8590-877601927c26","resolution":{"observed_at":"2026-08-06T17:58:45.638351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:58:45.381308Z","title":"Lib- rimix: An open-source dataset for generalizable speech separation,","venue":null,"work_id":"79c9daf4-bfe2-4677-86db-2b8b6ee4dd6f","year":2020},"citing_paper":{"arxiv_id":"2507.09510","last_updated":"2025-08-09T08:29:03Z","snapshot_observed_at":"2026-08-06T17:51:32.335228Z","submitted_at":"2025-07-13T06:35:13Z","title":"Enhancing Target Speaker Extraction with Explicit Speaker Consistency Modeling","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T17:58:39.151681Z"},"links":{"citing_paper":"/paper/2507.09510"},"observation_digest":"sha256:07c4477656749b2329aa9d675fc228433c34287c79df141e0f94558b72ccecbd","observation_id":"31d26293-98a0-43d4-9c27-cc536da3f3d7","resolution":{"observed_at":"2026-08-06T17:58:45.473589Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:58:45.232590Z","title":"But system description to voxceleb speaker recognition challenge 2019,","venue":null,"work_id":"7055c216-c659-43ce-a07b-5d85b22f01f0","year":2019},"citing_paper":{"arxiv_id":"2507.09510","last_updated":"2025-08-09T08:29:03Z","snapshot_observed_at":"2026-08-06T17:51:32.335228Z","submitted_at":"2025-07-13T06:35:13Z","title":"Enhancing Target Speaker Extraction with Explicit Speaker Consistency Modeling","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T17:58:39.253114Z"},"links":{"citing_paper":"/paper/2507.09510"},"observation_digest":"sha256:6928afd41d30f8908b30cb69c55e6208ebf28bec272e0d003d7c5d7f8eb7df0c","observation_id":"49af23a8-a315-4150-a6f8-c19823114eaf","resolution":{"observed_at":"2026-08-06T17:58:45.304615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:58:39.400949Z","title":"Ecapa-tdnn : Emphasized channel attention, propagation and aggregation in tdnn based speaker verification,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.09510","last_updated":"2025-08-09T08:29:03Z","snapshot_observed_at":"2026-08-06T17:51:32.335228Z","submitted_at":"2025-07-13T06:35:13Z","title":"Enhancing Target Speaker Extraction with Explicit Speaker Consistency Modeling","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T17:58:39.400949Z"},"links":{"citing_paper":"/paper/2507.09510"},"observation_digest":"sha256:f70f9041407b58eed6bf3117938b5d74fabb554fbe89a08290c3432b56fe4240","observation_id":"f58f258f-bf1c-4927-9cfe-01972083417b","resolution":{"observed_at":"2026-08-06T17:58:39.400949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:58:45.029826Z","title":"Wespeaker: A research and production oriented speaker embed- ding learning toolkit,","venue":null,"work_id":"e92172b6-adb3-4059-9675-810f87bcde5c","year":2023},"citing_paper":{"arxiv_id":"2507.09510","last_updated":"2025-08-09T08:29:03Z","snapshot_observed_at":"2026-08-06T17:51:32.335228Z","submitted_at":"2025-07-13T06:35:13Z","title":"Enhancing Target Speaker Extraction with Explicit Speaker Consistency Modeling","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T17:58:39.509318Z"},"links":{"citing_paper":"/paper/2507.09510"},"observation_digest":"sha256:6c48b952a713020a98b33a7df102e39b31a12666cc9bb2d29d9e65fafbcea357","observation_id":"b8624695-9fa7-4885-92e4-b63d42c05b9f","resolution":{"observed_at":"2026-08-06T17:58:45.136229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:58:39.616004Z","title":"V oxceleb2: Deep speaker recognition,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.09510","last_updated":"2025-08-09T08:29:03Z","snapshot_observed_at":"2026-08-06T17:51:32.335228Z","submitted_at":"2025-07-13T06:35:13Z","title":"Enhancing Target Speaker Extraction with Explicit Speaker Consistency Modeling","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T17:58:39.616004Z"},"links":{"citing_paper":"/paper/2507.09510"},"observation_digest":"sha256:fc8b4654f12c6a4f232e07cb5010c5349a850e757aa31fb948e4b94eb2cc4aa1","observation_id":"d861da22-9724-4e98-9b00-3e6cf57d6b19","resolution":{"observed_at":"2026-08-06T17:58:39.616004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15799","last_updated":"2024-09-24T06:47:12Z","snapshot_observed_at":"2026-08-04T16:20:42.322464Z","submitted_at":"2024-09-24T06:47:12Z","title":"WeSep: A Scalable and Flexible Toolkit Towards Generalizable Target Speaker Extraction","version":1},"cited_work":{"arxiv_id":"2409.15799","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.15799","snapshot_observed_at":"2026-08-06T17:58:42.276202Z","title":"WeSep: A Scalable and Flexible Toolkit Towards Generalizable Target Speaker Extraction","venue":"eess.AS","work_id":"c9c5d158-8694-4124-beba-0f3b02ba2cb4","year":2024},"citing_paper":{"arxiv_id":"2507.09510","last_updated":"2025-08-09T08:29:03Z","snapshot_observed_at":"2026-08-06T17:51:32.335228Z","submitted_at":"2025-07-13T06:35:13Z","title":"Enhancing Target Speaker Extraction with Explicit Speaker Consistency Modeling","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T17:58:39.732096Z"},"links":{"cited_paper":"/paper/2409.15799","citing_paper":"/paper/2507.09510"},"observation_digest":"sha256:1839159a99813698dc74f88b405f9f3cb20db37c2a5d06e9eabefb5489e129f8","observation_id":"9beb7c1c-b899-43c8-a306-d54f488fcbd1","resolution":{"observed_at":"2026-08-06T17:58:42.352929Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:58:44.899466Z","title":"Perceptual evaluation of speech quality (pesq): An objective method for end-to-end speech quality assessment of narrow-band telephone networks and speech codecs,","venue":null,"work_id":"65ed2e27-6e41-4d5f-9e99-e9a699f72da5","year":2001},"citing_paper":{"arxiv_id":"2507.09510","last_updated":"2025-08-09T08:29:03Z","snapshot_observed_at":"2026-08-06T17:51:32.335228Z","submitted_at":"2025-07-13T06:35:13Z","title":"Enhancing Target Speaker Extraction with Explicit Speaker Consistency Modeling","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T17:58:39.867589Z"},"links":{"citing_paper":"/paper/2507.09510"},"observation_digest":"sha256:ea77f5410c14e3285dc0b69f02065da7f36d96c537983b1d408e738a2ab2c53d","observation_id":"19611a75-f91d-49d7-82f2-05ece02de0c5","resolution":{"observed_at":"2026-08-06T17:58:44.962435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:58:44.477946Z","title":"Xtts: a massively mul- tilingual zero-shot text-to-speech model,","venue":null,"work_id":"75b1dc39-ea5f-4320-8b55-7ba45b0ed427","year":2024},"citing_paper":{"arxiv_id":"2507.09510","last_updated":"2025-08-09T08:29:03Z","snapshot_observed_at":"2026-08-06T17:51:32.335228Z","submitted_at":"2025-07-13T06:35:13Z","title":"Enhancing Target Speaker Extraction with Explicit Speaker Consistency Modeling","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T17:58:40.186751Z"},"links":{"citing_paper":"/paper/2507.09510"},"observation_digest":"sha256:19f8c5d4fc74b7435f263b953f450764847a908d25d95d4d10a825c56e326c10","observation_id":"2b029e47-5f9f-4c78-a18c-4ff84e909f84","resolution":{"observed_at":"2026-08-06T17:58:44.620467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:58:44.188059Z","title":"Ecapa2: A hybrid neural network archi- tecture and training strategy for robust speaker embeddings,","venue":null,"work_id":"947baca7-702d-42e5-b8b5-9619eda4d8cc","year":2023},"citing_paper":{"arxiv_id":"2507.09510","last_updated":"2025-08-09T08:29:03Z","snapshot_observed_at":"2026-08-06T17:51:32.335228Z","submitted_at":"2025-07-13T06:35:13Z","title":"Enhancing Target Speaker Extraction with Explicit Speaker Consistency Modeling","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T17:58:40.303176Z"},"links":{"citing_paper":"/paper/2507.09510"},"observation_digest":"sha256:ee0a5dadb155274275d75f3149bc682591097828845593beaeca75680e40f3df","observation_id":"08b27bca-02f0-49a5-9cbb-97cca54c4648","resolution":{"observed_at":"2026-08-06T17:58:44.343895Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16059","last_updated":"2024-12-11T09:39:28Z","snapshot_observed_at":"2026-08-06T06:23:46.335716Z","submitted_at":"2024-10-21T14:38:20Z","title":"Multi-Level Speaker Representation for Target Speaker Extraction","version":2},"cited_work":{"arxiv_id":"2410.16059","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.16059","snapshot_observed_at":"2026-08-06T17:58:42.030008Z","title":"Multi-Level Speaker Representation for Target Speaker Extraction","venue":"eess.AS","work_id":"6cf46efc-aa70-4bde-a355-431aefffe7e6","year":2024},"citing_paper":{"arxiv_id":"2507.09510","last_updated":"2025-08-09T08:29:03Z","snapshot_observed_at":"2026-08-06T17:51:32.335228Z","submitted_at":"2025-07-13T06:35:13Z","title":"Enhancing Target Speaker Extraction with Explicit Speaker Consistency Modeling","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T17:58:40.451824Z"},"links":{"cited_paper":"/paper/2410.16059","citing_paper":"/paper/2507.09510"},"observation_digest":"sha256:948d91ed04416735fcb4fb4954f9e674aa8a9cc1d52897d1d52768ba2bfc858e","observation_id":"4cb35800-a4d5-4da0-8aa0-d612e50c931e","resolution":{"observed_at":"2026-08-06T17:58:42.148745Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:58:43.925406Z","title":"Dpccn: Densely-connected pyramid complex convolutional network for robust speech separation and extraction,","venue":null,"work_id":"b534e37c-4bd5-449e-941f-96878a307223","year":2022},"citing_paper":{"arxiv_id":"2507.09510","last_updated":"2025-08-09T08:29:03Z","snapshot_observed_at":"2026-08-06T17:51:32.335228Z","submitted_at":"2025-07-13T06:35:13Z","title":"Enhancing Target Speaker Extraction with Explicit Speaker Consistency Modeling","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T17:58:40.578466Z"},"links":{"citing_paper":"/paper/2507.09510"},"observation_digest":"sha256:29dab6f9c11013b8bbd1e70d785a1dec5df8611fa46a93d055753d8e24041d1a","observation_id":"053c27d9-27b9-4d9a-a5eb-f6d36f47f9b4","resolution":{"observed_at":"2026-08-06T17:58:44.054911Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:58:43.712772Z","title":"Mc-spex: Towards effective speaker extraction with multi-scale interfu- sion and conditional speaker modulation,","venue":null,"work_id":"3d42fb88-1329-48cd-9b27-0203dd53a1cb","year":2023},"citing_paper":{"arxiv_id":"2507.09510","last_updated":"2025-08-09T08:29:03Z","snapshot_observed_at":"2026-08-06T17:51:32.335228Z","submitted_at":"2025-07-13T06:35:13Z","title":"Enhancing Target Speaker Extraction with Explicit Speaker Consistency Modeling","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T17:58:40.670334Z"},"links":{"citing_paper":"/paper/2507.09510"},"observation_digest":"sha256:358ae976319ffbfcf2134ae1cf88d32f77f10d18c5a45c7b07a2d2013e096737","observation_id":"9850ff13-8b76-4491-a351-cabbcf7af160","resolution":{"observed_at":"2026-08-06T17:58:43.814757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:58:47.586095Z","title":"Tar- get speech extraction with pre-trained self-supervised learning models,","venue":null,"work_id":"97bd3836-8631-4aca-93da-85a4ace51e34","year":2024},"citing_paper":{"arxiv_id":"2507.09510","last_updated":"2025-08-09T08:29:03Z","snapshot_observed_at":"2026-08-06T17:51:32.335228Z","submitted_at":"2025-07-13T06:35:13Z","title":"Enhancing Target Speaker Extraction with Explicit Speaker Consistency Modeling","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T17:58:40.797574Z"},"links":{"citing_paper":"/paper/2507.09510"},"observation_digest":"sha256:f31b9bd94d0d065b01b2d8964454d6727906fa7a124ed9661b34e8a491f72a60","observation_id":"de256083-5227-41d8-b2ef-3a28a4986f1a","resolution":{"observed_at":"2026-08-06T17:58:47.697564Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:58:43.480831Z","title":"Tf- gridnet: Making time-frequency domain models great again for monaural speaker separation,","venue":null,"work_id":"bb0a5090-d0e7-4ec5-944d-cb8be3ae8dc6","year":2023},"citing_paper":{"arxiv_id":"2507.09510","last_updated":"2025-08-09T08:29:03Z","snapshot_observed_at":"2026-08-06T17:51:32.335228Z","submitted_at":"2025-07-13T06:35:13Z","title":"Enhancing Target Speaker Extraction with Explicit Speaker Consistency Modeling","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T17:58:40.942430Z"},"links":{"citing_paper":"/paper/2507.09510"},"observation_digest":"sha256:0a540d4428f0d284e348aca1485daded19e0c62091d5ddefa295d2a326c1cd89","observation_id":"531299cb-327f-401b-804b-7061af17d7fb","resolution":{"observed_at":"2026-08-06T17:58:43.595248Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:58:43.154468Z","title":"V oxceleb: A large-scale speaker identification dataset,","venue":null,"work_id":"69bcdd41-e961-4114-9c33-a697e8addf92","year":2017},"citing_paper":{"arxiv_id":"2507.09510","last_updated":"2025-08-09T08:29:03Z","snapshot_observed_at":"2026-08-06T17:51:32.335228Z","submitted_at":"2025-07-13T06:35:13Z","title":"Enhancing Target Speaker Extraction with Explicit Speaker Consistency Modeling","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T17:58:41.063893Z"},"links":{"citing_paper":"/paper/2507.09510"},"observation_digest":"sha256:26ac802a59008837bd43731df5137e12652ec61252e8942f6b58de726e7bace8","observation_id":"8e319a68-b513-4e42-8018-03d56c53fe1a","resolution":{"observed_at":"2026-08-06T17:58:43.348936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:58:52.025974Z","title":null,"venue":null,"work_id":"c066ff1f-f230-4147-8d48-b1c999a76331","year":null},"citing_paper":{"arxiv_id":"2507.09510","last_updated":"2025-08-09T08:29:03Z","snapshot_observed_at":"2026-08-06T17:51:32.335228Z","submitted_at":"2025-07-13T06:35:13Z","title":"Enhancing Target Speaker Extraction with Explicit Speaker Consistency Modeling","version":3},"reference_index":128,"source":"pdf_text","source_observed_at":"2026-08-06T17:58:34.919879Z"},"links":{"citing_paper":"/paper/2507.09510"},"observation_digest":"sha256:b293a3c6d36ed255fe2779bb4d44719da90a9ccf577a98b4f2c0407e26563028","observation_id":"4202cf03-9f11-4a00-80b4-ede8b5b33f86","resolution":{"observed_at":"2026-08-06T17:58:52.159552Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.09510","last_updated":"2025-08-09T08:29:03Z","latest_version":3,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-06T17:51:32.335228Z","submitted_at":"2025-07-13T06:35:13Z","title":"Enhancing Target Speaker Extraction with Explicit Speaker Consistency Modeling"},"reference_resolution":{"displayed":51,"state_counts":{"malformed_identifier":2,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":5,"verified_exact":6,"verified_fuzzy":38},"total_outbound_references":51},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 1 inbound Pith citation observation for arXiv:2507.09510."}