{"as_of":"2026-08-08T00:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5df7602a43c891457f9db25b7000eb52c7303ff4ad262fcf25cb72b29f379239","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T03:30:39.617980Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T00:58:13.674758Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2602.07977","last_updated":"2026-06-07T08:01:33Z","snapshot_observed_at":"2026-08-06T12:39:56.583950Z","submitted_at":"2026-02-08T14:06:11Z","title":"Detect, Attend and Extract: Keyword Guided Target Speaker Extraction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.07977","snapshot_observed_at":"2026-07-31T00:58:13.674758Z","title":"Detect, attend and extract: Keyword guided target speaker extraction,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.27436","last_updated":"2026-07-29T20:05:39Z","snapshot_observed_at":"2026-08-07T01:15:56.832491Z","submitted_at":"2026-07-29T20:05:39Z","title":"WeSep: A Modular and Cue-Composable Framework for Target Speaker Extraction","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-31T00:58:13.674758Z"},"links":{"cited_paper":"/paper/2602.07977","citing_paper":"/paper/2607.27436"},"observation_digest":"sha256:66cd81ef6123edb0a205970e940c9e367200612dce7f2c2c1e25bd4f738cfe2a","observation_id":"e8d614d7-6b92-4100-9602-2d70ff910ecd","resolution":{"observed_at":"2026-07-31T00:58:13.674758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2602.07977/citation-record","integrity":"/paper/2602.07977/integrity","json":"/paper/2602.07977/citation-record.json","paper":"/paper/2602.07977"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:30:39.466669Z","title":"Target language extraction at multilingual cocktail parties","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.07977","last_updated":"2026-06-07T08:01:33Z","snapshot_observed_at":"2026-08-06T12:39:56.583950Z","submitted_at":"2026-02-08T14:06:11Z","title":"Detect, Attend and Extract: Keyword Guided Target Speaker Extraction","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T03:30:39.466669Z"},"links":{"citing_paper":"/paper/2602.07977"},"observation_digest":"sha256:f5c34486cf62fdfe7b4262290712b218bc707ec97daf398c4f38423201db8a76","observation_id":"051f3d2b-4983-4ad5-969a-c9b1d1346bb2","resolution":{"observed_at":"2026-08-03T03:30:39.466669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:30:39.482911Z","title":"V oxceleb2: Deep speaker recognition","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2602.07977","last_updated":"2026-06-07T08:01:33Z","snapshot_observed_at":"2026-08-06T12:39:56.583950Z","submitted_at":"2026-02-08T14:06:11Z","title":"Detect, Attend and Extract: Keyword Guided Target Speaker Extraction","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T03:30:39.482911Z"},"links":{"citing_paper":"/paper/2602.07977"},"observation_digest":"sha256:a7dfb761f7f847919fe3695467c8dccde33541ce6a9fe35d59f134d16e214fc1","observation_id":"bb0be067-dcf1-4421-bbe4-74480c0a6ea5","resolution":{"observed_at":"2026-08-03T03:30:39.482911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.07065","last_updated":"2023-03-03T08:37:38Z","snapshot_observed_at":"2026-07-06T14:30:29.323059Z","submitted_at":"2022-12-14T07:21:45Z","title":"CLIPSep: Learning Text-queried Sound Separation with Noisy Unlabeled Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.07065","snapshot_observed_at":"2026-08-03T03:30:39.500955Z","title":"Clipsep: Learning text-queried sound separation with noisy unlabeled videos.arXiv preprint arXiv:2212.07065,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.07977","last_updated":"2026-06-07T08:01:33Z","snapshot_observed_at":"2026-08-06T12:39:56.583950Z","submitted_at":"2026-02-08T14:06:11Z","title":"Detect, Attend and Extract: Keyword Guided Target Speaker Extraction","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T03:30:39.500955Z"},"links":{"cited_paper":"/paper/2212.07065","citing_paper":"/paper/2602.07977"},"observation_digest":"sha256:25ae7ba52c0d130a7c9885e641ca4505b7619b6f64713073cd0ed631a47013c9","observation_id":"9f42fcca-d05e-4618-830b-6d01515119f8","resolution":{"observed_at":"2026-08-03T03:30:39.500955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07284","last_updated":"2024-10-07T06:54:30Z","snapshot_observed_at":"2026-07-06T16:31:03.559653Z","submitted_at":"2023-10-11T08:17:54Z","title":"Typing to Listen at the Cocktail Party: Text-Guided Target Speaker Extraction","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07284","snapshot_observed_at":"2026-08-03T03:30:39.505616Z","title":"Typing to listen at the cocktail party: Text-guided target speaker extraction","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.07977","last_updated":"2026-06-07T08:01:33Z","snapshot_observed_at":"2026-08-06T12:39:56.583950Z","submitted_at":"2026-02-08T14:06:11Z","title":"Detect, Attend and Extract: Keyword Guided Target Speaker Extraction","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T03:30:39.505616Z"},"links":{"cited_paper":"/paper/2310.07284","citing_paper":"/paper/2602.07977"},"observation_digest":"sha256:18226e6945ec73ccdaecf1a426b3317255d3d342f605c1a14458366d2322c030","observation_id":"5d4231cc-5ec4-44d9-b417-f792aec67698","resolution":{"observed_at":"2026-08-03T03:30:39.505616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:30:39.517924Z","title":"Kingma and Jimmy Ba","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2602.07977","last_updated":"2026-06-07T08:01:33Z","snapshot_observed_at":"2026-08-06T12:39:56.583950Z","submitted_at":"2026-02-08T14:06:11Z","title":"Detect, Attend and Extract: Keyword Guided Target Speaker Extraction","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T03:30:39.517924Z"},"links":{"citing_paper":"/paper/2602.07977"},"observation_digest":"sha256:b851f7f08fea3669290eb01d574839859c9e9b396bc335abdac127f3ae859c18","observation_id":"fd590abe-7198-4061-acd4-b252eeb941a5","resolution":{"observed_at":"2026-08-03T03:30:39.517924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:30:39.534482Z","title":"Audio-visual active speaker extraction for sparsely overlapped multi-talker speech","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.07977","last_updated":"2026-06-07T08:01:33Z","snapshot_observed_at":"2026-08-06T12:39:56.583950Z","submitted_at":"2026-02-08T14:06:11Z","title":"Detect, Attend and Extract: Keyword Guided Target Speaker Extraction","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T03:30:39.534482Z"},"links":{"citing_paper":"/paper/2602.07977"},"observation_digest":"sha256:213f5d5a94d58dddd0c535c63453fae63dd4d740d8ccd4a059b8fd85fc4a0ca2","observation_id":"3dc15ca1-1e37-4a4a-85a7-35535fd09e9c","resolution":{"observed_at":"2026-08-03T03:30:39.534482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:30:39.539006Z","title":"Av- sepformer: Cross-attention sepformer for audio-visual tar- get speaker extraction","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.07977","last_updated":"2026-06-07T08:01:33Z","snapshot_observed_at":"2026-08-06T12:39:56.583950Z","submitted_at":"2026-02-08T14:06:11Z","title":"Detect, Attend and Extract: Keyword Guided Target Speaker Extraction","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T03:30:39.539006Z"},"links":{"citing_paper":"/paper/2602.07977"},"observation_digest":"sha256:f8ce119fcf2f0d5b734d506bb4ad234c9291b68f46d1e7f1096d53887765bcc8","observation_id":"01d1ec63-28eb-4b36-addf-88ef7d720f32","resolution":{"observed_at":"2026-08-03T03:30:39.539006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:30:39.543972Z","title":"Plumbley, and Wenwu Wang","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.07977","last_updated":"2026-06-07T08:01:33Z","snapshot_observed_at":"2026-08-06T12:39:56.583950Z","submitted_at":"2026-02-08T14:06:11Z","title":"Detect, Attend and Extract: Keyword Guided Target Speaker Extraction","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T03:30:39.543972Z"},"links":{"citing_paper":"/paper/2602.07977"},"observation_digest":"sha256:933acd35c0e5b6300711ff61022a471a4d532bcde34ca9a0df9effffb03d9070","observation_id":"2a54fb1e-4ed1-4762-b36d-d3204d3c009b","resolution":{"observed_at":"2026-08-03T03:30:39.543972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:30:39.547638Z","title":"Target speaker extraction with cur- riculum learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.07977","last_updated":"2026-06-07T08:01:33Z","snapshot_observed_at":"2026-08-06T12:39:56.583950Z","submitted_at":"2026-02-08T14:06:11Z","title":"Detect, Attend and Extract: Keyword Guided Target Speaker Extraction","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T03:30:39.547638Z"},"links":{"citing_paper":"/paper/2602.07977"},"observation_digest":"sha256:44e8ab59bfc8e4e3953e93dedf8e3e5dec36bb54a4c0aae2bca47ddbdaa166e5","observation_id":"d6d26acb-d1f9-4ed2-bd33-8308f3ca076a","resolution":{"observed_at":"2026-08-03T03:30:39.547638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:30:39.551147Z","title":"Conv-tasnet: Surpassing ideal time-frequency magnitude masking for speech separation.IEEE/ACM Trans","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2602.07977","last_updated":"2026-06-07T08:01:33Z","snapshot_observed_at":"2026-08-06T12:39:56.583950Z","submitted_at":"2026-02-08T14:06:11Z","title":"Detect, Attend and Extract: Keyword Guided Target Speaker Extraction","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T03:30:39.551147Z"},"links":{"citing_paper":"/paper/2602.07977"},"observation_digest":"sha256:7dee3947832c67c75a83e3674d6d3e7aceea01faec0d3338832be8ac683e94fa","observation_id":"b19c67e2-3c35-4389-b5df-3035d44712f5","resolution":{"observed_at":"2026-08-03T03:30:39.551147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:30:39.554702Z","title":"Music source separation with band-split RNN.IEEE ACM Trans","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.07977","last_updated":"2026-06-07T08:01:33Z","snapshot_observed_at":"2026-08-06T12:39:56.583950Z","submitted_at":"2026-02-08T14:06:11Z","title":"Detect, Attend and Extract: Keyword Guided Target Speaker Extraction","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T03:30:39.554702Z"},"links":{"citing_paper":"/paper/2602.07977"},"observation_digest":"sha256:237c05961ee02bfaaf6b61549f44d4e7536bb218a497413cb3e21b49e01019ce","observation_id":"f58fed34-1e15-46ae-a250-f08522049578","resolution":{"observed_at":"2026-08-03T03:30:39.554702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:30:39.558356Z","title":"Clapsep: Leverag- ing contrastive pre-trained model for multi-modal query- conditioned target sound extraction.IEEE/ACM Transac- tions on Audio, Speech, and Language Processing,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.07977","last_updated":"2026-06-07T08:01:33Z","snapshot_observed_at":"2026-08-06T12:39:56.583950Z","submitted_at":"2026-02-08T14:06:11Z","title":"Detect, Attend and Extract: Keyword Guided Target Speaker Extraction","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T03:30:39.558356Z"},"links":{"citing_paper":"/paper/2602.07977"},"observation_digest":"sha256:159aa62f7c60210463198806f5310571b0e6a4bc53a06e4e30bc047a503cae01","observation_id":"b4f2bf09-ef0d-49eb-a6b7-dee26919467b","resolution":{"observed_at":"2026-08-03T03:30:39.558356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:30:39.562597Z","title":"Visualizing data using t-sne.Journal of machine learning research, 9(Nov):2579–2605,","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2602.07977","last_updated":"2026-06-07T08:01:33Z","snapshot_observed_at":"2026-08-06T12:39:56.583950Z","submitted_at":"2026-02-08T14:06:11Z","title":"Detect, Attend and Extract: Keyword Guided Target Speaker Extraction","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T03:30:39.562597Z"},"links":{"citing_paper":"/paper/2602.07977"},"observation_digest":"sha256:d21916cb900d05ccbf475830b7a1ecaf087ac242a0940d185707c67b8ddee849","observation_id":"083757cc-7dc6-4bfe-af0a-c669f70597ef","resolution":{"observed_at":"2026-08-03T03:30:39.562597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:30:39.570207Z","title":"All neural low- latency directional speech extraction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.07977","last_updated":"2026-06-07T08:01:33Z","snapshot_observed_at":"2026-08-06T12:39:56.583950Z","submitted_at":"2026-02-08T14:06:11Z","title":"Detect, Attend and Extract: Keyword Guided Target Speaker Extraction","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T03:30:39.570207Z"},"links":{"citing_paper":"/paper/2602.07977"},"observation_digest":"sha256:89e714773c9617e4f654287c40d948325c2bdbcf8e71791075e6e37d36272829","observation_id":"0ff8a305-6cbd-46e9-bed6-80e6fb28c285","resolution":{"observed_at":"2026-08-03T03:30:39.570207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:30:39.573809Z","title":"Target speech extraction with pre-trained self-supervised learning models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.07977","last_updated":"2026-06-07T08:01:33Z","snapshot_observed_at":"2026-08-06T12:39:56.583950Z","submitted_at":"2026-02-08T14:06:11Z","title":"Detect, Attend and Extract: Keyword Guided Target Speaker Extraction","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T03:30:39.573809Z"},"links":{"citing_paper":"/paper/2602.07977"},"observation_digest":"sha256:1e6803183a51071ad43ba78ede6faa689a490d86052a95498ed218edc5b393ee","observation_id":"f1c14e61-8a80-40c5-a909-5bd16c178215","resolution":{"observed_at":"2026-08-03T03:30:39.573809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:30:39.579614Z","title":"Sam audio: Segment anything in audio.arXiv preprint arXiv:2512.18099,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.07977","last_updated":"2026-06-07T08:01:33Z","snapshot_observed_at":"2026-08-06T12:39:56.583950Z","submitted_at":"2026-02-08T14:06:11Z","title":"Detect, Attend and Extract: Keyword Guided Target Speaker Extraction","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T03:30:39.579614Z"},"links":{"citing_paper":"/paper/2602.07977"},"observation_digest":"sha256:3620277d2855430e9e65284b2edda9b4b665a2548d1fa1e39fffdb09e3f90737","observation_id":"bca869ed-3416-436b-87ab-62f84afe6a3e","resolution":{"observed_at":"2026-08-03T03:30:39.579614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:30:39.586989Z","title":"A lightweight hy- brid multi-channel speech extraction system with direc- tional voice activity detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.07977","last_updated":"2026-06-07T08:01:33Z","snapshot_observed_at":"2026-08-06T12:39:56.583950Z","submitted_at":"2026-02-08T14:06:11Z","title":"Detect, Attend and Extract: Keyword Guided Target Speaker Extraction","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T03:30:39.586989Z"},"links":{"citing_paper":"/paper/2602.07977"},"observation_digest":"sha256:44c9a3fc5c980b19b09139242e0b03704031e0f42ea3e724f89734e7b9b49b2c","observation_id":"e806a780-8a8c-4c0e-bf22-e6abb7b88435","resolution":{"observed_at":"2026-08-03T03:30:39.586989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18501","last_updated":"2025-03-03T13:54:41Z","snapshot_observed_at":"2026-07-06T18:06:53.888474Z","submitted_at":"2024-04-29T08:43:57Z","title":"Audio-Visual Target Speaker Extraction with Reverse Selective Auditory Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18501","snapshot_observed_at":"2026-08-03T03:30:39.590816Z","title":"Audio-visual tar- get speaker extraction with reverse selective auditory at- tention.arXiv preprint arXiv:2404.18501,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.07977","last_updated":"2026-06-07T08:01:33Z","snapshot_observed_at":"2026-08-06T12:39:56.583950Z","submitted_at":"2026-02-08T14:06:11Z","title":"Detect, Attend and Extract: Keyword Guided Target Speaker Extraction","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T03:30:39.590816Z"},"links":{"cited_paper":"/paper/2404.18501","citing_paper":"/paper/2602.07977"},"observation_digest":"sha256:92941b7d14ef7b1c86d672e332d46cfef03492be84592cb1f7fcec37a0a5f35b","observation_id":"741a72b9-e840-4f57-9e55-4580ee1e0cd6","resolution":{"observed_at":"2026-08-03T03:30:39.590816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:30:39.595828Z","title":"Wespeaker: A research and pro- duction oriented speaker embedding learning toolkit","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.07977","last_updated":"2026-06-07T08:01:33Z","snapshot_observed_at":"2026-08-06T12:39:56.583950Z","submitted_at":"2026-02-08T14:06:11Z","title":"Detect, Attend and Extract: Keyword Guided Target Speaker Extraction","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T03:30:39.595828Z"},"links":{"citing_paper":"/paper/2602.07977"},"observation_digest":"sha256:fc1993c1d4699dd1267b9310267bd7c3f8c01a8567d22a84de001b3f2ba77657","observation_id":"3f46650b-6e84-4d98-97fa-8e36d6089f95","resolution":{"observed_at":"2026-08-03T03:30:39.595828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:30:39.599615Z","title":"Unified audio visual cues for target speaker extraction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.07977","last_updated":"2026-06-07T08:01:33Z","snapshot_observed_at":"2026-08-06T12:39:56.583950Z","submitted_at":"2026-02-08T14:06:11Z","title":"Detect, Attend and Extract: Keyword Guided Target Speaker Extraction","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T03:30:39.599615Z"},"links":{"citing_paper":"/paper/2602.07977"},"observation_digest":"sha256:ca02e1632524f60b30c4f7687c82ebd9e3a67c8a1cb02a7f5d1b6507c72173b8","observation_id":"aaa63050-b550-406d-8f63-2977fc3a4e54","resolution":{"observed_at":"2026-08-03T03:30:39.599615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:30:39.603058Z","title":"Target speaker extraction with ultra-short reference speech by ve-ve framework","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.07977","last_updated":"2026-06-07T08:01:33Z","snapshot_observed_at":"2026-08-06T12:39:56.583950Z","submitted_at":"2026-02-08T14:06:11Z","title":"Detect, Attend and Extract: Keyword Guided Target Speaker Extraction","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T03:30:39.603058Z"},"links":{"citing_paper":"/paper/2602.07977"},"observation_digest":"sha256:eb8ca13ee47677819c053fbcf4aaa5dce92e2949b5e56abe6d82883f3de8e9c8","observation_id":"2c8cbdd5-ff49-4eee-a931-49f3380c5644","resolution":{"observed_at":"2026-08-03T03:30:39.603058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:30:39.607065Z","title":"Tspeech-ai sys- tem description to the 5th deep noise suppression (DNS) challenge","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.07977","last_updated":"2026-06-07T08:01:33Z","snapshot_observed_at":"2026-08-06T12:39:56.583950Z","submitted_at":"2026-02-08T14:06:11Z","title":"Detect, Attend and Extract: Keyword Guided Target Speaker Extraction","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T03:30:39.607065Z"},"links":{"citing_paper":"/paper/2602.07977"},"observation_digest":"sha256:e95664f54f0c40db81b63660988a2c4bc6052d69223e10c892130dffbc03c1bd","observation_id":"31d6b5c9-564b-4d53-92f3-e17b52e0cb12","resolution":{"observed_at":"2026-08-03T03:30:39.607065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16059","last_updated":"2024-12-11T09:39:28Z","snapshot_observed_at":"2026-08-06T06:23:46.335716Z","submitted_at":"2024-10-21T14:38:20Z","title":"Multi-Level Speaker Representation for Target Speaker Extraction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16059","snapshot_observed_at":"2026-08-03T03:30:39.610230Z","title":"Multi-level speaker representation for target speaker ex- traction.arXiv preprint arXiv:2410.16059,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.07977","last_updated":"2026-06-07T08:01:33Z","snapshot_observed_at":"2026-08-06T12:39:56.583950Z","submitted_at":"2026-02-08T14:06:11Z","title":"Detect, Attend and Extract: Keyword Guided Target Speaker Extraction","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T03:30:39.610230Z"},"links":{"cited_paper":"/paper/2410.16059","citing_paper":"/paper/2602.07977"},"observation_digest":"sha256:5004eefe3a08e00c433e33445acadaf2e7651525876afec19b24b8d1e42bcb5e","observation_id":"bb30cc9c-c6e3-4e9d-b985-2638c35bb30e","resolution":{"observed_at":"2026-08-03T03:30:39.610230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:30:39.614647Z","title":"Mossformer2: Com- bining transformer and rnn-free recurrent network for en- hanced time-domain monaural speech separation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.07977","last_updated":"2026-06-07T08:01:33Z","snapshot_observed_at":"2026-08-06T12:39:56.583950Z","submitted_at":"2026-02-08T14:06:11Z","title":"Detect, Attend and Extract: Keyword Guided Target Speaker Extraction","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T03:30:39.614647Z"},"links":{"citing_paper":"/paper/2602.07977"},"observation_digest":"sha256:f51bdd5965746bb85b46960de8730819bac60de96e4fc603900abbb6681ca5aa","observation_id":"493af539-d1ac-4568-af68-1ec63eb37c62","resolution":{"observed_at":"2026-08-03T03:30:39.614647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:30:39.617980Z","title":"Neural target speech extraction: An overview.IEEE Signal Processing Magazine, pages 8–29, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.07977","last_updated":"2026-06-07T08:01:33Z","snapshot_observed_at":"2026-08-06T12:39:56.583950Z","submitted_at":"2026-02-08T14:06:11Z","title":"Detect, Attend and Extract: Keyword Guided Target Speaker Extraction","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T03:30:39.617980Z"},"links":{"citing_paper":"/paper/2602.07977"},"observation_digest":"sha256:92960e5abc275f65e6c0699289bfad15ec306069ad1b65e2196b4d1c4b9cf458","observation_id":"5016eb6d-6817-4ab7-9b0d-be524b2bbca7","resolution":{"observed_at":"2026-08-03T03:30:39.617980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:30:39.566540Z","title":"Lib- rispeech: an asr corpus based on public domain audio books","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2602.07977","last_updated":"2026-06-07T08:01:33Z","snapshot_observed_at":"2026-08-06T12:39:56.583950Z","submitted_at":"2026-02-08T14:06:11Z","title":"Detect, Attend and Extract: Keyword Guided Target Speaker Extraction","version":2},"reference_index":2008,"source":"pdf_text","source_observed_at":"2026-08-03T03:30:39.566540Z"},"links":{"citing_paper":"/paper/2602.07977"},"observation_digest":"sha256:8ab9c4ccbfb98ab779583203cf08ae62f6e3e8d764dbbec13eec3169a603d7cf","observation_id":"614b5213-8859-412a-adde-16ab31ebd758","resolution":{"observed_at":"2026-08-03T03:30:39.566540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.09577","last_updated":"2019-09-14T03:51:46Z","snapshot_observed_at":"2026-08-03T18:17:55.398298Z","submitted_at":"2019-09-14T03:51:46Z","title":"NeMo: a toolkit for building AI applications using Neural Modules","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.09577","snapshot_observed_at":"2026-08-03T03:30:39.524396Z","title":"Nemo: a toolkit for building ai applications using neural modu les.arXiv preprint arXiv:1909.09577,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2602.07977","last_updated":"2026-06-07T08:01:33Z","snapshot_observed_at":"2026-08-06T12:39:56.583950Z","submitted_at":"2026-02-08T14:06:11Z","title":"Detect, Attend and Extract: Keyword Guided Target Speaker Extraction","version":2},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-03T03:30:39.524396Z"},"links":{"cited_paper":"/paper/1909.09577","citing_paper":"/paper/2602.07977"},"observation_digest":"sha256:b23bdfd3ddce58d018e661066e28246b2110da01fce556573b5364d85874d208","observation_id":"406e503c-86c1-4a25-9012-8c0c122b2b97","resolution":{"observed_at":"2026-08-03T03:30:39.524396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.11262","last_updated":"2020-05-22T16:26:54Z","snapshot_observed_at":"2026-08-04T10:15:33.124350Z","submitted_at":"2020-05-22T16:26:54Z","title":"LibriMix: An Open-Source Dataset for Generalizable Speech Separation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.11262","snapshot_observed_at":"2026-08-03T03:30:39.487256Z","title":"Librimix: An open-source dataset for generaliz- able speech separation.arXiv preprint arXiv:2005.11262,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2602.07977","last_updated":"2026-06-07T08:01:33Z","snapshot_observed_at":"2026-08-06T12:39:56.583950Z","submitted_at":"2026-02-08T14:06:11Z","title":"Detect, Attend and Extract: Keyword Guided Target Speaker Extraction","version":2},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-03T03:30:39.487256Z"},"links":{"cited_paper":"/paper/2005.11262","citing_paper":"/paper/2602.07977"},"observation_digest":"sha256:d7a19d4c5c93f2d1c3af1429717179a95f488268c7271d662942659153389a6f","observation_id":"1842cc52-26a7-4b0a-a006-3a66ab9697b2","resolution":{"observed_at":"2026-08-03T03:30:39.487256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.09364","last_updated":"2020-06-24T00:57:25Z","snapshot_observed_at":"2026-07-06T07:16:33.611269Z","submitted_at":"2018-11-23T05:24:15Z","title":"Learning pronunciation from a foreign language in speech synthesis networks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.09364","snapshot_observed_at":"2026-08-03T03:30:39.530229Z","title":"Learning pronunciation from a foreign lan- guage in speech synthesis networks.arXiv preprint arXiv:1811.09364,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2602.07977","last_updated":"2026-06-07T08:01:33Z","snapshot_observed_at":"2026-08-06T12:39:56.583950Z","submitted_at":"2026-02-08T14:06:11Z","title":"Detect, Attend and Extract: Keyword Guided Target Speaker Extraction","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-03T03:30:39.530229Z"},"links":{"cited_paper":"/paper/1811.09364","citing_paper":"/paper/2602.07977"},"observation_digest":"sha256:201ae9f6b72dc8f799bd085be484602ad3ba37c165617d8be8471cf1b691bd05","observation_id":"2c20bbd6-a8e8-4407-a3da-1d08f5a1975b","resolution":{"observed_at":"2026-08-03T03:30:39.530229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:30:39.493560Z","title":"Ecapa-tdnn: Empha- sized channel attention, propagation and aggregation in tdnn based speaker verification","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2602.07977","last_updated":"2026-06-07T08:01:33Z","snapshot_observed_at":"2026-08-06T12:39:56.583950Z","submitted_at":"2026-02-08T14:06:11Z","title":"Detect, Attend and Extract: Keyword Guided Target Speaker Extraction","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-03T03:30:39.493560Z"},"links":{"citing_paper":"/paper/2602.07977"},"observation_digest":"sha256:65f1cea778ccabf5ff55b46c2cf95f98e2c36353ca3c2d18198427b58de89701","observation_id":"b02bedfe-81fe-490a-941a-a9ac337401ca","resolution":{"observed_at":"2026-08-03T03:30:39.493560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:30:39.472758Z","title":"Experts versus all- rounders: target language extraction for multiple target languages","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.07977","last_updated":"2026-06-07T08:01:33Z","snapshot_observed_at":"2026-08-06T12:39:56.583950Z","submitted_at":"2026-02-08T14:06:11Z","title":"Detect, Attend and Extract: Keyword Guided Target Speaker Extraction","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-03T03:30:39.472758Z"},"links":{"citing_paper":"/paper/2602.07977"},"observation_digest":"sha256:fedc8c9f83efd842aa93633bfcd8c29e519da22bb108242321bd1716684dc300","observation_id":"56f49673-8e8a-4a01-9a64-d53ef964ce78","resolution":{"observed_at":"2026-08-03T03:30:39.472758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:30:39.478013Z","title":"Wavlm: Large-scale self-supervised pre-training for full stack speech processing.IEEE J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.07977","last_updated":"2026-06-07T08:01:33Z","snapshot_observed_at":"2026-08-06T12:39:56.583950Z","submitted_at":"2026-02-08T14:06:11Z","title":"Detect, Attend and Extract: Keyword Guided Target Speaker Extraction","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-03T03:30:39.478013Z"},"links":{"citing_paper":"/paper/2602.07977"},"observation_digest":"sha256:06bee01c03ae6396c60085960a5b78ecd2d79bbb86bc61e34d32721079ddba31","observation_id":"73d79a71-8441-440e-9c31-b93baa884fe4","resolution":{"observed_at":"2026-08-03T03:30:39.478013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:30:39.509911Z","title":"3s-tse: Efficient three-stage target speaker extraction for real-time and low- resource applications","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.07977","last_updated":"2026-06-07T08:01:33Z","snapshot_observed_at":"2026-08-06T12:39:56.583950Z","submitted_at":"2026-02-08T14:06:11Z","title":"Detect, Attend and Extract: Keyword Guided Target Speaker Extraction","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-03T03:30:39.509911Z"},"links":{"citing_paper":"/paper/2602.07977"},"observation_digest":"sha256:2cc7ff609c980541d465c3b09ae4265e96a9236c29828272cb0c890f1f8c7e81","observation_id":"633cb22c-63ca-461b-ab96-3b481214e164","resolution":{"observed_at":"2026-08-03T03:30:39.509911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:30:39.513505Z","title":"Centroid estimation with transformer-based speaker embedder for robust target speaker extraction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.07977","last_updated":"2026-06-07T08:01:33Z","snapshot_observed_at":"2026-08-06T12:39:56.583950Z","submitted_at":"2026-02-08T14:06:11Z","title":"Detect, Attend and Extract: Keyword Guided Target Speaker Extraction","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-03T03:30:39.513505Z"},"links":{"citing_paper":"/paper/2602.07977"},"observation_digest":"sha256:adfecd2b50ce0624f74ff8c7b2f2b6e39c1756df66c8197889843a8bad796edd","observation_id":"28700231-1a72-48cc-b73d-df2bec338525","resolution":{"observed_at":"2026-08-03T03:30:39.513505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:30:39.583323Z","title":"Lever- aging language information for target language extraction","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.07977","last_updated":"2026-06-07T08:01:33Z","snapshot_observed_at":"2026-08-06T12:39:56.583950Z","submitted_at":"2026-02-08T14:06:11Z","title":"Detect, Attend and Extract: Keyword Guided Target Speaker Extraction","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-03T03:30:39.583323Z"},"links":{"citing_paper":"/paper/2602.07977"},"observation_digest":"sha256:39d4d99eab3bcc6da4c8f20a180ec5a8b87485454755a332fa03598b503c20cc","observation_id":"8922309d-2750-45c5-9c79-4778bebaed34","resolution":{"observed_at":"2026-08-03T03:30:39.583323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2602.07977","last_updated":"2026-06-07T08:01:33Z","latest_version":2,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-06T12:39:56.583950Z","submitted_at":"2026-02-08T14:06:11Z","title":"Detect, Attend and Extract: Keyword Guided Target Speaker Extraction"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":35,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 1 inbound Pith citation observation for arXiv:2602.07977."}