{"as_of":"2026-08-12T22:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d548f9e0c834ec1efcd8e5ffd588628fba6ca151a1818be9716f2502fc45f93c","coverage":[{"denominator":27,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T20:14:00.754527Z","state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.09169/citation-record","integrity":"/paper/2501.09169/integrity","json":"/paper/2501.09169/citation-record.json","paper":"/paper/2501.09169"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:01.348783Z","title":"V oiceFilter: Targeted V oice Separation by Speaker-Conditioned Spectrogram Masking,","venue":null,"work_id":"6704c47b-5f96-4f89-b9f8-a11d413ed941","year":2019},"citing_paper":{"arxiv_id":"2501.09169","last_updated":"2025-01-15T21:43:49Z","snapshot_observed_at":"2026-08-12T15:49:41.476622Z","submitted_at":"2025-01-15T21:43:49Z","title":"Beyond Speaker Identity: Text Guided Target Speech Extraction","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:00.599522Z"},"links":{"citing_paper":"/paper/2501.09169"},"observation_digest":"sha256:6eaef0d9d53adc0558960491eeccaad46ad5efd2281c8c5646321ae35ffb2b83","observation_id":"5effb835-1de0-438e-89e6-e1e2f390e16f","resolution":{"observed_at":"2026-08-10T20:14:01.355088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:00.605275Z","title":"Speakerbeam: Speaker aware neural network for target speaker extraction in speech mixtures,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.09169","last_updated":"2025-01-15T21:43:49Z","snapshot_observed_at":"2026-08-12T15:49:41.476622Z","submitted_at":"2025-01-15T21:43:49Z","title":"Beyond Speaker Identity: Text Guided Target Speech Extraction","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:00.605275Z"},"links":{"citing_paper":"/paper/2501.09169"},"observation_digest":"sha256:34b054d9a611c6b38a5aaf85d993620aa9ff2ad680d2df3bf28167becfda2e9a","observation_id":"943e1499-b812-41fa-bb79-310e48e11aae","resolution":{"observed_at":"2026-08-10T20:14:00.605275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:01.320625Z","title":"Spex+: A complete time domain speaker extraction network,","venue":null,"work_id":"f0668c0d-a1db-4abb-af00-5613bb260db7","year":2020},"citing_paper":{"arxiv_id":"2501.09169","last_updated":"2025-01-15T21:43:49Z","snapshot_observed_at":"2026-08-12T15:49:41.476622Z","submitted_at":"2025-01-15T21:43:49Z","title":"Beyond Speaker Identity: Text Guided Target Speech Extraction","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:00.610679Z"},"links":{"citing_paper":"/paper/2501.09169"},"observation_digest":"sha256:d7574ed89a56a5a70c74297faa1b352228b7fbc0a03f3749cd811a4e337df1c1","observation_id":"7b4987b4-d832-4ac2-aae7-a985417ee1c3","resolution":{"observed_at":"2026-08-10T20:14:01.326227Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:01.299207Z","title":"Looking to listen at the cocktail party: A speaker-independent audio-visual model for speech separation,","venue":null,"work_id":"5c3800ed-def9-49d7-a803-3ab9e18c1d23","year":2018},"citing_paper":{"arxiv_id":"2501.09169","last_updated":"2025-01-15T21:43:49Z","snapshot_observed_at":"2026-08-12T15:49:41.476622Z","submitted_at":"2025-01-15T21:43:49Z","title":"Beyond Speaker Identity: Text Guided Target Speech Extraction","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:00.615829Z"},"links":{"citing_paper":"/paper/2501.09169"},"observation_digest":"sha256:1aa88ca493858a8f3cdc7ed9714ab86dc8cca2069179462d2f4e39c8b31bf4c5","observation_id":"f0fbe5aa-2ab5-461b-9476-76768b5506bd","resolution":{"observed_at":"2026-08-10T20:14:01.308630Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:01.261027Z","title":"Multimodal SpeakerBeam: Single channel target speech extraction with audio-visual speaker clues","venue":null,"work_id":"80a1f1c7-a6ca-40d0-a98b-56646ca4ce51","year":2019},"citing_paper":{"arxiv_id":"2501.09169","last_updated":"2025-01-15T21:43:49Z","snapshot_observed_at":"2026-08-12T15:49:41.476622Z","submitted_at":"2025-01-15T21:43:49Z","title":"Beyond Speaker Identity: Text Guided Target Speech Extraction","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:00.621232Z"},"links":{"citing_paper":"/paper/2501.09169"},"observation_digest":"sha256:0ea5ece9e4807769d356eacd11af63b1883b3f017ed8ac8a43678266aaf42c58","observation_id":"76c6c715-309f-4dc5-9c9f-3b9eb7f7f082","resolution":{"observed_at":"2026-08-10T20:14:01.269058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:01.231378Z","title":"Text-driven separation of arbitrary sounds,","venue":null,"work_id":"330f6e7d-471a-468a-89a2-9dc42ab7c933","year":2022},"citing_paper":{"arxiv_id":"2501.09169","last_updated":"2025-01-15T21:43:49Z","snapshot_observed_at":"2026-08-12T15:49:41.476622Z","submitted_at":"2025-01-15T21:43:49Z","title":"Beyond Speaker Identity: Text Guided Target Speech Extraction","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:00.625979Z"},"links":{"citing_paper":"/paper/2501.09169"},"observation_digest":"sha256:9af9f79017bf246186d1023b54bb82050649b77c1cd6048d9052d17f808846cd","observation_id":"0d3fb154-6984-4e9f-8660-e71b78b8e072","resolution":{"observed_at":"2026-08-10T20:14:01.241447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:01.207514Z","title":"CLIPSep: Learning text-queried sound separation with noisy unlabeled videos,","venue":null,"work_id":"47692c72-d6bd-459c-a7cf-0ada8c9dd2cf","year":2023},"citing_paper":{"arxiv_id":"2501.09169","last_updated":"2025-01-15T21:43:49Z","snapshot_observed_at":"2026-08-12T15:49:41.476622Z","submitted_at":"2025-01-15T21:43:49Z","title":"Beyond Speaker Identity: Text Guided Target Speech Extraction","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:00.631961Z"},"links":{"citing_paper":"/paper/2501.09169"},"observation_digest":"sha256:77a717dc92fae9ec87cdc2edbf9dacd8f5b0e0e51d53b394dc1197a3f74497fd","observation_id":"d5f7358f-6ef5-4371-a0e1-12e6f3660e6b","resolution":{"observed_at":"2026-08-10T20:14:01.213502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.05037","last_updated":"2024-12-01T15:17:03Z","snapshot_observed_at":"2026-07-06T16:04:26.461227Z","submitted_at":"2023-08-09T16:09:44Z","title":"Separate Anything You Describe","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.05037","snapshot_observed_at":"2026-08-10T20:14:00.636550Z","title":"Separate anything you describe,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.09169","last_updated":"2025-01-15T21:43:49Z","snapshot_observed_at":"2026-08-12T15:49:41.476622Z","submitted_at":"2025-01-15T21:43:49Z","title":"Beyond Speaker Identity: Text Guided Target Speech Extraction","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:00.636550Z"},"links":{"cited_paper":"/paper/2308.05037","citing_paper":"/paper/2501.09169"},"observation_digest":"sha256:ce0d53739474007674f376e9a365775ede29d3cf20c692b014244288f07d49f5","observation_id":"790022a0-24b9-470c-a242-b5139b912fd3","resolution":{"observed_at":"2026-08-10T20:14:00.636550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:01.185016Z","title":"Target sound extraction with variable cross-modality clues,","venue":null,"work_id":"8b2f8e7a-2890-4a81-8169-a74821a33b44","year":2023},"citing_paper":{"arxiv_id":"2501.09169","last_updated":"2025-01-15T21:43:49Z","snapshot_observed_at":"2026-08-12T15:49:41.476622Z","submitted_at":"2025-01-15T21:43:49Z","title":"Beyond Speaker Identity: Text Guided Target Speech Extraction","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:00.641820Z"},"links":{"citing_paper":"/paper/2501.09169"},"observation_digest":"sha256:685b85cd930030a9523f5323a8095ead2928401d19019c9b3d0990fea5313b36","observation_id":"d799943c-7b47-4695-a756-f868eecb56de","resolution":{"observed_at":"2026-08-10T20:14:01.193632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17455","last_updated":"2025-03-21T12:55:53Z","snapshot_observed_at":"2026-08-10T10:53:00.738224Z","submitted_at":"2024-02-27T12:27:18Z","title":"CLAPSep: Leveraging Contrastive Pre-trained Model for Multi-Modal Query-Conditioned Target Sound Extraction","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17455","snapshot_observed_at":"2026-08-10T20:14:00.646171Z","title":"CLAPSep: Leveraging contrastive pre-trained models for multi- modal query-conditioned target sound extraction,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.09169","last_updated":"2025-01-15T21:43:49Z","snapshot_observed_at":"2026-08-12T15:49:41.476622Z","submitted_at":"2025-01-15T21:43:49Z","title":"Beyond Speaker Identity: Text Guided Target Speech Extraction","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:00.646171Z"},"links":{"cited_paper":"/paper/2402.17455","citing_paper":"/paper/2501.09169"},"observation_digest":"sha256:ed9f9a2af76b3c4cc0719a8e81458c77c3d7db53243be7fbfb1ebb6a62519679","observation_id":"c8714b0d-7845-4bf9-979a-8fafcb4697ea","resolution":{"observed_at":"2026-08-10T20:14:00.646171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07284","last_updated":"2024-10-07T06:54:30Z","snapshot_observed_at":"2026-08-10T01:59:40.020150Z","submitted_at":"2023-10-11T08:17:54Z","title":"Typing to Listen at the Cocktail Party: Text-Guided Target Speaker Extraction","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07284","snapshot_observed_at":"2026-08-10T20:14:00.651546Z","title":"Typing to listen at the cocktail party: Text-guided target speaker extraction,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.09169","last_updated":"2025-01-15T21:43:49Z","snapshot_observed_at":"2026-08-12T15:49:41.476622Z","submitted_at":"2025-01-15T21:43:49Z","title":"Beyond Speaker Identity: Text Guided Target Speech Extraction","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:00.651546Z"},"links":{"cited_paper":"/paper/2310.07284","citing_paper":"/paper/2501.09169"},"observation_digest":"sha256:b024e82b50c88325e8a58117bb6cebf8d41b007a69235d3219b6683ef1d50fb8","observation_id":"4577da83-0503-427c-b818-f8e6f8c9f220","resolution":{"observed_at":"2026-08-10T20:14:00.651546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07198","last_updated":"2024-06-11T12:18:18Z","snapshot_observed_at":"2026-07-06T18:28:51.180903Z","submitted_at":"2024-06-11T12:18:18Z","title":"Target Speech Diarization with Multimodal Prompts","version":1},"cited_work":{"arxiv_id":"2406.07198","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.07198","snapshot_observed_at":"2026-08-10T20:14:00.851964Z","title":"Target Speech Diarization with Multimodal Prompts","venue":"eess.AS","work_id":"53e657c4-b2ef-4177-8d00-37d2183d2601","year":2024},"citing_paper":{"arxiv_id":"2501.09169","last_updated":"2025-01-15T21:43:49Z","snapshot_observed_at":"2026-08-12T15:49:41.476622Z","submitted_at":"2025-01-15T21:43:49Z","title":"Beyond Speaker Identity: Text Guided Target Speech Extraction","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:00.657124Z"},"links":{"cited_paper":"/paper/2406.07198","citing_paper":"/paper/2501.09169"},"observation_digest":"sha256:9a7361cabbef9ba134634c47d3e6e08c6903a3f231e4818a09e693b58182c222","observation_id":"529930c3-ceed-44b9-968d-e6124fc551b3","resolution":{"observed_at":"2026-08-10T20:14:00.859643Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:01.159149Z","title":"Attention is all you need in speech separation,","venue":null,"work_id":"e3800757-5e41-4e76-960c-32f3a8aecc69","year":2021},"citing_paper":{"arxiv_id":"2501.09169","last_updated":"2025-01-15T21:43:49Z","snapshot_observed_at":"2026-08-12T15:49:41.476622Z","submitted_at":"2025-01-15T21:43:49Z","title":"Beyond Speaker Identity: Text Guided Target Speech Extraction","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:00.662412Z"},"links":{"citing_paper":"/paper/2501.09169"},"observation_digest":"sha256:d5bf12b93fdad3b05deed9f38aa2e20011a9c57ae57a7af54185be86c4aa7856","observation_id":"41becd24-0ace-429c-ba4f-8606c5eb6231","resolution":{"observed_at":"2026-08-10T20:14:01.165097Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04624","last_updated":"2021-06-08T18:22:56Z","snapshot_observed_at":"2026-08-04T07:20:14.379561Z","submitted_at":"2021-06-08T18:22:56Z","title":"SpeechBrain: A General-Purpose Speech Toolkit","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.04624","snapshot_observed_at":"2026-08-10T20:14:00.667684Z","title":"SpeechBrain: A general-purpose speech toolkit,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.09169","last_updated":"2025-01-15T21:43:49Z","snapshot_observed_at":"2026-08-12T15:49:41.476622Z","submitted_at":"2025-01-15T21:43:49Z","title":"Beyond Speaker Identity: Text Guided Target Speech Extraction","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:00.667684Z"},"links":{"cited_paper":"/paper/2106.04624","citing_paper":"/paper/2501.09169"},"observation_digest":"sha256:874c259499461393f41dbaaad59012b04ac4ade458479e53ef4dd8b9cf9c0359","observation_id":"bdb63dc3-bd02-477b-beed-6ff8d0783781","resolution":{"observed_at":"2026-08-10T20:14:00.667684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:01.142341Z","title":"Textrolspeech: A text style control speech corpus with codec language text-to-speech models,","venue":null,"work_id":"1fab3c02-b916-4544-a336-eee9e4295eb1","year":2024},"citing_paper":{"arxiv_id":"2501.09169","last_updated":"2025-01-15T21:43:49Z","snapshot_observed_at":"2026-08-12T15:49:41.476622Z","submitted_at":"2025-01-15T21:43:49Z","title":"Beyond Speaker Identity: Text Guided Target Speech Extraction","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:00.675548Z"},"links":{"citing_paper":"/paper/2501.09169"},"observation_digest":"sha256:79c0b17ae6f6c0bd016cf048ec13886781f1f34bfe1c742eea6bbbd3ed8077ee","observation_id":"f3eed92a-141a-444f-925f-a158c500a3a3","resolution":{"observed_at":"2026-08-10T20:14:01.147416Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:01.118565Z","title":"Optimization of speaker extraction neural network with magnitude and temporal spectrum approximation loss,","venue":null,"work_id":"c00f565f-618f-4ae0-a045-61ff9e88bc18","year":2019},"citing_paper":{"arxiv_id":"2501.09169","last_updated":"2025-01-15T21:43:49Z","snapshot_observed_at":"2026-08-12T15:49:41.476622Z","submitted_at":"2025-01-15T21:43:49Z","title":"Beyond Speaker Identity: Text Guided Target Speech Extraction","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:00.681693Z"},"links":{"citing_paper":"/paper/2501.09169"},"observation_digest":"sha256:4507b5f70771cf2ffc08b450396d7024c3046518798271b2d42dafac5db2af3d","observation_id":"17418e5a-10de-456d-8c14-58a147cb9a53","resolution":{"observed_at":"2026-08-10T20:14:01.124753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.11262","last_updated":"2020-05-22T16:26:54Z","snapshot_observed_at":"2026-08-10T10:54:26.224254Z","submitted_at":"2020-05-22T16:26:54Z","title":"LibriMix: An Open-Source Dataset for Generalizable Speech Separation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.11262","snapshot_observed_at":"2026-08-10T20:14:00.691235Z","title":"LibriMix: An open-source dataset for generalizable speech separation,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2501.09169","last_updated":"2025-01-15T21:43:49Z","snapshot_observed_at":"2026-08-12T15:49:41.476622Z","submitted_at":"2025-01-15T21:43:49Z","title":"Beyond Speaker Identity: Text Guided Target Speech Extraction","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:00.691235Z"},"links":{"cited_paper":"/paper/2005.11262","citing_paper":"/paper/2501.09169"},"observation_digest":"sha256:4dca9a447e006e261abf216d14cbc01f9adfa07cd428a061870af7824a5fe554","observation_id":"2335e1c5-3911-4214-a303-5b7847321c5f","resolution":{"observed_at":"2026-08-10T20:14:00.691235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:01.095081Z","title":"Dual-path rnn: efficient long sequence modeling for time-domain single-channel speech sepa- ration,","venue":null,"work_id":"336675f2-6b2c-434d-86e0-56b3357c7733","year":2020},"citing_paper":{"arxiv_id":"2501.09169","last_updated":"2025-01-15T21:43:49Z","snapshot_observed_at":"2026-08-12T15:49:41.476622Z","submitted_at":"2025-01-15T21:43:49Z","title":"Beyond Speaker Identity: Text Guided Target Speech Extraction","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:00.703745Z"},"links":{"citing_paper":"/paper/2501.09169"},"observation_digest":"sha256:f0d19447ff2715fcbb411fbb31e56dc8810290b54dad88befbaafa67cf8608ef","observation_id":"80c66340-71a3-460d-93f6-0d24113b728a","resolution":{"observed_at":"2026-08-10T20:14:01.103312Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:01.055357Z","title":"Deep neural networks for acoustic modeling in speech recognition: The shared views of four research groups,","venue":null,"work_id":"3523ae15-d199-43ec-97cf-9b337ba23c93","year":2012},"citing_paper":{"arxiv_id":"2501.09169","last_updated":"2025-01-15T21:43:49Z","snapshot_observed_at":"2026-08-12T15:49:41.476622Z","submitted_at":"2025-01-15T21:43:49Z","title":"Beyond Speaker Identity: Text Guided Target Speech Extraction","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:00.709583Z"},"links":{"citing_paper":"/paper/2501.09169"},"observation_digest":"sha256:9c4da2c59b762ee3fbc5b1f13d61518774fffd33fe8da694c2336ee678d3bfea","observation_id":"4bb5b753-248c-4144-a981-612c9e84d0d8","resolution":{"observed_at":"2026-08-10T20:14:01.060804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:00.715163Z","title":"X-vectors: Robust dnn embeddings for speaker recognition,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.09169","last_updated":"2025-01-15T21:43:49Z","snapshot_observed_at":"2026-08-12T15:49:41.476622Z","submitted_at":"2025-01-15T21:43:49Z","title":"Beyond Speaker Identity: Text Guided Target Speech Extraction","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:00.715163Z"},"links":{"citing_paper":"/paper/2501.09169"},"observation_digest":"sha256:c532886757eb5bb07e9d8247d5dab6ac62e5b236ccf7e9290ecab52d7ff9e64f","observation_id":"540a7d0f-2926-478c-821e-9abe2cbc5e3f","resolution":{"observed_at":"2026-08-10T20:14:00.715163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-10T20:14:00.721189Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.09169","last_updated":"2025-01-15T21:43:49Z","snapshot_observed_at":"2026-08-12T15:49:41.476622Z","submitted_at":"2025-01-15T21:43:49Z","title":"Beyond Speaker Identity: Text Guided Target Speech Extraction","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:00.721189Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2501.09169"},"observation_digest":"sha256:536d6cec832553dbcf2be071b9173edb805bba6c8c8f746253b49ac657dd0dd1","observation_id":"06270b51-d33d-43fc-8a96-84f584383de9","resolution":{"observed_at":"2026-08-10T20:14:00.721189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:01.026405Z","title":"Semi- supervised time domain target speaker extraction with attention,","venue":null,"work_id":"4ba0b0c1-f730-4e7c-8fb6-9288bbf7e45e","year":2021},"citing_paper":{"arxiv_id":"2501.09169","last_updated":"2025-01-15T21:43:49Z","snapshot_observed_at":"2026-08-12T15:49:41.476622Z","submitted_at":"2025-01-15T21:43:49Z","title":"Beyond Speaker Identity: Text Guided Target Speech Extraction","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:00.726748Z"},"links":{"citing_paper":"/paper/2501.09169"},"observation_digest":"sha256:584d9f840fee2f53d74acc8e3d30cf7e80288d640e48e3702241e86835120646","observation_id":"8491beed-4259-4cc3-a58f-5bb734d19bae","resolution":{"observed_at":"2026-08-10T20:14:01.032498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:00.998034Z","title":"Performance measure- ment in blind audio source separation,","venue":null,"work_id":"e44017b5-9d3e-4f53-a128-12501e6d51fe","year":2006},"citing_paper":{"arxiv_id":"2501.09169","last_updated":"2025-01-15T21:43:49Z","snapshot_observed_at":"2026-08-12T15:49:41.476622Z","submitted_at":"2025-01-15T21:43:49Z","title":"Beyond Speaker Identity: Text Guided Target Speech Extraction","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:00.731405Z"},"links":{"citing_paper":"/paper/2501.09169"},"observation_digest":"sha256:dbff4e6a80f7d232bb6e9af86e58b5364545cb88bb68aa7662667cbc2dbf07c7","observation_id":"bb48f634-17e7-43d2-ae8f-024f92d5d5b3","resolution":{"observed_at":"2026-08-10T20:14:01.011895Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:00.979671Z","title":"Wavesplit: End-to-end speech sep- aration by speaker clustering,","venue":null,"work_id":"6d922203-be8e-4291-bcf7-e9891f5e01a2","year":2021},"citing_paper":{"arxiv_id":"2501.09169","last_updated":"2025-01-15T21:43:49Z","snapshot_observed_at":"2026-08-12T15:49:41.476622Z","submitted_at":"2025-01-15T21:43:49Z","title":"Beyond Speaker Identity: Text Guided Target Speech Extraction","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:00.737069Z"},"links":{"citing_paper":"/paper/2501.09169"},"observation_digest":"sha256:5f56420484b0768abdb3be5aa6906e596412514ec6cfccf99f53a4c3643740b5","observation_id":"1ef555f1-f253-4f8b-a894-1524efce4221","resolution":{"observed_at":"2026-08-10T20:14:00.985082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:00.963198Z","title":"Perceptual evaluation of speech quality (PESQ)-a new method for speech quality assessment of telephone networks and codecs,","venue":null,"work_id":"e1fd3d7c-0ad9-4ab4-b20b-c1b66360bd6b","year":2001},"citing_paper":{"arxiv_id":"2501.09169","last_updated":"2025-01-15T21:43:49Z","snapshot_observed_at":"2026-08-12T15:49:41.476622Z","submitted_at":"2025-01-15T21:43:49Z","title":"Beyond Speaker Identity: Text Guided Target Speech Extraction","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:00.742812Z"},"links":{"citing_paper":"/paper/2501.09169"},"observation_digest":"sha256:0e421a696d3f1f11b036b73e58b31cfd4c66895da0d0fc2a1a11518096bccda9","observation_id":"44f33c04-f025-45f8-bbd4-e5dbf6544a93","resolution":{"observed_at":"2026-08-10T20:14:00.968610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:00.948281Z","title":"Conv-tasnet: Surpassing ideal time– frequency magnitude masking for speech separation,","venue":null,"work_id":"456b2207-ee16-4dad-8604-e6a4237ed6e1","year":2019},"citing_paper":{"arxiv_id":"2501.09169","last_updated":"2025-01-15T21:43:49Z","snapshot_observed_at":"2026-08-12T15:49:41.476622Z","submitted_at":"2025-01-15T21:43:49Z","title":"Beyond Speaker Identity: Text Guided Target Speech Extraction","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:00.749916Z"},"links":{"citing_paper":"/paper/2501.09169"},"observation_digest":"sha256:a1ba2e74a1aa197777158eda9783f626b9221606864c50aa0cc44d6665ceee13","observation_id":"c4e21c3a-685c-4476-af3d-6a1e468f98e7","resolution":{"observed_at":"2026-08-10T20:14:00.952605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:00.934771Z","title":"Self-supervised disentangled representation learning for robust target speech extraction,","venue":null,"work_id":"e752b65c-4053-4b8d-ac3e-ca0dfc76b548","year":2024},"citing_paper":{"arxiv_id":"2501.09169","last_updated":"2025-01-15T21:43:49Z","snapshot_observed_at":"2026-08-12T15:49:41.476622Z","submitted_at":"2025-01-15T21:43:49Z","title":"Beyond Speaker Identity: Text Guided Target Speech Extraction","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:00.754527Z"},"links":{"citing_paper":"/paper/2501.09169"},"observation_digest":"sha256:82ee7448dfa429b916e15d33cb38c1c84225b471b5db773de153bf32bb78e1a9","observation_id":"287ae483-999f-4ee8-ae62-19339118296c","resolution":{"observed_at":"2026-08-10T20:14:00.939537Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.09169","last_updated":"2025-01-15T21:43:49Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-12T15:49:41.476622Z","submitted_at":"2025-01-15T21:43:49Z","title":"Beyond Speaker Identity: Text Guided Target Speech Extraction"},"reference_resolution":{"displayed":27,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":8,"verified_exact":1,"verified_fuzzy":18},"total_outbound_references":27},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 27 of 27 outbound references and 0 inbound Pith citation observations for arXiv:2501.09169."}