{"as_of":"2026-08-15T08:05:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bffd9e743d8bf90af9ec9d9b56774f7da9f5639b4e2e212a0adbdd64b9176e49","coverage":[{"denominator":53,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T21:57:02.568478Z","state":"measured"},{"denominator":53,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":53,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.03184/citation-record","integrity":"/paper/2501.03184/integrity","json":"/paper/2501.03184/citation-record.json","paper":"/paper/2501.03184"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:57:03.413751Z","title":"rV AD: An unsupervised segment-based robust voice activity detection method,","venue":null,"work_id":"4a44d0c4-555d-48bb-888c-bafe4ff1a08f","year":2020},"citing_paper":{"arxiv_id":"2501.03184","last_updated":"2025-01-06T18:00:14Z","snapshot_observed_at":"2026-08-11T00:05:58.578355Z","submitted_at":"2025-01-06T18:00:14Z","title":"Noise-Robust Target-Speaker Voice Activity Detection Through Self-Supervised Pretraining","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:02.311351Z"},"links":{"citing_paper":"/paper/2501.03184"},"observation_digest":"sha256:a37ce73325ea6635ead1e2d6c58bd5504fad9ec64aa04d211dc2daf4af46318f","observation_id":"8cc40807-84df-4175-8b72-6c22edfb4573","resolution":{"observed_at":"2026-08-10T21:57:03.419230Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:57:02.316337Z","title":"V oice activity detection in the wild: A data-driven approach using teacher-student training,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.03184","last_updated":"2025-01-06T18:00:14Z","snapshot_observed_at":"2026-08-11T00:05:58.578355Z","submitted_at":"2025-01-06T18:00:14Z","title":"Noise-Robust Target-Speaker Voice Activity Detection Through Self-Supervised Pretraining","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:02.316337Z"},"links":{"citing_paper":"/paper/2501.03184"},"observation_digest":"sha256:17b610b97b54143394f922f7d1a34ae5c50951e673a571eee1925af704579db6","observation_id":"9c0ce093-394f-4588-8194-4bbdd8f3c09f","resolution":{"observed_at":"2026-08-10T21:57:02.316337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:57:03.385866Z","title":"Robust voice activity detection using an auditory-inspired masked modulation encoder based convolutional attention network,","venue":null,"work_id":"1453c1a1-3c99-4c42-80f5-4a4888ea26f5","year":2024},"citing_paper":{"arxiv_id":"2501.03184","last_updated":"2025-01-06T18:00:14Z","snapshot_observed_at":"2026-08-11T00:05:58.578355Z","submitted_at":"2025-01-06T18:00:14Z","title":"Noise-Robust Target-Speaker Voice Activity Detection Through Self-Supervised Pretraining","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:02.320789Z"},"links":{"citing_paper":"/paper/2501.03184"},"observation_digest":"sha256:856fa8e9268f2b8cab62451bb2ca8a3863723bd953e92c56ee51289c30f107d7","observation_id":"e2e559a8-8e5a-4b97-8b68-763bacd4cc8e","resolution":{"observed_at":"2026-08-10T21:57:03.391416Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:57:03.368357Z","title":"V oice biometric system security: Design and analysis of countermeasures for replay attacks","venue":null,"work_id":"9165d668-4079-46ad-8685-29735400a74e","year":2020},"citing_paper":{"arxiv_id":"2501.03184","last_updated":"2025-01-06T18:00:14Z","snapshot_observed_at":"2026-08-11T00:05:58.578355Z","submitted_at":"2025-01-06T18:00:14Z","title":"Noise-Robust Target-Speaker Voice Activity Detection Through Self-Supervised Pretraining","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:02.325687Z"},"links":{"citing_paper":"/paper/2501.03184"},"observation_digest":"sha256:7864ee39b9fb2a96424dfedc2b9743c17abd79fcbd2607294e811b627781b370","observation_id":"e159f841-f467-47bd-a409-1cb1268db226","resolution":{"observed_at":"2026-08-10T21:57:03.373459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:57:03.353073Z","title":"Audiovisual speaker indexing for web-tv automations,","venue":null,"work_id":"ac6b21d7-e189-4b74-bfe4-5549b7a992cd","year":2021},"citing_paper":{"arxiv_id":"2501.03184","last_updated":"2025-01-06T18:00:14Z","snapshot_observed_at":"2026-08-11T00:05:58.578355Z","submitted_at":"2025-01-06T18:00:14Z","title":"Noise-Robust Target-Speaker Voice Activity Detection Through Self-Supervised Pretraining","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:02.331212Z"},"links":{"citing_paper":"/paper/2501.03184"},"observation_digest":"sha256:527e728f359e2fa2cb8c60a5f15004b5945a305e173f7a1044d8575874ab7d9e","observation_id":"0fb1f21d-3405-4bcc-b25d-7fb0c59fa4b8","resolution":{"observed_at":"2026-08-10T21:57:03.357799Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:57:03.338262Z","title":"Neural target speech extraction: An overview,","venue":null,"work_id":"429e3179-0c28-4568-ab62-488c0c6f9a5b","year":2023},"citing_paper":{"arxiv_id":"2501.03184","last_updated":"2025-01-06T18:00:14Z","snapshot_observed_at":"2026-08-11T00:05:58.578355Z","submitted_at":"2025-01-06T18:00:14Z","title":"Noise-Robust Target-Speaker Voice Activity Detection Through Self-Supervised Pretraining","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:02.337966Z"},"links":{"citing_paper":"/paper/2501.03184"},"observation_digest":"sha256:1f8eae95625b4fc70aad556a530d83f13c22d5837c22a0e56454ab6b770f3ade","observation_id":"e83e1b8c-0cb6-4aca-a7bc-9bfcb55ca68f","resolution":{"observed_at":"2026-08-10T21:57:03.343696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:57:03.322723Z","title":"Speakerbeam: Speaker aware neural network for target speaker extraction in speech mixtures,","venue":null,"work_id":"0623bb30-2a49-43b8-aa16-17686daf7a81","year":2019},"citing_paper":{"arxiv_id":"2501.03184","last_updated":"2025-01-06T18:00:14Z","snapshot_observed_at":"2026-08-11T00:05:58.578355Z","submitted_at":"2025-01-06T18:00:14Z","title":"Noise-Robust Target-Speaker Voice Activity Detection Through Self-Supervised Pretraining","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:02.343699Z"},"links":{"citing_paper":"/paper/2501.03184"},"observation_digest":"sha256:8f7b1358efe88c87c950e8116fae6ea7aa5e77210f227a7b6cd0bc45319b3afd","observation_id":"4f20ab46-882f-4a7b-940e-e82de34eeb48","resolution":{"observed_at":"2026-08-10T21:57:03.327807Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:57:03.305517Z","title":"Per- sonal V AD: Speaker-conditioned voice activity detection,","venue":null,"work_id":"05d0d634-1e8e-440a-81d0-90db60c10212","year":2020},"citing_paper":{"arxiv_id":"2501.03184","last_updated":"2025-01-06T18:00:14Z","snapshot_observed_at":"2026-08-11T00:05:58.578355Z","submitted_at":"2025-01-06T18:00:14Z","title":"Noise-Robust Target-Speaker Voice Activity Detection Through Self-Supervised Pretraining","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:02.348715Z"},"links":{"citing_paper":"/paper/2501.03184"},"observation_digest":"sha256:b35a16496594f6c6f8760b65ef20b1d277985925ab931757d74ba4c0de53de36","observation_id":"0e755325-d70e-480c-aaba-4572f718cb3e","resolution":{"observed_at":"2026-08-10T21:57:03.310965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:57:03.290006Z","title":"Personal V AD 2.0: Optimizing personal voice activity detection for on-device speech recognition,","venue":null,"work_id":"4dc25d97-e07e-4b08-9bd2-ceebc5d579a2","year":2022},"citing_paper":{"arxiv_id":"2501.03184","last_updated":"2025-01-06T18:00:14Z","snapshot_observed_at":"2026-08-11T00:05:58.578355Z","submitted_at":"2025-01-06T18:00:14Z","title":"Noise-Robust Target-Speaker Voice Activity Detection Through Self-Supervised Pretraining","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:02.352736Z"},"links":{"citing_paper":"/paper/2501.03184"},"observation_digest":"sha256:dc92dbacd7401f8f08a2e4fdb93ac7f589867a947b0d381948b5bdc9317c0c2c","observation_id":"29ac4f61-64a3-46e6-8ff0-58f456621b24","resolution":{"observed_at":"2026-08-10T21:57:03.295892Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:57:03.274688Z","title":"Target speech extraction with pre-trained self-supervised learning models,","venue":null,"work_id":"f9714f22-2ca5-493f-89b5-67ac518df59e","year":2024},"citing_paper":{"arxiv_id":"2501.03184","last_updated":"2025-01-06T18:00:14Z","snapshot_observed_at":"2026-08-11T00:05:58.578355Z","submitted_at":"2025-01-06T18:00:14Z","title":"Noise-Robust Target-Speaker Voice Activity Detection Through Self-Supervised Pretraining","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:02.357023Z"},"links":{"citing_paper":"/paper/2501.03184"},"observation_digest":"sha256:10b4995b43ccfec7e6e0dafc8ca1db8dfbfe2762b850add818fae982aa0e44d0","observation_id":"00acbc08-e568-4731-9611-f1bf0e91a745","resolution":{"observed_at":"2026-08-10T21:57:03.280845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:57:03.261203Z","title":"Target-speaker voice activity detection: a novel approach for multi-speaker diarization in a dinner party scenario,","venue":null,"work_id":"1ac1abfb-d1cd-4fe5-91d6-ced7c8b5f7dc","year":2020},"citing_paper":{"arxiv_id":"2501.03184","last_updated":"2025-01-06T18:00:14Z","snapshot_observed_at":"2026-08-11T00:05:58.578355Z","submitted_at":"2025-01-06T18:00:14Z","title":"Noise-Robust Target-Speaker Voice Activity Detection Through Self-Supervised Pretraining","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:02.361696Z"},"links":{"citing_paper":"/paper/2501.03184"},"observation_digest":"sha256:77b4d8191d02cde66d7c9f7e0453a078c8a5848868de20933926c1849c1fb126","observation_id":"7553fe0a-d2e9-4439-a6dd-6fa360d8f40a","resolution":{"observed_at":"2026-08-10T21:57:03.264954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:57:03.245220Z","title":"Target- speaker voice activity detection with improved i-vector estimation for unknown number of speaker,","venue":null,"work_id":"8df43b58-29b8-4c47-950c-dacb5d486d13","year":2021},"citing_paper":{"arxiv_id":"2501.03184","last_updated":"2025-01-06T18:00:14Z","snapshot_observed_at":"2026-08-11T00:05:58.578355Z","submitted_at":"2025-01-06T18:00:14Z","title":"Noise-Robust Target-Speaker Voice Activity Detection Through Self-Supervised Pretraining","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:02.366910Z"},"links":{"citing_paper":"/paper/2501.03184"},"observation_digest":"sha256:2394aeb5056faff9b23dbb71965d02169365a75ba98db17baf33cb2579bdd26d","observation_id":"79fe2f20-69f2-492b-aa6a-05fdbc71a639","resolution":{"observed_at":"2026-08-10T21:57:03.251477Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:57:03.228183Z","title":"Target speaker voice activity detection with transformers and its integration with end- to-end neural diarization,","venue":null,"work_id":"f4b3c077-9a8a-46f7-9fcd-cfb517a311a1","year":2023},"citing_paper":{"arxiv_id":"2501.03184","last_updated":"2025-01-06T18:00:14Z","snapshot_observed_at":"2026-08-11T00:05:58.578355Z","submitted_at":"2025-01-06T18:00:14Z","title":"Noise-Robust Target-Speaker Voice Activity Detection Through Self-Supervised Pretraining","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:02.370489Z"},"links":{"citing_paper":"/paper/2501.03184"},"observation_digest":"sha256:4d9b057d4b500122b2b20a6f1bd707252c5ed7ca65f1630123be5b2381544b0c","observation_id":"aa4bdbd9-ea5e-4afb-8efe-071424a1de4f","resolution":{"observed_at":"2026-08-10T21:57:03.235495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:57:03.207424Z","title":"Profile-error-tolerant target-speaker voice activity detection,","venue":null,"work_id":"841ebbe4-7060-4195-a6dc-0d43d386a370","year":2024},"citing_paper":{"arxiv_id":"2501.03184","last_updated":"2025-01-06T18:00:14Z","snapshot_observed_at":"2026-08-11T00:05:58.578355Z","submitted_at":"2025-01-06T18:00:14Z","title":"Noise-Robust Target-Speaker Voice Activity Detection Through Self-Supervised Pretraining","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:02.374049Z"},"links":{"citing_paper":"/paper/2501.03184"},"observation_digest":"sha256:5eaa256b5e8b3910148ef0b1bbd45ca7a10787aa207c87c5c805ee241eb0f83d","observation_id":"0ccae93b-eab4-46ec-8eea-ace328e26948","resolution":{"observed_at":"2026-08-10T21:57:03.215029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:57:03.188218Z","title":"Multimodal attention fusion for target speaker extraction,","venue":null,"work_id":"207dbde3-b307-4adb-b859-2ab4e74c3b7e","year":2021},"citing_paper":{"arxiv_id":"2501.03184","last_updated":"2025-01-06T18:00:14Z","snapshot_observed_at":"2026-08-11T00:05:58.578355Z","submitted_at":"2025-01-06T18:00:14Z","title":"Noise-Robust Target-Speaker Voice Activity Detection Through Self-Supervised Pretraining","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:02.378202Z"},"links":{"citing_paper":"/paper/2501.03184"},"observation_digest":"sha256:d26c9a38c5145cf5e397a963d17236b7ae391176ec5e0ef83d9956dd28298d53","observation_id":"7dfb6889-7ba1-4155-b32b-c59f751ca9ea","resolution":{"observed_at":"2026-08-10T21:57:03.193356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:57:03.166964Z","title":"Multimodal speakerbeam: Single channel target speech extraction with audio-visual speaker clues","venue":null,"work_id":"487a5df8-a2fe-402d-957d-d550f79020f8","year":2019},"citing_paper":{"arxiv_id":"2501.03184","last_updated":"2025-01-06T18:00:14Z","snapshot_observed_at":"2026-08-11T00:05:58.578355Z","submitted_at":"2025-01-06T18:00:14Z","title":"Noise-Robust Target-Speaker Voice Activity Detection Through Self-Supervised Pretraining","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:02.383782Z"},"links":{"citing_paper":"/paper/2501.03184"},"observation_digest":"sha256:f06f4229026eef5ab8dab86940c1da53c20966279093620eb9a3a07c8a478e7c","observation_id":"3b42f450-f794-4c41-b1b3-5deaef20b1dd","resolution":{"observed_at":"2026-08-10T21:57:03.173474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:57:03.148052Z","title":"Av-sepformer: Cross-attention sepformer for audio-visual target speaker extraction,","venue":null,"work_id":"60d547e8-ab62-4ff5-8656-efb7f291e39a","year":2023},"citing_paper":{"arxiv_id":"2501.03184","last_updated":"2025-01-06T18:00:14Z","snapshot_observed_at":"2026-08-11T00:05:58.578355Z","submitted_at":"2025-01-06T18:00:14Z","title":"Noise-Robust Target-Speaker Voice Activity Detection Through Self-Supervised Pretraining","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:02.388408Z"},"links":{"citing_paper":"/paper/2501.03184"},"observation_digest":"sha256:759251b80f523ce6cb63894a21b3554d41baa9aed6b7fbdba73fbcb4b2116bae","observation_id":"1a02336b-b7a5-4672-b898-fe58cb7efdf0","resolution":{"observed_at":"2026-08-10T21:57:03.155325Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:57:03.130377Z","title":"Usev: Universal speaker extraction with visual cue,","venue":null,"work_id":"9717bb1e-d6f2-4e31-979a-f6ea622030d7","year":2022},"citing_paper":{"arxiv_id":"2501.03184","last_updated":"2025-01-06T18:00:14Z","snapshot_observed_at":"2026-08-11T00:05:58.578355Z","submitted_at":"2025-01-06T18:00:14Z","title":"Noise-Robust Target-Speaker Voice Activity Detection Through Self-Supervised Pretraining","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:02.392385Z"},"links":{"citing_paper":"/paper/2501.03184"},"observation_digest":"sha256:3529bc7ca9201808bbd3abbe93a5b21603d2825ade439b8fecbcc69d73b360aa","observation_id":"19382b48-c880-40c7-b48c-802cdb5da07f","resolution":{"observed_at":"2026-08-10T21:57:03.135132Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:57:03.112716Z","title":"Brain-informed speech separation (biss) for enhancement of target speaker in multitalker speech perception,","venue":null,"work_id":"8c137419-af30-4e56-a6c7-939c7f03e34f","year":2020},"citing_paper":{"arxiv_id":"2501.03184","last_updated":"2025-01-06T18:00:14Z","snapshot_observed_at":"2026-08-11T00:05:58.578355Z","submitted_at":"2025-01-06T18:00:14Z","title":"Noise-Robust Target-Speaker Voice Activity Detection Through Self-Supervised Pretraining","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:02.398227Z"},"links":{"citing_paper":"/paper/2501.03184"},"observation_digest":"sha256:0dfa3ff05c147224cebb57541c73f5b2cda044b5334d700a458e5812c1b34df9","observation_id":"dc16625e-cfe1-42fe-9122-16d3702c6751","resolution":{"observed_at":"2026-08-10T21:57:03.117893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:57:03.096455Z","title":"Target speaker detection with concealed eeg around the ear,","venue":null,"work_id":"83f027a6-d565-44a1-af61-44d4c57f2a2b","year":2016},"citing_paper":{"arxiv_id":"2501.03184","last_updated":"2025-01-06T18:00:14Z","snapshot_observed_at":"2026-08-11T00:05:58.578355Z","submitted_at":"2025-01-06T18:00:14Z","title":"Noise-Robust Target-Speaker Voice Activity Detection Through Self-Supervised Pretraining","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:02.402985Z"},"links":{"citing_paper":"/paper/2501.03184"},"observation_digest":"sha256:80ff569f0aecee909f15058c3c70c9d4a92ed63c524948512ef92e91e51ddf04","observation_id":"e29ad883-373e-4a45-bd88-5ebb6c64f633","resolution":{"observed_at":"2026-08-10T21:57:03.100835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:57:03.078749Z","title":"Eeg decoding of the target speaker in a cocktail party scenario: considerations regarding dynamic switching of talker location,","venue":null,"work_id":"ee6c332f-36d9-4456-9424-07c26b11212e","year":2019},"citing_paper":{"arxiv_id":"2501.03184","last_updated":"2025-01-06T18:00:14Z","snapshot_observed_at":"2026-08-11T00:05:58.578355Z","submitted_at":"2025-01-06T18:00:14Z","title":"Noise-Robust Target-Speaker Voice Activity Detection Through Self-Supervised Pretraining","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:02.408508Z"},"links":{"citing_paper":"/paper/2501.03184"},"observation_digest":"sha256:12e952cf0a577b1fe51444811a62d1e1fad06c12d2c94cbc07214b522cc18f94","observation_id":"0bb8d991-43ab-43f8-8152-c28403f145ba","resolution":{"observed_at":"2026-08-10T21:57:03.084500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:57:03.057996Z","title":"Cortical auditory at- tention decoding during music and speech listening,","venue":null,"work_id":"027c15c5-5fb0-495d-9796-b8465da55a37","year":2023},"citing_paper":{"arxiv_id":"2501.03184","last_updated":"2025-01-06T18:00:14Z","snapshot_observed_at":"2026-08-11T00:05:58.578355Z","submitted_at":"2025-01-06T18:00:14Z","title":"Noise-Robust Target-Speaker Voice Activity Detection Through Self-Supervised Pretraining","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:02.414172Z"},"links":{"citing_paper":"/paper/2501.03184"},"observation_digest":"sha256:7be5594f33d4ece12612fc689e43e117b0985651a842d104fb8d96119755b8f6","observation_id":"15a3f4c4-2394-448f-9080-29f66d731cb0","resolution":{"observed_at":"2026-08-10T21:57:03.063569Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:57:02.419361Z","title":"Self-supervised speech representation learning: A review,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.03184","last_updated":"2025-01-06T18:00:14Z","snapshot_observed_at":"2026-08-11T00:05:58.578355Z","submitted_at":"2025-01-06T18:00:14Z","title":"Noise-Robust Target-Speaker Voice Activity Detection Through Self-Supervised Pretraining","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:02.419361Z"},"links":{"citing_paper":"/paper/2501.03184"},"observation_digest":"sha256:2dd86f54e242efce14d004c63ba155a59eba40e1ae314d6e5545c0bedbfa4d18","observation_id":"a8d165d2-e984-48b7-9481-a7e9358b23cc","resolution":{"observed_at":"2026-08-10T21:57:02.419361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:57:02.426095Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech representations,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.03184","last_updated":"2025-01-06T18:00:14Z","snapshot_observed_at":"2026-08-11T00:05:58.578355Z","submitted_at":"2025-01-06T18:00:14Z","title":"Noise-Robust Target-Speaker Voice Activity Detection Through Self-Supervised Pretraining","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:02.426095Z"},"links":{"citing_paper":"/paper/2501.03184"},"observation_digest":"sha256:8b4a41b8c3be78f39e5ddc5bc95ae9883b03eca2198b8796fa4171b72a602a8f","observation_id":"52bd3b3a-6c90-415f-9080-309215240994","resolution":{"observed_at":"2026-08-10T21:57:02.426095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:57:02.431390Z","title":"HuBERT: Self-supervised speech representation learning by masked prediction of hidden units,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.03184","last_updated":"2025-01-06T18:00:14Z","snapshot_observed_at":"2026-08-11T00:05:58.578355Z","submitted_at":"2025-01-06T18:00:14Z","title":"Noise-Robust Target-Speaker Voice Activity Detection Through Self-Supervised Pretraining","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:02.431390Z"},"links":{"citing_paper":"/paper/2501.03184"},"observation_digest":"sha256:c966eea9c188a1266970930f185aba6c6700e1a617d74f35ba1e6557dfd3f6a8","observation_id":"b2473e1b-e498-4d17-b720-fec15d1a48ac","resolution":{"observed_at":"2026-08-10T21:57:02.431390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:57:02.436697Z","title":"WavLM: Large-scale self- supervised pre-training for full stack speech processing,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.03184","last_updated":"2025-01-06T18:00:14Z","snapshot_observed_at":"2026-08-11T00:05:58.578355Z","submitted_at":"2025-01-06T18:00:14Z","title":"Noise-Robust Target-Speaker Voice Activity Detection Through Self-Supervised Pretraining","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:02.436697Z"},"links":{"citing_paper":"/paper/2501.03184"},"observation_digest":"sha256:74ccac1bc2d75cce47d54a97ef1893841fa238aa459373e506dd14ea2d38237e","observation_id":"cde589c0-16ba-4cb7-a340-5fdd469f4ed4","resolution":{"observed_at":"2026-08-10T21:57:02.436697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:57:02.987609Z","title":"Self-supervised pretraining for robust personalized voice activity detection in adverse conditions,","venue":null,"work_id":"53aae2d1-2d6e-472c-b452-6fee7526f16d","year":2024},"citing_paper":{"arxiv_id":"2501.03184","last_updated":"2025-01-06T18:00:14Z","snapshot_observed_at":"2026-08-11T00:05:58.578355Z","submitted_at":"2025-01-06T18:00:14Z","title":"Noise-Robust Target-Speaker Voice Activity Detection Through Self-Supervised Pretraining","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:02.441426Z"},"links":{"citing_paper":"/paper/2501.03184"},"observation_digest":"sha256:029ca454a49bbe86f4d09d5253a6e5e276b615926cedd313355da5adb45d218c","observation_id":"d77e2797-a8d8-4b2b-9601-01914e3a64fa","resolution":{"observed_at":"2026-08-10T21:57:02.992252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:57:02.969299Z","title":"Features for voice activity detection: a comparative analysis,","venue":null,"work_id":"9009b99f-3506-4d94-88b6-ce7994c9cd88","year":2015},"citing_paper":{"arxiv_id":"2501.03184","last_updated":"2025-01-06T18:00:14Z","snapshot_observed_at":"2026-08-11T00:05:58.578355Z","submitted_at":"2025-01-06T18:00:14Z","title":"Noise-Robust Target-Speaker Voice Activity Detection Through Self-Supervised Pretraining","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:02.448001Z"},"links":{"citing_paper":"/paper/2501.03184"},"observation_digest":"sha256:b2c68df519344e8d096a605d59837ca804f8cc79f0f743e79ee20c147de846fb","observation_id":"2a2b6f54-e75d-4080-8c70-4d593ba5336c","resolution":{"observed_at":"2026-08-10T21:57:02.974156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:57:02.953801Z","title":"I-vector-based speaker adaptation of deep neural networks for french broadcast audio transcription,","venue":null,"work_id":"03c796ef-9863-4896-aa5a-0d18f365e6f3","year":2014},"citing_paper":{"arxiv_id":"2501.03184","last_updated":"2025-01-06T18:00:14Z","snapshot_observed_at":"2026-08-11T00:05:58.578355Z","submitted_at":"2025-01-06T18:00:14Z","title":"Noise-Robust Target-Speaker Voice Activity Detection Through Self-Supervised Pretraining","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:02.453109Z"},"links":{"citing_paper":"/paper/2501.03184"},"observation_digest":"sha256:1c1645920235bfd9f66a334247bbda2c309e795e82aa89c9bdaf65235efb2978","observation_id":"a6d98d99-5e1d-4057-b6bd-7068c0664229","resolution":{"observed_at":"2026-08-10T21:57:02.959356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:57:02.937149Z","title":"Deep neural networks for small footprint text-dependent speaker verification,","venue":null,"work_id":"69273843-4cd6-4995-93a6-de68fb29322d","year":2014},"citing_paper":{"arxiv_id":"2501.03184","last_updated":"2025-01-06T18:00:14Z","snapshot_observed_at":"2026-08-11T00:05:58.578355Z","submitted_at":"2025-01-06T18:00:14Z","title":"Noise-Robust Target-Speaker Voice Activity Detection Through Self-Supervised Pretraining","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:02.458119Z"},"links":{"citing_paper":"/paper/2501.03184"},"observation_digest":"sha256:624d7bdd8fda82f4ca20febec4470308b64819c87f7c851e080091e380aa04f5","observation_id":"5fee9e3f-d381-4380-8f4f-36db9c9ca7fb","resolution":{"observed_at":"2026-08-10T21:57:02.943226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:57:02.917244Z","title":"Generalized end-to-end loss for speaker verification,","venue":null,"work_id":"0c7b6daf-4877-478f-8d72-8e91a7db87db","year":2018},"citing_paper":{"arxiv_id":"2501.03184","last_updated":"2025-01-06T18:00:14Z","snapshot_observed_at":"2026-08-11T00:05:58.578355Z","submitted_at":"2025-01-06T18:00:14Z","title":"Noise-Robust Target-Speaker Voice Activity Detection Through Self-Supervised Pretraining","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:02.463382Z"},"links":{"citing_paper":"/paper/2501.03184"},"observation_digest":"sha256:c5a91616df5aec46bae0648379070991b1be4259d011bcbba4b3cca016452924","observation_id":"7054ccb0-e335-4f80-a457-8727123350cf","resolution":{"observed_at":"2026-08-10T21:57:02.922685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:57:02.901407Z","title":"X- vectors: Robust dnn embeddings for speaker recognition,","venue":null,"work_id":"bde72a70-d013-44b3-a83c-397ea77d5e6b","year":2018},"citing_paper":{"arxiv_id":"2501.03184","last_updated":"2025-01-06T18:00:14Z","snapshot_observed_at":"2026-08-11T00:05:58.578355Z","submitted_at":"2025-01-06T18:00:14Z","title":"Noise-Robust Target-Speaker Voice Activity Detection Through Self-Supervised Pretraining","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:02.468419Z"},"links":{"citing_paper":"/paper/2501.03184"},"observation_digest":"sha256:3205422a19e6419e2857a5b736e2ad9b9ee42aba22841fb9176432dc52ffda67","observation_id":"133c8f00-d408-4709-8214-564c1049c6a8","resolution":{"observed_at":"2026-08-10T21:57:02.906596Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:57:02.885433Z","title":"Attention is all you need,","venue":null,"work_id":"a38e5cb7-ec91-473d-bd90-a3bf19a00cb4","year":2017},"citing_paper":{"arxiv_id":"2501.03184","last_updated":"2025-01-06T18:00:14Z","snapshot_observed_at":"2026-08-11T00:05:58.578355Z","submitted_at":"2025-01-06T18:00:14Z","title":"Noise-Robust Target-Speaker Voice Activity Detection Through Self-Supervised Pretraining","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:02.472674Z"},"links":{"citing_paper":"/paper/2501.03184"},"observation_digest":"sha256:d222ec5401479832fed5efe5b3054a3802b0cc22de3d4336338d13c8e97cb50b","observation_id":"27fbdb2d-edc3-49b5-8783-6c286e145c80","resolution":{"observed_at":"2026-08-10T21:57:02.890665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:57:02.476956Z","title":"Film: Visual reasoning with a general conditioning layer,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.03184","last_updated":"2025-01-06T18:00:14Z","snapshot_observed_at":"2026-08-11T00:05:58.578355Z","submitted_at":"2025-01-06T18:00:14Z","title":"Noise-Robust Target-Speaker Voice Activity Detection Through Self-Supervised Pretraining","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:02.476956Z"},"links":{"citing_paper":"/paper/2501.03184"},"observation_digest":"sha256:10b2e7d71925fbbeb2698774a1fe76c058d7ad17858edcf60e7911ebef281da8","observation_id":"dc9b081e-4a65-40ee-9624-3d2427f665fe","resolution":{"observed_at":"2026-08-10T21:57:02.476956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:57:02.846006Z","title":"Conditional conformer: Improving speaker modulation for single and multi-user speech enhancement,","venue":null,"work_id":"3ea730f7-4b67-452a-b51d-1da46af6757a","year":2023},"citing_paper":{"arxiv_id":"2501.03184","last_updated":"2025-01-06T18:00:14Z","snapshot_observed_at":"2026-08-11T00:05:58.578355Z","submitted_at":"2025-01-06T18:00:14Z","title":"Noise-Robust Target-Speaker Voice Activity Detection Through Self-Supervised Pretraining","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:02.480619Z"},"links":{"citing_paper":"/paper/2501.03184"},"observation_digest":"sha256:3e4d6e4cb6f39c49024ac9d110ade7231abaec75956e162cb78beb3e09853a27","observation_id":"618a3ce4-b723-4b22-80b9-4f777cf353b1","resolution":{"observed_at":"2026-08-10T21:57:02.851599Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.05941","last_updated":"2017-10-27T17:45:21Z","snapshot_observed_at":"2026-08-08T18:23:31.977872Z","submitted_at":"2017-10-16T18:05:45Z","title":"Searching for Activation Functions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.05941","snapshot_observed_at":"2026-08-10T21:57:02.484788Z","title":"Searching for activation functions,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.03184","last_updated":"2025-01-06T18:00:14Z","snapshot_observed_at":"2026-08-11T00:05:58.578355Z","submitted_at":"2025-01-06T18:00:14Z","title":"Noise-Robust Target-Speaker Voice Activity Detection Through Self-Supervised Pretraining","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:02.484788Z"},"links":{"cited_paper":"/paper/1710.05941","citing_paper":"/paper/2501.03184"},"observation_digest":"sha256:7ec87be96527e46f10ebbfe351687b7e8d13ed9d03e65578cc4711ab5a7df43e","observation_id":"bf350042-69c2-402f-9aa1-3dd5cddba11c","resolution":{"observed_at":"2026-08-10T21:57:02.484788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:57:02.829266Z","title":"Using self- supervised learning can improve model robustness and uncertainty,","venue":null,"work_id":"2a1d5f77-cc60-4f14-95c2-5d56213d4012","year":2019},"citing_paper":{"arxiv_id":"2501.03184","last_updated":"2025-01-06T18:00:14Z","snapshot_observed_at":"2026-08-11T00:05:58.578355Z","submitted_at":"2025-01-06T18:00:14Z","title":"Noise-Robust Target-Speaker Voice Activity Detection Through Self-Supervised Pretraining","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:02.490368Z"},"links":{"citing_paper":"/paper/2501.03184"},"observation_digest":"sha256:f0ba3de3d3b5277d56c2b4f0b48c0577e800fab4153d588ade9f49d3a1c3f8ed","observation_id":"c1ef7187-05f6-4974-a845-d5a704bffab0","resolution":{"observed_at":"2026-08-10T21:57:02.835380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18560","last_updated":"2024-03-27T13:42:14Z","snapshot_observed_at":"2026-08-15T05:06:07.755364Z","submitted_at":"2024-03-27T13:42:14Z","title":"Noise-Robust Keyword Spotting through Self-supervised Pretraining","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.18560","snapshot_observed_at":"2026-08-10T21:57:02.495311Z","title":"Noise-robust keyword spotting through self-supervised pretraining,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.03184","last_updated":"2025-01-06T18:00:14Z","snapshot_observed_at":"2026-08-11T00:05:58.578355Z","submitted_at":"2025-01-06T18:00:14Z","title":"Noise-Robust Target-Speaker Voice Activity Detection Through Self-Supervised Pretraining","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:02.495311Z"},"links":{"cited_paper":"/paper/2403.18560","citing_paper":"/paper/2501.03184"},"observation_digest":"sha256:c2d30ac81a809e64e4e9acb65cd1b66fb08df17324d6ebfddb9ec8f7fa18f1a7","observation_id":"f6c5bddc-983f-4a1f-835e-3687bdfc609f","resolution":{"observed_at":"2026-08-10T21:57:02.495311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:57:02.815893Z","title":"Bootstrap predictive coding: Investigating a non-contrastive self-supervised learning approach,","venue":null,"work_id":"c4e7ab3b-be8b-4aaf-92ff-4dfc318c3418","year":2024},"citing_paper":{"arxiv_id":"2501.03184","last_updated":"2025-01-06T18:00:14Z","snapshot_observed_at":"2026-08-11T00:05:58.578355Z","submitted_at":"2025-01-06T18:00:14Z","title":"Noise-Robust Target-Speaker Voice Activity Detection Through Self-Supervised Pretraining","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:02.499682Z"},"links":{"citing_paper":"/paper/2501.03184"},"observation_digest":"sha256:657ae88a3c39060b9c3fccd9ac6c7f8404896da43e902a3af8ae922cd89a3f12","observation_id":"695e7c77-3336-4239-9d9c-3e7126522883","resolution":{"observed_at":"2026-08-10T21:57:02.820023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-08-14T18:53:38.574749Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-10T21:57:02.505721Z","title":"Representation learning with contrastive predictive coding,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.03184","last_updated":"2025-01-06T18:00:14Z","snapshot_observed_at":"2026-08-11T00:05:58.578355Z","submitted_at":"2025-01-06T18:00:14Z","title":"Noise-Robust Target-Speaker Voice Activity Detection Through Self-Supervised Pretraining","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:02.505721Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2501.03184"},"observation_digest":"sha256:b09a9789478e43b5f60da2441dfe4158b859e4fbf4b8012582b3fc442e5a5c6c","observation_id":"f179beba-3bba-4b46-b126-8535aa2eb225","resolution":{"observed_at":"2026-08-10T21:57:02.505721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:57:02.801995Z","title":"Autore- gressive predictive coding: A comprehensive study,","venue":null,"work_id":"0841d469-f0d1-4f3f-8a4d-fa78c07b9b4b","year":2022},"citing_paper":{"arxiv_id":"2501.03184","last_updated":"2025-01-06T18:00:14Z","snapshot_observed_at":"2026-08-11T00:05:58.578355Z","submitted_at":"2025-01-06T18:00:14Z","title":"Noise-Robust Target-Speaker Voice Activity Detection Through Self-Supervised Pretraining","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:02.509729Z"},"links":{"citing_paper":"/paper/2501.03184"},"observation_digest":"sha256:c8489d1a921365e6c513e05932ed0bb7e6ea49cbab4450c641ef26d2cb1aa92a","observation_id":"4d18faa0-88ff-4295-a9ab-1d06143b30c0","resolution":{"observed_at":"2026-08-10T21:57:02.806167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:57:02.785779Z","title":"Generative pre-training for speech with au- toregressive predictive coding,","venue":null,"work_id":"91044b5c-363f-4d92-b4f8-2a47d9b14888","year":2020},"citing_paper":{"arxiv_id":"2501.03184","last_updated":"2025-01-06T18:00:14Z","snapshot_observed_at":"2026-08-11T00:05:58.578355Z","submitted_at":"2025-01-06T18:00:14Z","title":"Noise-Robust Target-Speaker Voice Activity Detection Through Self-Supervised Pretraining","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:02.512913Z"},"links":{"citing_paper":"/paper/2501.03184"},"observation_digest":"sha256:42de613bd2da5c8666c2f4dd386ff57df0f7e95055bb02902c11f6919af53c8c","observation_id":"79ad0697-058e-4d63-acef-9a9d990bf29c","resolution":{"observed_at":"2026-08-10T21:57:02.791522Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:57:02.772489Z","title":"Pytorch: An imperative style, high- performance deep learning library,","venue":null,"work_id":"c85126e9-dc41-4499-aa64-cc19c5ae3fac","year":2019},"citing_paper":{"arxiv_id":"2501.03184","last_updated":"2025-01-06T18:00:14Z","snapshot_observed_at":"2026-08-11T00:05:58.578355Z","submitted_at":"2025-01-06T18:00:14Z","title":"Noise-Robust Target-Speaker Voice Activity Detection Through Self-Supervised Pretraining","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:02.516729Z"},"links":{"citing_paper":"/paper/2501.03184"},"observation_digest":"sha256:8a69d38cbfef340e145d7ae05efc32ab9fbcef1625d391f6ecd1dce100c4ffc1","observation_id":"3404282a-bc80-43ef-8552-79bbb936a3bb","resolution":{"observed_at":"2026-08-10T21:57:02.777412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:57:02.521885Z","title":"Librispeech: An ASR corpus based on public domain audio books,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.03184","last_updated":"2025-01-06T18:00:14Z","snapshot_observed_at":"2026-08-11T00:05:58.578355Z","submitted_at":"2025-01-06T18:00:14Z","title":"Noise-Robust Target-Speaker Voice Activity Detection Through Self-Supervised Pretraining","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:02.521885Z"},"links":{"citing_paper":"/paper/2501.03184"},"observation_digest":"sha256:80359e69e5f4c9bbdfaf6a5606c92a0251e08cf75b4ab389b9746558debf914c","observation_id":"9cd1009d-abfa-4031-8c74-21b40718d71f","resolution":{"observed_at":"2026-08-10T21:57:02.521885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:57:02.747616Z","title":"Montreal Forced Aligner: Trainable text-speech alignment using kaldi,","venue":null,"work_id":"591aa937-ecb2-477d-a4f2-72c031380c54","year":2017},"citing_paper":{"arxiv_id":"2501.03184","last_updated":"2025-01-06T18:00:14Z","snapshot_observed_at":"2026-08-11T00:05:58.578355Z","submitted_at":"2025-01-06T18:00:14Z","title":"Noise-Robust Target-Speaker Voice Activity Detection Through Self-Supervised Pretraining","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:02.528486Z"},"links":{"citing_paper":"/paper/2501.03184"},"observation_digest":"sha256:26ca9abb6624f8c181990aa5fa75fb5ada2a3d977089000b27d684284ab94ea2","observation_id":"a2c503d8-5fc7-4ccc-94af-b8c9b1e1d9f9","resolution":{"observed_at":"2026-08-10T21:57:02.753804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:57:02.534690Z","title":"Speech enhancement using long short-term memory based recurrent neural networks for noise robust speaker verification,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.03184","last_updated":"2025-01-06T18:00:14Z","snapshot_observed_at":"2026-08-11T00:05:58.578355Z","submitted_at":"2025-01-06T18:00:14Z","title":"Noise-Robust Target-Speaker Voice Activity Detection Through Self-Supervised Pretraining","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:02.534690Z"},"links":{"citing_paper":"/paper/2501.03184"},"observation_digest":"sha256:4502d7856a9944694cc597660a05f84c2485bda03103399b8452398183ba2be1","observation_id":"b0038722-4240-46ce-aeea-366096f62462","resolution":{"observed_at":"2026-08-10T21:57:02.534690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:57:02.540473Z","title":"A study on data augmentation of reverberant speech for robust speech recognition,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.03184","last_updated":"2025-01-06T18:00:14Z","snapshot_observed_at":"2026-08-11T00:05:58.578355Z","submitted_at":"2025-01-06T18:00:14Z","title":"Noise-Robust Target-Speaker Voice Activity Detection Through Self-Supervised Pretraining","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:02.540473Z"},"links":{"citing_paper":"/paper/2501.03184"},"observation_digest":"sha256:5071b77b4fb3f462b2f4edacf6b7c1982aa18da72177dd89451d8167b7d71b4e","observation_id":"a877476e-2ed0-400f-ac3c-8164a73e86a5","resolution":{"observed_at":"2026-08-10T21:57:02.540473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:57:02.713699Z","title":"audiomentations,","venue":null,"work_id":"a126bc8a-a935-47ca-9fe4-77c1cbe35ccb","year":2024},"citing_paper":{"arxiv_id":"2501.03184","last_updated":"2025-01-06T18:00:14Z","snapshot_observed_at":"2026-08-11T00:05:58.578355Z","submitted_at":"2025-01-06T18:00:14Z","title":"Noise-Robust Target-Speaker Voice Activity Detection Through Self-Supervised Pretraining","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:02.545669Z"},"links":{"citing_paper":"/paper/2501.03184"},"observation_digest":"sha256:3aba48e5c3be94c05febfaf531ca5c671639c05cb8a92e99061b4011865a18c9","observation_id":"6eab3ae7-99dd-4477-9f57-2f4b8aeda8ea","resolution":{"observed_at":"2026-08-10T21:57:02.718608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:57:02.701806Z","title":"Transformer-xl: Attentive language models beyond a fixed- length context,","venue":null,"work_id":"0b16273f-1756-4028-909b-97fbaf0ea050","year":2019},"citing_paper":{"arxiv_id":"2501.03184","last_updated":"2025-01-06T18:00:14Z","snapshot_observed_at":"2026-08-11T00:05:58.578355Z","submitted_at":"2025-01-06T18:00:14Z","title":"Noise-Robust Target-Speaker Voice Activity Detection Through Self-Supervised Pretraining","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:02.550209Z"},"links":{"citing_paper":"/paper/2501.03184"},"observation_digest":"sha256:4500e3f1a1ee02f304ad13f4d688b2d8abea3776dc349b522e47d14ba3f04efb","observation_id":"3a36b517-3e24-4d07-b0c7-f3adb31b7768","resolution":{"observed_at":"2026-08-10T21:57:02.705433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:57:02.554906Z","title":"V oxceleb: Large- scale speaker verification in the wild,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.03184","last_updated":"2025-01-06T18:00:14Z","snapshot_observed_at":"2026-08-11T00:05:58.578355Z","submitted_at":"2025-01-06T18:00:14Z","title":"Noise-Robust Target-Speaker Voice Activity Detection Through Self-Supervised Pretraining","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:02.554906Z"},"links":{"citing_paper":"/paper/2501.03184"},"observation_digest":"sha256:2e0f049415f0ceda9f3df67217ac1bc4c227b5cce901be15b63cb023b590e9f2","observation_id":"98366df6-51dd-4fe5-b9b1-a9bf787c0af0","resolution":{"observed_at":"2026-08-10T21:57:02.554906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:57:02.560104Z","title":"SGDR: Stochastic gradient descent with warm restarts,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.03184","last_updated":"2025-01-06T18:00:14Z","snapshot_observed_at":"2026-08-11T00:05:58.578355Z","submitted_at":"2025-01-06T18:00:14Z","title":"Noise-Robust Target-Speaker Voice Activity Detection Through Self-Supervised Pretraining","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:02.560104Z"},"links":{"citing_paper":"/paper/2501.03184"},"observation_digest":"sha256:f816eabf90e833ae0828f81b143452284166982a0dad0f755cf569bacb91dc62","observation_id":"97196bad-743d-42b8-8748-deab98cc94f0","resolution":{"observed_at":"2026-08-10T21:57:02.560104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:57:02.670841Z","title":"On batching variable size inputs for training end-to-end speech enhancement systems,","venue":null,"work_id":"c7d5829b-3c9f-4dfc-8545-346b8a2ad1f0","year":2023},"citing_paper":{"arxiv_id":"2501.03184","last_updated":"2025-01-06T18:00:14Z","snapshot_observed_at":"2026-08-11T00:05:58.578355Z","submitted_at":"2025-01-06T18:00:14Z","title":"Noise-Robust Target-Speaker Voice Activity Detection Through Self-Supervised Pretraining","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:02.564382Z"},"links":{"citing_paper":"/paper/2501.03184"},"observation_digest":"sha256:bd160a2f786090d6798a7f12373a4bf68bcd57084df69d193678219fb93c3d6e","observation_id":"1eda67bf-5213-425e-9552-17f1af2fa819","resolution":{"observed_at":"2026-08-10T21:57:02.676959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:57:02.568478Z","title":"Visualizing data using t-sne,","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2501.03184","last_updated":"2025-01-06T18:00:14Z","snapshot_observed_at":"2026-08-11T00:05:58.578355Z","submitted_at":"2025-01-06T18:00:14Z","title":"Noise-Robust Target-Speaker Voice Activity Detection Through Self-Supervised Pretraining","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:02.568478Z"},"links":{"citing_paper":"/paper/2501.03184"},"observation_digest":"sha256:1d52dbd3091e28ab3ebf0c22cd64dc68cabb389532e86b22f1a0c9b9b9262138","observation_id":"51e4370d-cac2-4dbc-b46d-14bd02734cc1","resolution":{"observed_at":"2026-08-10T21:57:02.568478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.03184","last_updated":"2025-01-06T18:00:14Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-11T00:05:58.578355Z","submitted_at":"2025-01-06T18:00:14Z","title":"Noise-Robust Target-Speaker Voice Activity Detection Through Self-Supervised Pretraining"},"reference_resolution":{"displayed":53,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":15,"verified_exact":0,"verified_fuzzy":38},"total_outbound_references":53},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 0 inbound Pith citation observations for arXiv:2501.03184."}