{"as_of":"2026-08-17T19:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:582472fc4e080de7312824cccbe53e6e0922e38819433b25c33307b3f76e941b","coverage":[{"denominator":76,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":76,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T10:11:06.390185Z","state":"measured"},{"denominator":77,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":77,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T02:10:24.379578Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T12:26:56.306727Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.18950","last_updated":"2025-04-29T09:48:21Z","snapshot_observed_at":"2026-08-16T10:03:14.288076Z","submitted_at":"2025-04-26T15:21:14Z","title":"Speaker Retrieval in the Wild: Challenges, Effectiveness and Robustness","version":2},"cited_work":{"arxiv_id":"2504.18950","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.18950","snapshot_observed_at":"2026-07-02T12:26:56.306727Z","title":"Speaker retrieval in the wild: Challenges, effectiveness and robustness,","venue":null,"work_id":"77c702a7-3b56-49b3-b20b-c154b526d0fa","year":2025},"citing_paper":{"arxiv_id":"2606.05931","last_updated":"2026-06-04T09:33:58Z","snapshot_observed_at":"2026-07-06T23:45:51.910263Z","submitted_at":"2026-06-04T09:33:58Z","title":"To Be Multimodal or Not to Be: Query-Adaptive Audio-Visual Person Retrieval via Active Modality Detection","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-28T02:10:24.379578Z"},"links":{"cited_paper":"/paper/2504.18950","citing_paper":"/paper/2606.05931"},"observation_digest":"sha256:75f924d2b3f942f084f7ae76d7b5aeab6567de0a8c8192ded20ba2151edf995b","observation_id":"edf74e14-64f1-4f4a-9f01-1ef146a7cbee","resolution":{"observed_at":"2026-07-02T12:26:56.308174Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2504.18950/citation-record","integrity":"/paper/2504.18950/integrity","json":"/paper/2504.18950/citation-record.json","paper":"/paper/2504.18950"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:11:07.607752Z","title":"Multimedia information retrieval: Theory and techniques,","venue":null,"work_id":"33e7af8c-8335-410d-b83e-f2315b05aec0","year":2014},"citing_paper":{"arxiv_id":"2504.18950","last_updated":"2025-04-29T09:48:21Z","snapshot_observed_at":"2026-08-16T10:03:14.288076Z","submitted_at":"2025-04-26T15:21:14Z","title":"Speaker Retrieval in the Wild: Challenges, Effectiveness and Robustness","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T10:11:06.034594Z"},"links":{"citing_paper":"/paper/2504.18950"},"observation_digest":"sha256:1323af037ea596246e9c60ff734690cf029867954ed642fd7b4066c058cf49ec","observation_id":"2b0f20cc-62e2-4de5-a4c3-bd7ad1e7007e","resolution":{"observed_at":"2026-08-16T10:11:07.613493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:11:07.591178Z","title":"R ¨uger, Multimedia information retrieval , ser","venue":null,"work_id":"684859c1-acd9-49db-a771-349b6c0a1010","year":2010},"citing_paper":{"arxiv_id":"2504.18950","last_updated":"2025-04-29T09:48:21Z","snapshot_observed_at":"2026-08-16T10:03:14.288076Z","submitted_at":"2025-04-26T15:21:14Z","title":"Speaker Retrieval in the Wild: Challenges, Effectiveness and Robustness","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T10:11:06.040400Z"},"links":{"citing_paper":"/paper/2504.18950"},"observation_digest":"sha256:100c7e87356701fdb341d8d194056bd5de6c8409e5231f5b5f52cdc651358bbe","observation_id":"ffc06da9-7c27-48f2-b415-df61397713c4","resolution":{"observed_at":"2026-08-16T10:11:07.596370Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:11:07.574925Z","title":"Scalable identity-oriented speech retrieval,","venue":null,"work_id":"bc3bf28a-c236-4c1c-9b47-2976fd93f33b","year":2023},"citing_paper":{"arxiv_id":"2504.18950","last_updated":"2025-04-29T09:48:21Z","snapshot_observed_at":"2026-08-16T10:03:14.288076Z","submitted_at":"2025-04-26T15:21:14Z","title":"Speaker Retrieval in the Wild: Challenges, Effectiveness and Robustness","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T10:11:06.045455Z"},"links":{"citing_paper":"/paper/2504.18950"},"observation_digest":"sha256:cd0df2736ca62202dfe0906ff325561c88edc87bb825a6ab63dd60d5da7cfa30","observation_id":"81d978d0-3b47-4ce8-b803-fe6797434353","resolution":{"observed_at":"2026-08-16T10:11:07.580685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:11:06.050736Z","title":"Spoken content retrieval—beyond cascading speech recognition with text retrieval,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2504.18950","last_updated":"2025-04-29T09:48:21Z","snapshot_observed_at":"2026-08-16T10:03:14.288076Z","submitted_at":"2025-04-26T15:21:14Z","title":"Speaker Retrieval in the Wild: Challenges, Effectiveness and Robustness","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T10:11:06.050736Z"},"links":{"citing_paper":"/paper/2504.18950"},"observation_digest":"sha256:7ebebbd67d50783f25ccd3e7e5cfa9cff2fb2bb5955f31fcffcb8aace87d863d","observation_id":"12babd05-6757-41cf-9038-e53f4b5cb265","resolution":{"observed_at":"2026-08-16T10:11:06.050736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:11:07.548690Z","title":"Spoken content retrieval: A survey of techniques and technologies,","venue":null,"work_id":"c645cf52-d325-4128-818b-5cdef22b3fcd","year":2012},"citing_paper":{"arxiv_id":"2504.18950","last_updated":"2025-04-29T09:48:21Z","snapshot_observed_at":"2026-08-16T10:03:14.288076Z","submitted_at":"2025-04-26T15:21:14Z","title":"Speaker Retrieval in the Wild: Challenges, Effectiveness and Robustness","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T10:11:06.057017Z"},"links":{"citing_paper":"/paper/2504.18950"},"observation_digest":"sha256:94e6a86434cdf207d7a921a9ce3b6f6d0ce2c28f341fbb444eb00e3b6e9d6fe2","observation_id":"ed3b6560-0029-455e-b27b-71e63895fe1f","resolution":{"observed_at":"2026-08-16T10:11:07.554360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:11:07.532629Z","title":"Tur and R","venue":null,"work_id":"88745ad5-eca1-4c7a-889a-57be15a46da9","year":2011},"citing_paper":{"arxiv_id":"2504.18950","last_updated":"2025-04-29T09:48:21Z","snapshot_observed_at":"2026-08-16T10:03:14.288076Z","submitted_at":"2025-04-26T15:21:14Z","title":"Speaker Retrieval in the Wild: Challenges, Effectiveness and Robustness","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T10:11:06.062110Z"},"links":{"citing_paper":"/paper/2504.18950"},"observation_digest":"sha256:37f991f9a4ddb44bf6b4ddd72d2629ea49aaf7882bfeb5f40f7ff7a7dbac822c","observation_id":"ef0279be-601b-4a2e-bca0-5282ff7ef2f4","resolution":{"observed_at":"2026-08-16T10:11:07.538014Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:11:07.517547Z","title":"A framework for speaker retrieval and identification through unsupervised learning,","venue":null,"work_id":"cf8f6e50-255c-42dc-912e-b874b2fea348","year":2019},"citing_paper":{"arxiv_id":"2504.18950","last_updated":"2025-04-29T09:48:21Z","snapshot_observed_at":"2026-08-16T10:03:14.288076Z","submitted_at":"2025-04-26T15:21:14Z","title":"Speaker Retrieval in the Wild: Challenges, Effectiveness and Robustness","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T10:11:06.067676Z"},"links":{"citing_paper":"/paper/2504.18950"},"observation_digest":"sha256:97c2c9667c91b8dfdacf3a3ccf9ad49d22e63d880cdf396f81573355c3176852","observation_id":"47294bd6-cd26-4a69-a3ce-89e12c9ed5ff","resolution":{"observed_at":"2026-08-16T10:11:07.522386Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:11:07.502333Z","title":"On the usefulness of speaker embeddings for speaker retrieval in the wild: A comparative study of x-vector and ecapa-tdnn models,","venue":null,"work_id":"626932ff-a146-4f34-88de-e04579839bdb","year":2024},"citing_paper":{"arxiv_id":"2504.18950","last_updated":"2025-04-29T09:48:21Z","snapshot_observed_at":"2026-08-16T10:03:14.288076Z","submitted_at":"2025-04-26T15:21:14Z","title":"Speaker Retrieval in the Wild: Challenges, Effectiveness and Robustness","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T10:11:06.072474Z"},"links":{"citing_paper":"/paper/2504.18950"},"observation_digest":"sha256:85089720849ced9cb3db22ae43f5237fb03efb7b58b31b098782964b578a3768","observation_id":"a51139a4-064e-4cdc-86c9-2519584e78ce","resolution":{"observed_at":"2026-08-16T10:11:07.507450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:11:07.486718Z","title":"Zero- shot audio topic reranking using large language models,","venue":null,"work_id":"b756ce5c-1529-4a76-a469-d55b578c40b6","year":2024},"citing_paper":{"arxiv_id":"2504.18950","last_updated":"2025-04-29T09:48:21Z","snapshot_observed_at":"2026-08-16T10:03:14.288076Z","submitted_at":"2025-04-26T15:21:14Z","title":"Speaker Retrieval in the Wild: Challenges, Effectiveness and Robustness","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T10:11:06.077296Z"},"links":{"citing_paper":"/paper/2504.18950"},"observation_digest":"sha256:10943a2b44cb9b66ed311550bf0df0d35e8437c6079e8cef70dc50dbbfbf0ecc","observation_id":"313c3ca3-579a-47b0-9e38-ff09c24b217b","resolution":{"observed_at":"2026-08-16T10:11:07.491569Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:11:07.471324Z","title":"Ai-based seman- tic multimedia indexing and retrieval for social media on smartphones,","venue":null,"work_id":"fecaca7d-0366-475f-abb7-2b6486dfe93e","year":2021},"citing_paper":{"arxiv_id":"2504.18950","last_updated":"2025-04-29T09:48:21Z","snapshot_observed_at":"2026-08-16T10:03:14.288076Z","submitted_at":"2025-04-26T15:21:14Z","title":"Speaker Retrieval in the Wild: Challenges, Effectiveness and Robustness","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T10:11:06.081818Z"},"links":{"citing_paper":"/paper/2504.18950"},"observation_digest":"sha256:1504fbed462e47f9208e6c461aca56f34a7004a9e7adc9a71240862705eed794","observation_id":"9a92736e-8fa2-4566-8709-dc7c93fced81","resolution":{"observed_at":"2026-08-16T10:11:07.476236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:11:07.454932Z","title":"Adversarial attacks against audio surveillance systems,","venue":null,"work_id":"82368d7e-f0c4-4208-8dfc-6dd022329bba","year":2022},"citing_paper":{"arxiv_id":"2504.18950","last_updated":"2025-04-29T09:48:21Z","snapshot_observed_at":"2026-08-16T10:03:14.288076Z","submitted_at":"2025-04-26T15:21:14Z","title":"Speaker Retrieval in the Wild: Challenges, Effectiveness and Robustness","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T10:11:06.086458Z"},"links":{"citing_paper":"/paper/2504.18950"},"observation_digest":"sha256:5946654210b6db36b4c1a976e569192e0788be29bce508081b3e6b8819e79e2c","observation_id":"3cc0a1e1-1cd2-400d-b188-5a569d7c4779","resolution":{"observed_at":"2026-08-16T10:11:07.460442Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:11:07.439450Z","title":"Audio surveillance: A systematic review,","venue":null,"work_id":"fadd453f-1f2b-4f67-b09e-d6ad7fab3bd5","year":2016},"citing_paper":{"arxiv_id":"2504.18950","last_updated":"2025-04-29T09:48:21Z","snapshot_observed_at":"2026-08-16T10:03:14.288076Z","submitted_at":"2025-04-26T15:21:14Z","title":"Speaker Retrieval in the Wild: Challenges, Effectiveness and Robustness","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T10:11:06.091527Z"},"links":{"citing_paper":"/paper/2504.18950"},"observation_digest":"sha256:94ad836fe831c1db65d6fe045ea429f6dde8b465a222fcd4ddf833d955025303","observation_id":"53414272-500e-4ad7-a0b9-182938565991","resolution":{"observed_at":"2026-08-16T10:11:07.444237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:11:07.422959Z","title":"Audio forensics behind the iron curtain: from raw sounds to expert testimony,","venue":null,"work_id":"d3e199a6-89a2-447e-9387-ce9026b09a3a","year":2023},"citing_paper":{"arxiv_id":"2504.18950","last_updated":"2025-04-29T09:48:21Z","snapshot_observed_at":"2026-08-16T10:03:14.288076Z","submitted_at":"2025-04-26T15:21:14Z","title":"Speaker Retrieval in the Wild: Challenges, Effectiveness and Robustness","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T10:11:06.096133Z"},"links":{"citing_paper":"/paper/2504.18950"},"observation_digest":"sha256:6761a33cffcae06f89e3a75da26fc55fb77b8e0645445ce11ece49e12b05d995","observation_id":"812145aa-085c-4416-aa5c-d65722f413a2","resolution":{"observed_at":"2026-08-16T10:11:07.428381Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:11:07.405542Z","title":"Digital forensics approach for handling audio and video files,","venue":null,"work_id":"05bf4d1a-b4a1-4a95-aa22-ee7bf7e4ccbb","year":2023},"citing_paper":{"arxiv_id":"2504.18950","last_updated":"2025-04-29T09:48:21Z","snapshot_observed_at":"2026-08-16T10:03:14.288076Z","submitted_at":"2025-04-26T15:21:14Z","title":"Speaker Retrieval in the Wild: Challenges, Effectiveness and Robustness","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T10:11:06.101010Z"},"links":{"citing_paper":"/paper/2504.18950"},"observation_digest":"sha256:2017f3cf79eadf6fa7318bff1a4751d230092d442b41f8d318c5b792b7a88e7f","observation_id":"0e0ebd5e-465a-41c2-95f1-9cb69f6e0b3d","resolution":{"observed_at":"2026-08-16T10:11:07.410665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:11:07.387758Z","title":"Evaluation of a forensic auto- matic speaker recognition system with emotional speech recordings,","venue":null,"work_id":"c7f6f746-17cb-4606-98ad-6a41e7b815ea","year":2023},"citing_paper":{"arxiv_id":"2504.18950","last_updated":"2025-04-29T09:48:21Z","snapshot_observed_at":"2026-08-16T10:03:14.288076Z","submitted_at":"2025-04-26T15:21:14Z","title":"Speaker Retrieval in the Wild: Challenges, Effectiveness and Robustness","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T10:11:06.105739Z"},"links":{"citing_paper":"/paper/2504.18950"},"observation_digest":"sha256:c4b158ea289a62d618aa849eb5d772a84ba40e5c75af755a66e90460de0d3808","observation_id":"bad37475-193e-4c88-bd4b-a9ca55e1bfa8","resolution":{"observed_at":"2026-08-16T10:11:07.394531Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.12067","last_updated":"2022-05-12T20:09:42Z","snapshot_observed_at":"2026-08-16T17:04:36.634407Z","submitted_at":"2022-04-26T04:17:19Z","title":"An Overview of Recent Work in Media Forensics: Methods and Threats","version":2},"cited_work":{"arxiv_id":"2204.12067","doi":null,"metadata_source":"pith","pith_arxiv_id":"2204.12067","snapshot_observed_at":"2026-08-16T10:11:06.454583Z","title":"An Overview of Recent Work in Media Forensics: Methods and Threats","venue":"cs.CV","work_id":"5d84bb34-5b0c-4fb3-a7ab-44447ee632bd","year":2022},"citing_paper":{"arxiv_id":"2504.18950","last_updated":"2025-04-29T09:48:21Z","snapshot_observed_at":"2026-08-16T10:03:14.288076Z","submitted_at":"2025-04-26T15:21:14Z","title":"Speaker Retrieval in the Wild: Challenges, Effectiveness and Robustness","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T10:11:06.110447Z"},"links":{"cited_paper":"/paper/2204.12067","citing_paper":"/paper/2504.18950"},"observation_digest":"sha256:7c4099641f8934b932b781c24223bdcbd9ca8e1179585b8073ed77e0ba30ae6c","observation_id":"3ee388ec-1812-40cb-8a49-3df7f93e43b0","resolution":{"observed_at":"2026-08-16T10:11:06.460046Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:11:07.371367Z","title":"Artificial intelligence and music: Open questions of copyright law and engineering praxis,","venue":null,"work_id":"8f745cff-08bd-49de-99d5-80155d44b2ee","year":2019},"citing_paper":{"arxiv_id":"2504.18950","last_updated":"2025-04-29T09:48:21Z","snapshot_observed_at":"2026-08-16T10:03:14.288076Z","submitted_at":"2025-04-26T15:21:14Z","title":"Speaker Retrieval in the Wild: Challenges, Effectiveness and Robustness","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T10:11:06.115414Z"},"links":{"citing_paper":"/paper/2504.18950"},"observation_digest":"sha256:478e700442d976a5ed8f0052a3a0325a45cf35cc537801d28b031e680c490ecd","observation_id":"7c6f2acf-ec93-41f4-92c7-0f7742b689b3","resolution":{"observed_at":"2026-08-16T10:11:07.376435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:11:07.355414Z","title":"Ethical dimensions of music information retrieval technology,","venue":null,"work_id":"56074ed2-18d8-4932-9e5d-aee2124716dd","year":2018},"citing_paper":{"arxiv_id":"2504.18950","last_updated":"2025-04-29T09:48:21Z","snapshot_observed_at":"2026-08-16T10:03:14.288076Z","submitted_at":"2025-04-26T15:21:14Z","title":"Speaker Retrieval in the Wild: Challenges, Effectiveness and Robustness","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T10:11:06.121071Z"},"links":{"citing_paper":"/paper/2504.18950"},"observation_digest":"sha256:771cbcefb5673d3b1b9b1489fc6fdf56f392edec0f090cdb47e083f8fff905fa","observation_id":"886acc94-d09c-426e-a127-44aaf2b86090","resolution":{"observed_at":"2026-08-16T10:11:07.360607Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:11:07.339082Z","title":"A review of speaker diarization: Recent advances with deep learning,","venue":null,"work_id":"111a5725-16ac-4a19-9fd2-a46400660ddd","year":2022},"citing_paper":{"arxiv_id":"2504.18950","last_updated":"2025-04-29T09:48:21Z","snapshot_observed_at":"2026-08-16T10:03:14.288076Z","submitted_at":"2025-04-26T15:21:14Z","title":"Speaker Retrieval in the Wild: Challenges, Effectiveness and Robustness","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T10:11:06.125646Z"},"links":{"citing_paper":"/paper/2504.18950"},"observation_digest":"sha256:8954c9ce07977c0be059ca28adb0564cbb33631f561843c5e0886641812133ee","observation_id":"ecbc92a7-f7e1-46b8-9fd1-63c7084524a1","resolution":{"observed_at":"2026-08-16T10:11:07.344248Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:11:06.130405Z","title":"Speaker recognition based on deep learning: An overview,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.18950","last_updated":"2025-04-29T09:48:21Z","snapshot_observed_at":"2026-08-16T10:03:14.288076Z","submitted_at":"2025-04-26T15:21:14Z","title":"Speaker Retrieval in the Wild: Challenges, Effectiveness and Robustness","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T10:11:06.130405Z"},"links":{"citing_paper":"/paper/2504.18950"},"observation_digest":"sha256:7164c6543accae62050f631e854e8da36b065a089ffe1cbc695187caa3a56def","observation_id":"ed130ce7-7145-4175-bbda-f05737093281","resolution":{"observed_at":"2026-08-16T10:11:06.130405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:11:07.312235Z","title":"Automatic speaker verification systems and spoof detection techniques: review and analysis,","venue":null,"work_id":"a1bb4053-5c26-4ba1-bf41-328af9c0a892","year":2022},"citing_paper":{"arxiv_id":"2504.18950","last_updated":"2025-04-29T09:48:21Z","snapshot_observed_at":"2026-08-16T10:03:14.288076Z","submitted_at":"2025-04-26T15:21:14Z","title":"Speaker Retrieval in the Wild: Challenges, Effectiveness and Robustness","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T10:11:06.134995Z"},"links":{"citing_paper":"/paper/2504.18950"},"observation_digest":"sha256:d36fa3f3c920a18a05d738792a975474c034ee748a49b7e4a94d3245476ff389","observation_id":"7f948c56-db26-428c-ad5c-0078009b4f1e","resolution":{"observed_at":"2026-08-16T10:11:07.317831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:11:06.139767Z","title":"Representation learning: A review and new perspectives,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2504.18950","last_updated":"2025-04-29T09:48:21Z","snapshot_observed_at":"2026-08-16T10:03:14.288076Z","submitted_at":"2025-04-26T15:21:14Z","title":"Speaker Retrieval in the Wild: Challenges, Effectiveness and Robustness","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T10:11:06.139767Z"},"links":{"citing_paper":"/paper/2504.18950"},"observation_digest":"sha256:e0636ea80088241d6d9d57fec706a838cd1deeca07b88e32a714f07006857736","observation_id":"5557f953-8710-464b-997f-8db1798f9c72","resolution":{"observed_at":"2026-08-16T10:11:06.139767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:11:06.144345Z","title":"Front- end factor analysis for speaker verification,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2504.18950","last_updated":"2025-04-29T09:48:21Z","snapshot_observed_at":"2026-08-16T10:03:14.288076Z","submitted_at":"2025-04-26T15:21:14Z","title":"Speaker Retrieval in the Wild: Challenges, Effectiveness and Robustness","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T10:11:06.144345Z"},"links":{"citing_paper":"/paper/2504.18950"},"observation_digest":"sha256:47af40d9b23be37d6e16c094409dbf6d28fcafec01714f35d99409cbdb78b6c9","observation_id":"aed38a18-453d-49db-b74e-d455a565e638","resolution":{"observed_at":"2026-08-16T10:11:06.144345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:11:07.273716Z","title":"Deep neural networks for small footprint text-dependent speaker verification,","venue":null,"work_id":"235b7dbb-5ff2-4b93-aee1-7360d461dd68","year":2014},"citing_paper":{"arxiv_id":"2504.18950","last_updated":"2025-04-29T09:48:21Z","snapshot_observed_at":"2026-08-16T10:03:14.288076Z","submitted_at":"2025-04-26T15:21:14Z","title":"Speaker Retrieval in the Wild: Challenges, Effectiveness and Robustness","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T10:11:06.148897Z"},"links":{"citing_paper":"/paper/2504.18950"},"observation_digest":"sha256:e31e8bbaa9c99bb158118822cb3eb62778166ee08dfada0b7f93548c1ea21ce3","observation_id":"281c1e62-71a1-41b0-b872-4b9e10e3fd79","resolution":{"observed_at":"2026-08-16T10:11:07.279075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:11:06.153342Z","title":"Generalized end-to-end loss for speaker verification,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.18950","last_updated":"2025-04-29T09:48:21Z","snapshot_observed_at":"2026-08-16T10:03:14.288076Z","submitted_at":"2025-04-26T15:21:14Z","title":"Speaker Retrieval in the Wild: Challenges, Effectiveness and Robustness","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T10:11:06.153342Z"},"links":{"citing_paper":"/paper/2504.18950"},"observation_digest":"sha256:5d09d7af7a0c7bce9f8bbcad778a12702b54500da5f3f34e10c7b2c13235b3a1","observation_id":"0dec4069-4d66-434e-a330-5d889d5c78b8","resolution":{"observed_at":"2026-08-16T10:11:06.153342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:11:07.245405Z","title":"X- vectors: Robust dnn embeddings for speaker recognition,","venue":null,"work_id":"b1cd2762-e09f-409d-b49e-0264360fba74","year":2018},"citing_paper":{"arxiv_id":"2504.18950","last_updated":"2025-04-29T09:48:21Z","snapshot_observed_at":"2026-08-16T10:03:14.288076Z","submitted_at":"2025-04-26T15:21:14Z","title":"Speaker Retrieval in the Wild: Challenges, Effectiveness and Robustness","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T10:11:06.157843Z"},"links":{"citing_paper":"/paper/2504.18950"},"observation_digest":"sha256:3ad9c865393663919d550c74bcd6ebdd6fcf5ad40d532310472dd53eb1193e84","observation_id":"f1c8c40f-15da-4654-9d01-1f0d64ef136c","resolution":{"observed_at":"2026-08-16T10:11:07.251133Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:11:07.226800Z","title":"Speaker embedding extraction with phonetic information,","venue":null,"work_id":"9409104c-bf8e-46e1-b039-6899611c0b62","year":2018},"citing_paper":{"arxiv_id":"2504.18950","last_updated":"2025-04-29T09:48:21Z","snapshot_observed_at":"2026-08-16T10:03:14.288076Z","submitted_at":"2025-04-26T15:21:14Z","title":"Speaker Retrieval in the Wild: Challenges, Effectiveness and Robustness","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T10:11:06.162243Z"},"links":{"citing_paper":"/paper/2504.18950"},"observation_digest":"sha256:2001416e5fbad516c339231b4e2bdc58a1dbeb11a1d69b4e072ae94f7055dd95","observation_id":"0f26fb8a-3755-436b-b8fa-d467c75ebfd7","resolution":{"observed_at":"2026-08-16T10:11:07.232824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15627","last_updated":"2023-11-27T08:45:35Z","snapshot_observed_at":"2026-08-16T14:40:09.900676Z","submitted_at":"2023-11-27T08:45:35Z","title":"Phonetic-aware speaker embedding for far-field speaker verification","version":1},"cited_work":{"arxiv_id":"2311.15627","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.15627","snapshot_observed_at":"2026-08-16T10:11:06.429283Z","title":"Phonetic-aware speaker embedding for far-field speaker verification","venue":"cs.SD","work_id":"56b34d15-2443-44b1-8bea-582541b4ad4b","year":2023},"citing_paper":{"arxiv_id":"2504.18950","last_updated":"2025-04-29T09:48:21Z","snapshot_observed_at":"2026-08-16T10:03:14.288076Z","submitted_at":"2025-04-26T15:21:14Z","title":"Speaker Retrieval in the Wild: Challenges, Effectiveness and Robustness","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T10:11:06.167692Z"},"links":{"cited_paper":"/paper/2311.15627","citing_paper":"/paper/2504.18950"},"observation_digest":"sha256:8d72ea0c0e364037d38e601b959456e2aaa09ac4343e07dd69fe44d5e6c15e65","observation_id":"f8548523-25ff-4294-b1a0-e58ce014995d","resolution":{"observed_at":"2026-08-16T10:11:06.436717Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:11:07.209391Z","title":"ECAPA-TDNN: Emphasized Channel Attention, Propagation and Aggregation in TDNN Based Speaker Verification,","venue":null,"work_id":"c4d33990-fe43-413c-83b4-ec672adf0781","year":2020},"citing_paper":{"arxiv_id":"2504.18950","last_updated":"2025-04-29T09:48:21Z","snapshot_observed_at":"2026-08-16T10:03:14.288076Z","submitted_at":"2025-04-26T15:21:14Z","title":"Speaker Retrieval in the Wild: Challenges, Effectiveness and Robustness","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T10:11:06.173435Z"},"links":{"citing_paper":"/paper/2504.18950"},"observation_digest":"sha256:9d8f7332dd2ffc92c1c8181375621bd26de406d0212f8d4c15e75cea59ba9696","observation_id":"0f5fdd3f-4322-4938-96d5-ae919dfab21f","resolution":{"observed_at":"2026-08-16T10:11:07.215029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:11:07.191947Z","title":"TitaNet: Neural model for speaker representation with 1d depth-wise separable convolutions and global context,","venue":null,"work_id":"9a40f420-c3e3-43f3-b4a7-fe48860fe768","year":2021},"citing_paper":{"arxiv_id":"2504.18950","last_updated":"2025-04-29T09:48:21Z","snapshot_observed_at":"2026-08-16T10:03:14.288076Z","submitted_at":"2025-04-26T15:21:14Z","title":"Speaker Retrieval in the Wild: Challenges, Effectiveness and Robustness","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T10:11:06.179093Z"},"links":{"citing_paper":"/paper/2504.18950"},"observation_digest":"sha256:75884452055cead5b56432777ccf2b5fd31f593f3b180a0aac95f5c97ab888f6","observation_id":"9bda7fda-14db-4c8a-91e2-473eebb743a4","resolution":{"observed_at":"2026-08-16T10:11:07.197360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:11:07.176104Z","title":"(2024) BBC Rewind","venue":null,"work_id":"4e6dd24a-23e2-425d-bc48-0289a8bf8e2e","year":2024},"citing_paper":{"arxiv_id":"2504.18950","last_updated":"2025-04-29T09:48:21Z","snapshot_observed_at":"2026-08-16T10:03:14.288076Z","submitted_at":"2025-04-26T15:21:14Z","title":"Speaker Retrieval in the Wild: Challenges, Effectiveness and Robustness","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T10:11:06.183788Z"},"links":{"citing_paper":"/paper/2504.18950"},"observation_digest":"sha256:a9a053be7b64f0d6f2cc1018778889e66e6b5303a26bff12dfa62bccc2dd5e22","observation_id":"82eb8b42-98cd-4eb2-83fa-bf82c2192664","resolution":{"observed_at":"2026-08-16T10:11:07.180790Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:11:07.156872Z","title":"The speakers in the wild (SITW) speaker recognition database,","venue":null,"work_id":"afb5190b-9c2a-457f-97f8-0239aab98d02","year":2016},"citing_paper":{"arxiv_id":"2504.18950","last_updated":"2025-04-29T09:48:21Z","snapshot_observed_at":"2026-08-16T10:03:14.288076Z","submitted_at":"2025-04-26T15:21:14Z","title":"Speaker Retrieval in the Wild: Challenges, Effectiveness and Robustness","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T10:11:06.188304Z"},"links":{"citing_paper":"/paper/2504.18950"},"observation_digest":"sha256:049abb6fe3af37ac898d4015c0d6c544ecc230a87dd1007d9455df5075075fe8","observation_id":"ea7b380c-6bb0-4eef-b61d-5972c4ec647f","resolution":{"observed_at":"2026-08-16T10:11:07.163665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:11:07.139591Z","title":"V oxCeleb: A Large-Scale Speaker Identification Dataset,","venue":null,"work_id":"033be6e7-7dfa-4c64-8cc6-443873d73e6f","year":2017},"citing_paper":{"arxiv_id":"2504.18950","last_updated":"2025-04-29T09:48:21Z","snapshot_observed_at":"2026-08-16T10:03:14.288076Z","submitted_at":"2025-04-26T15:21:14Z","title":"Speaker Retrieval in the Wild: Challenges, Effectiveness and Robustness","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T10:11:06.192960Z"},"links":{"citing_paper":"/paper/2504.18950"},"observation_digest":"sha256:af3fba7a36665ed409e897bfc311b6054486d8d0610bf87bd51c0e93320aa47c","observation_id":"5472843b-22fd-4cdf-ac53-cf085df77996","resolution":{"observed_at":"2026-08-16T10:11:07.144791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:11:07.123289Z","title":"V oxCeleb: Large- scale speaker verification in the wild,","venue":null,"work_id":"b4a9205a-643f-4974-8cf4-0a90e5d61793","year":2020},"citing_paper":{"arxiv_id":"2504.18950","last_updated":"2025-04-29T09:48:21Z","snapshot_observed_at":"2026-08-16T10:03:14.288076Z","submitted_at":"2025-04-26T15:21:14Z","title":"Speaker Retrieval in the Wild: Challenges, Effectiveness and Robustness","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T10:11:06.197250Z"},"links":{"citing_paper":"/paper/2504.18950"},"observation_digest":"sha256:78a74a68534dc0ed102495d49dc4ce646dd75eac636063a8e866bda2997d8cf4","observation_id":"cafb4f79-3631-40b7-ad0d-c0bec5dc5922","resolution":{"observed_at":"2026-08-16T10:11:07.128579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:11:07.107648Z","title":"Finding difficult speakers in automatic speaker recognition,","venue":null,"work_id":"d4cbacd8-6356-4ca2-87d4-fb8ce7ce0663","year":2011},"citing_paper":{"arxiv_id":"2504.18950","last_updated":"2025-04-29T09:48:21Z","snapshot_observed_at":"2026-08-16T10:03:14.288076Z","submitted_at":"2025-04-26T15:21:14Z","title":"Speaker Retrieval in the Wild: Challenges, Effectiveness and Robustness","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T10:11:06.201505Z"},"links":{"citing_paper":"/paper/2504.18950"},"observation_digest":"sha256:265a26a4b6c0cc9332ee2bb314ac0b492e5da95a736605d51ee4c67d9ea08061","observation_id":"07ded18c-1a98-4155-9e5c-8c140c759bfb","resolution":{"observed_at":"2026-08-16T10:11:07.112577Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:11:07.091845Z","title":"pyannote.audio: neural building blocks for speaker diarization,","venue":null,"work_id":"a6f1c9d1-6146-43b4-9981-750fa354df16","year":2020},"citing_paper":{"arxiv_id":"2504.18950","last_updated":"2025-04-29T09:48:21Z","snapshot_observed_at":"2026-08-16T10:03:14.288076Z","submitted_at":"2025-04-26T15:21:14Z","title":"Speaker Retrieval in the Wild: Challenges, Effectiveness and Robustness","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T10:11:06.205878Z"},"links":{"citing_paper":"/paper/2504.18950"},"observation_digest":"sha256:c71f4e2416cec001b3434b0d1700a36a7d650d52c9034ee679a6dc36256355cc","observation_id":"ac0dda5f-da71-494a-a4ed-a6625feae311","resolution":{"observed_at":"2026-08-16T10:11:07.096732Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:11:07.075637Z","title":"End-to-end speaker segmentation for overlap-aware resegmentation,","venue":null,"work_id":"cbadbe34-269a-4681-b3d0-960a309984f0","year":2021},"citing_paper":{"arxiv_id":"2504.18950","last_updated":"2025-04-29T09:48:21Z","snapshot_observed_at":"2026-08-16T10:03:14.288076Z","submitted_at":"2025-04-26T15:21:14Z","title":"Speaker Retrieval in the Wild: Challenges, Effectiveness and Robustness","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T10:11:06.210307Z"},"links":{"citing_paper":"/paper/2504.18950"},"observation_digest":"sha256:26519a1c0caff821429393d98b305badce6516e0fc025fe0e0a87e838eeffa54","observation_id":"41500e34-a370-4812-a935-9de53fa4efdf","resolution":{"observed_at":"2026-08-16T10:11:07.080667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:11:06.214969Z","title":"Bidirectional recurrent neural networks,","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2504.18950","last_updated":"2025-04-29T09:48:21Z","snapshot_observed_at":"2026-08-16T10:03:14.288076Z","submitted_at":"2025-04-26T15:21:14Z","title":"Speaker Retrieval in the Wild: Challenges, Effectiveness and Robustness","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T10:11:06.214969Z"},"links":{"citing_paper":"/paper/2504.18950"},"observation_digest":"sha256:5df8e58f63ba981905d3e527541f3e708cec74e981e76a7dad51161f9a1ca5e8","observation_id":"8b920b31-f772-47df-b499-d65d7ad6526f","resolution":{"observed_at":"2026-08-16T10:11:06.214969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:11:07.048917Z","title":"Bidirectional LSTM networks for improved phoneme classification and recognition,","venue":null,"work_id":"b02e4ac5-e937-431f-aac7-a238bdfc7d8d","year":2005},"citing_paper":{"arxiv_id":"2504.18950","last_updated":"2025-04-29T09:48:21Z","snapshot_observed_at":"2026-08-16T10:03:14.288076Z","submitted_at":"2025-04-26T15:21:14Z","title":"Speaker Retrieval in the Wild: Challenges, Effectiveness and Robustness","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T10:11:06.219357Z"},"links":{"citing_paper":"/paper/2504.18950"},"observation_digest":"sha256:b9bfacc4d0a9dd21a4b01bcc5d36b7709931821ce000c1f8393927aaea9d1879","observation_id":"00375759-04d3-4bc5-b1c7-749898929c1b","resolution":{"observed_at":"2026-08-16T10:11:07.053910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:11:07.032850Z","title":"Phoneme recognition using time-delay neural networks,","venue":null,"work_id":"df16f124-a51d-4646-989a-5833f554c581","year":1989},"citing_paper":{"arxiv_id":"2504.18950","last_updated":"2025-04-29T09:48:21Z","snapshot_observed_at":"2026-08-16T10:03:14.288076Z","submitted_at":"2025-04-26T15:21:14Z","title":"Speaker Retrieval in the Wild: Challenges, Effectiveness and Robustness","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T10:11:06.223845Z"},"links":{"citing_paper":"/paper/2504.18950"},"observation_digest":"sha256:d5c773a597fd4c48e683c4a68cbe6cb0fc6ae7aee0e0bbebc58cc172715bdfd4","observation_id":"fcb4ad5d-437b-42b6-b157-5c968beabaa3","resolution":{"observed_at":"2026-08-16T10:11:07.038017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:11:07.016341Z","title":"Attentive statistics pooling for deep speaker embedding,","venue":null,"work_id":"2996b5ab-f093-4114-90a3-22c1521b962f","year":2018},"citing_paper":{"arxiv_id":"2504.18950","last_updated":"2025-04-29T09:48:21Z","snapshot_observed_at":"2026-08-16T10:03:14.288076Z","submitted_at":"2025-04-26T15:21:14Z","title":"Speaker Retrieval in the Wild: Challenges, Effectiveness and Robustness","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T10:11:06.228203Z"},"links":{"citing_paper":"/paper/2504.18950"},"observation_digest":"sha256:a2e5d8d21ea460734e66b00662791a51981a3a03d2576fe6485cfacf3c2ef307","observation_id":"63a57588-cb37-4f08-bf12-a61de579cf1b","resolution":{"observed_at":"2026-08-16T10:11:07.021481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:11:06.232820Z","title":"Arcface: Additive angular margin loss for deep face recognition,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.18950","last_updated":"2025-04-29T09:48:21Z","snapshot_observed_at":"2026-08-16T10:03:14.288076Z","submitted_at":"2025-04-26T15:21:14Z","title":"Speaker Retrieval in the Wild: Challenges, Effectiveness and Robustness","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T10:11:06.232820Z"},"links":{"citing_paper":"/paper/2504.18950"},"observation_digest":"sha256:64eb3542468f763c8d42b93089b54351558bf33274722d9b437d339796f7dda8","observation_id":"1f864419-99f5-4e5d-a430-c2b5a2afec12","resolution":{"observed_at":"2026-08-16T10:11:06.232820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:11:06.986548Z","title":"Margin mat- ters: Towards more discriminative deep neural network embeddings for speaker recognition,","venue":null,"work_id":"9f056e9d-614b-4dd0-b8b7-a2f722e62d2d","year":2019},"citing_paper":{"arxiv_id":"2504.18950","last_updated":"2025-04-29T09:48:21Z","snapshot_observed_at":"2026-08-16T10:03:14.288076Z","submitted_at":"2025-04-26T15:21:14Z","title":"Speaker Retrieval in the Wild: Challenges, Effectiveness and Robustness","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T10:11:06.237688Z"},"links":{"citing_paper":"/paper/2504.18950"},"observation_digest":"sha256:f89c07531500eeed86fc01fbbcbb8890a329492951012d826bed8d6202c52800","observation_id":"fd98a846-93a4-477d-b6a5-4893b3c17e07","resolution":{"observed_at":"2026-08-16T10:11:06.992459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:11:06.968212Z","title":"Res2net: A new multi-scale backbone architecture,","venue":null,"work_id":"5d59ac0c-2a98-4e08-8f4f-720dac03e877","year":2021},"citing_paper":{"arxiv_id":"2504.18950","last_updated":"2025-04-29T09:48:21Z","snapshot_observed_at":"2026-08-16T10:03:14.288076Z","submitted_at":"2025-04-26T15:21:14Z","title":"Speaker Retrieval in the Wild: Challenges, Effectiveness and Robustness","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-16T10:11:06.242377Z"},"links":{"citing_paper":"/paper/2504.18950"},"observation_digest":"sha256:4d8276bd64516d71706941aaeb15dea485d7ad5351790ffffda4f5c34e9361b1","observation_id":"628af6e8-917f-414f-b32a-279262b759b6","resolution":{"observed_at":"2026-08-16T10:11:06.974102Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:11:06.246993Z","title":"Squeeze-and-excitation networks,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.18950","last_updated":"2025-04-29T09:48:21Z","snapshot_observed_at":"2026-08-16T10:03:14.288076Z","submitted_at":"2025-04-26T15:21:14Z","title":"Speaker Retrieval in the Wild: Challenges, Effectiveness and Robustness","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-16T10:11:06.246993Z"},"links":{"citing_paper":"/paper/2504.18950"},"observation_digest":"sha256:703d29ae1aa0b63afd6a2b50a2cdfa8b00f929d8ed6159f8cd64a493bee922de","observation_id":"636ebf43-c29a-49cf-b839-449d3ba09f81","resolution":{"observed_at":"2026-08-16T10:11:06.246993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:11:06.940226Z","title":"ContextNet: Improving Convolutional Neural Networks for Automatic Speech Recognition with Global Context,","venue":null,"work_id":"c6282793-4e85-4a2b-998c-c5acf1529625","year":2020},"citing_paper":{"arxiv_id":"2504.18950","last_updated":"2025-04-29T09:48:21Z","snapshot_observed_at":"2026-08-16T10:03:14.288076Z","submitted_at":"2025-04-26T15:21:14Z","title":"Speaker Retrieval in the Wild: Challenges, Effectiveness and Robustness","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-16T10:11:06.251376Z"},"links":{"citing_paper":"/paper/2504.18950"},"observation_digest":"sha256:779123f3a3951ed78481296c6946a47e4355250ea6d21cdb7ba75ff8120709ec","observation_id":"b8229484-fd3a-4f5d-9c34-2e304f1c0f89","resolution":{"observed_at":"2026-08-16T10:11:06.945668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:11:06.923969Z","title":"Quartznet: Deep automatic speech recognition with 1d time-channel separable convolutions,","venue":null,"work_id":"c45d7c81-2358-4e89-ba83-2f0895d2a885","year":2020},"citing_paper":{"arxiv_id":"2504.18950","last_updated":"2025-04-29T09:48:21Z","snapshot_observed_at":"2026-08-16T10:03:14.288076Z","submitted_at":"2025-04-26T15:21:14Z","title":"Speaker Retrieval in the Wild: Challenges, Effectiveness and Robustness","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-16T10:11:06.256371Z"},"links":{"citing_paper":"/paper/2504.18950"},"observation_digest":"sha256:84f655379c36eb05c20d4712133a197591e71c4ecfbc8ca3d922fde23b8e29e9","observation_id":"3c9566f8-e5e4-4e20-8159-c250e36d8a17","resolution":{"observed_at":"2026-08-16T10:11:06.928989Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:11:06.906380Z","title":"Multimodal Video Search by Examples (MVSE),","venue":null,"work_id":"0b9dc9c5-d30f-4bc8-82a0-3fb0af3713a6","year":null},"citing_paper":{"arxiv_id":"2504.18950","last_updated":"2025-04-29T09:48:21Z","snapshot_observed_at":"2026-08-16T10:03:14.288076Z","submitted_at":"2025-04-26T15:21:14Z","title":"Speaker Retrieval in the Wild: Challenges, Effectiveness and Robustness","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-16T10:11:06.260823Z"},"links":{"citing_paper":"/paper/2504.18950"},"observation_digest":"sha256:459850135e8a0ca44390c88e289e84b72617a88e3306854e2d5248f451597922","observation_id":"b813b725-200b-4bb2-af85-5177b3e1d80f","resolution":{"observed_at":"2026-08-16T10:11:06.911664Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:11:06.889039Z","title":"Multi-modal video search by examples—a video quality impact analysis,","venue":null,"work_id":"5c8d253a-a9c8-4f9e-886e-fbcd6e7ba294","year":2024},"citing_paper":{"arxiv_id":"2504.18950","last_updated":"2025-04-29T09:48:21Z","snapshot_observed_at":"2026-08-16T10:03:14.288076Z","submitted_at":"2025-04-26T15:21:14Z","title":"Speaker Retrieval in the Wild: Challenges, Effectiveness and Robustness","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-16T10:11:06.265391Z"},"links":{"citing_paper":"/paper/2504.18950"},"observation_digest":"sha256:6988a3a573cc2d682ec468b0d6ac9162898074f63160fd9dd45862a6e1d52e43","observation_id":"18fa26e3-011a-4d07-8acd-b21058ef974e","resolution":{"observed_at":"2026-08-16T10:11:06.895075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:11:06.872669Z","title":"Robust signal-to-noise ratio estimation based on waveform amplitude distribution analysis,","venue":null,"work_id":"25409aed-b4ec-46a8-b2e4-b29d65ad90fc","year":2008},"citing_paper":{"arxiv_id":"2504.18950","last_updated":"2025-04-29T09:48:21Z","snapshot_observed_at":"2026-08-16T10:03:14.288076Z","submitted_at":"2025-04-26T15:21:14Z","title":"Speaker Retrieval in the Wild: Challenges, Effectiveness and Robustness","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-16T10:11:06.269900Z"},"links":{"citing_paper":"/paper/2504.18950"},"observation_digest":"sha256:c60172a760eb4f8c711ef6ad08772e1cbf07a2224a446515bde170650c448cc6","observation_id":"94608150-1f7a-41e8-8d2d-6cafa3d29322","resolution":{"observed_at":"2026-08-16T10:11:06.877651Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:11:06.856071Z","title":"spaCy: Industrial-strength natural language processing in Python,","venue":null,"work_id":"b3fbd6b2-b74e-4536-bca0-92ad11165bd2","year":2015},"citing_paper":{"arxiv_id":"2504.18950","last_updated":"2025-04-29T09:48:21Z","snapshot_observed_at":"2026-08-16T10:03:14.288076Z","submitted_at":"2025-04-26T15:21:14Z","title":"Speaker Retrieval in the Wild: Challenges, Effectiveness and Robustness","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-16T10:11:06.274853Z"},"links":{"citing_paper":"/paper/2504.18950"},"observation_digest":"sha256:5a6830104303c41701049453ea800d82ecc4058478b660fc936deef6bf677771","observation_id":"c43b05ed-68a7-4a6f-aca1-5490b01a2928","resolution":{"observed_at":"2026-08-16T10:11:06.861116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:11:06.839964Z","title":"Beautiful soup: HTML and XML parsing for python,","venue":null,"work_id":"1490d0e4-844a-4849-99f7-7352940be586","year":2004},"citing_paper":{"arxiv_id":"2504.18950","last_updated":"2025-04-29T09:48:21Z","snapshot_observed_at":"2026-08-16T10:03:14.288076Z","submitted_at":"2025-04-26T15:21:14Z","title":"Speaker Retrieval in the Wild: Challenges, Effectiveness and Robustness","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-16T10:11:06.279526Z"},"links":{"citing_paper":"/paper/2504.18950"},"observation_digest":"sha256:5c0384514a3535ee506d171ba7ca2e530de94ebf63097932dcd7ce104b8540c6","observation_id":"f79bd013-135b-492f-aeee-b1674451fd7a","resolution":{"observed_at":"2026-08-16T10:11:06.844956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:11:06.824283Z","title":null,"venue":null,"work_id":"99eb73ba-b2d3-41d6-b668-e822af9fa1ef","year":2001},"citing_paper":{"arxiv_id":"2504.18950","last_updated":"2025-04-29T09:48:21Z","snapshot_observed_at":"2026-08-16T10:03:14.288076Z","submitted_at":"2025-04-26T15:21:14Z","title":"Speaker Retrieval in the Wild: Challenges, Effectiveness and Robustness","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-16T10:11:06.284041Z"},"links":{"citing_paper":"/paper/2504.18950"},"observation_digest":"sha256:3ae7f556f794f69bee67bae1675e7318a3972f442b71b2fd20de8057fc0fa4d7","observation_id":"1638308f-69bd-4d9b-a496-7a8c6c5e10fa","resolution":{"observed_at":"2026-08-16T10:11:06.828762Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:11:06.808572Z","title":"SpeechBrain’s x-vector implementation for speaker embedding extraction,","venue":null,"work_id":"eaa840c7-99ad-48ea-9a3a-ddec7f067b1c","year":2021},"citing_paper":{"arxiv_id":"2504.18950","last_updated":"2025-04-29T09:48:21Z","snapshot_observed_at":"2026-08-16T10:03:14.288076Z","submitted_at":"2025-04-26T15:21:14Z","title":"Speaker Retrieval in the Wild: Challenges, Effectiveness and Robustness","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-16T10:11:06.288660Z"},"links":{"citing_paper":"/paper/2504.18950"},"observation_digest":"sha256:587a136bacabd3bcca663c02caa9ecf06e14ef9a48f283e230ec9162c335acdb","observation_id":"857d6ce1-6317-4271-8e89-c893bb7a60b9","resolution":{"observed_at":"2026-08-16T10:11:06.813465Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:11:06.791863Z","title":"SpeechBrain’s ECAPA-TDNN implementation for speaker embedding extraction,","venue":null,"work_id":"a3b0129f-7204-41c2-a09d-0bacfdb6ebd0","year":2021},"citing_paper":{"arxiv_id":"2504.18950","last_updated":"2025-04-29T09:48:21Z","snapshot_observed_at":"2026-08-16T10:03:14.288076Z","submitted_at":"2025-04-26T15:21:14Z","title":"Speaker Retrieval in the Wild: Challenges, Effectiveness and Robustness","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-16T10:11:06.293069Z"},"links":{"citing_paper":"/paper/2504.18950"},"observation_digest":"sha256:62e3cdff74ad15d5a2d8d0631a73837d972825c9c992336dd62c8e1eb213d5cf","observation_id":"7e6e2483-4eb3-44ca-af72-b3abc6bb4e37","resolution":{"observed_at":"2026-08-16T10:11:06.796827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:11:06.776809Z","title":"ECAPA-TDNN model for speaker verification and diarization tasks,","venue":null,"work_id":"9eaeeccc-80c6-4b2d-8e00-f3e7c621ea14","year":2023},"citing_paper":{"arxiv_id":"2504.18950","last_updated":"2025-04-29T09:48:21Z","snapshot_observed_at":"2026-08-16T10:03:14.288076Z","submitted_at":"2025-04-26T15:21:14Z","title":"Speaker Retrieval in the Wild: Challenges, Effectiveness and Robustness","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-16T10:11:06.297421Z"},"links":{"citing_paper":"/paper/2504.18950"},"observation_digest":"sha256:746b45c36d81ac6a8e751951b70217df98e73cd58a9a49a95fb9b3cb520443a6","observation_id":"42bf088a-0f27-474a-9d4b-cb1a0d179c8f","resolution":{"observed_at":"2026-08-16T10:11:06.781501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:11:06.759133Z","title":"TitaNet model for speaker verification and diarization tasks,","venue":null,"work_id":"e60554e4-8fc4-4384-b753-5b8e1c0e3856","year":2023},"citing_paper":{"arxiv_id":"2504.18950","last_updated":"2025-04-29T09:48:21Z","snapshot_observed_at":"2026-08-16T10:03:14.288076Z","submitted_at":"2025-04-26T15:21:14Z","title":"Speaker Retrieval in the Wild: Challenges, Effectiveness and Robustness","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-16T10:11:06.301945Z"},"links":{"citing_paper":"/paper/2504.18950"},"observation_digest":"sha256:8fb0a2abda3b8f8cc7312e1790818647985d3149bb1bcecabe7ec11963a18a53","observation_id":"d68d5d2b-d3e9-40b3-a298-363809b2bf11","resolution":{"observed_at":"2026-08-16T10:11:06.765138Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:11:06.742110Z","title":"V oxCeleb2: Deep speaker recognition,","venue":null,"work_id":"23c29be7-c3c5-4ea8-b246-b8cf43ae1a42","year":2018},"citing_paper":{"arxiv_id":"2504.18950","last_updated":"2025-04-29T09:48:21Z","snapshot_observed_at":"2026-08-16T10:03:14.288076Z","submitted_at":"2025-04-26T15:21:14Z","title":"Speaker Retrieval in the Wild: Challenges, Effectiveness and Robustness","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-16T10:11:06.306949Z"},"links":{"citing_paper":"/paper/2504.18950"},"observation_digest":"sha256:5c9c1ca86bfb257a9343739d9f37e9dabf2da7c950590e3de754633e6497ce29","observation_id":"65dba286-33aa-438f-b61a-211050e7ce9f","resolution":{"observed_at":"2026-08-16T10:11:06.747105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:11:06.726586Z","title":"Librispeech: An asr corpus based on public domain audio books,","venue":null,"work_id":"5dee68f9-01fa-4d84-9e2f-8434c049bfd5","year":2015},"citing_paper":{"arxiv_id":"2504.18950","last_updated":"2025-04-29T09:48:21Z","snapshot_observed_at":"2026-08-16T10:03:14.288076Z","submitted_at":"2025-04-26T15:21:14Z","title":"Speaker Retrieval in the Wild: Challenges, Effectiveness and Robustness","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-16T10:11:06.311715Z"},"links":{"citing_paper":"/paper/2504.18950"},"observation_digest":"sha256:c1dcea95b022c978e6147e4a4bb631a9ff348b4e02f88de973e56e46ebca58a5","observation_id":"99e6bc85-25da-41a8-a754-917002d37e19","resolution":{"observed_at":"2026-08-16T10:11:06.731285Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:11:06.711101Z","title":"Switchboard: telephone speech corpus for research and development,","venue":null,"work_id":"b404d610-70dc-420f-a221-a369d894015f","year":1992},"citing_paper":{"arxiv_id":"2504.18950","last_updated":"2025-04-29T09:48:21Z","snapshot_observed_at":"2026-08-16T10:03:14.288076Z","submitted_at":"2025-04-26T15:21:14Z","title":"Speaker Retrieval in the Wild: Challenges, Effectiveness and Robustness","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-16T10:11:06.316167Z"},"links":{"citing_paper":"/paper/2504.18950"},"observation_digest":"sha256:6156776c6692b9bba071b112bc93ca1caafc8ea75f23534aae05d8994b03578c","observation_id":"8afb3030-0755-4155-8370-34b74d7cec6f","resolution":{"observed_at":"2026-08-16T10:11:06.716160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:11:06.695645Z","title":"Fisher english training speech parts 1 and 2 transcripts,","venue":null,"work_id":"6245d80b-a2b6-44de-994f-fdbb5a1791c5","year":2004},"citing_paper":{"arxiv_id":"2504.18950","last_updated":"2025-04-29T09:48:21Z","snapshot_observed_at":"2026-08-16T10:03:14.288076Z","submitted_at":"2025-04-26T15:21:14Z","title":"Speaker Retrieval in the Wild: Challenges, Effectiveness and Robustness","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-16T10:11:06.320522Z"},"links":{"citing_paper":"/paper/2504.18950"},"observation_digest":"sha256:e7904e6baad3c754a29fe402867e9766622653e36d2b2eb4a6b3e28497c059e3","observation_id":"27e43598-7161-4583-9e64-ee9124c9cf96","resolution":{"observed_at":"2026-08-16T10:11:06.700714Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:11:06.679248Z","title":"The NIST speaker recognition eval- uations: 1996-2001,","venue":null,"work_id":"083dd3db-3b73-402a-a1c5-fa48daf3d476","year":1996},"citing_paper":{"arxiv_id":"2504.18950","last_updated":"2025-04-29T09:48:21Z","snapshot_observed_at":"2026-08-16T10:03:14.288076Z","submitted_at":"2025-04-26T15:21:14Z","title":"Speaker Retrieval in the Wild: Challenges, Effectiveness and Robustness","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-16T10:11:06.325064Z"},"links":{"citing_paper":"/paper/2504.18950"},"observation_digest":"sha256:9471eb5b1887cc8c014320d97d6f138c42ef3463acb8bf83ad4e6f0816f9795b","observation_id":"d89abc41-1db9-4e0e-ac1a-688b12f78ed2","resolution":{"observed_at":"2026-08-16T10:11:06.684399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:11:06.329361Z","title":"A study on data augmentation of reverberant speech for robust speech recognition,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.18950","last_updated":"2025-04-29T09:48:21Z","snapshot_observed_at":"2026-08-16T10:03:14.288076Z","submitted_at":"2025-04-26T15:21:14Z","title":"Speaker Retrieval in the Wild: Challenges, Effectiveness and Robustness","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-16T10:11:06.329361Z"},"links":{"citing_paper":"/paper/2504.18950"},"observation_digest":"sha256:648aa9f90fdad1c2fa0a78b86cc31cf50ca6b24ee70847a604abbf8ea2e0904a","observation_id":"8c837b69-17b3-446c-9a8b-473a11bdbd13","resolution":{"observed_at":"2026-08-16T10:11:06.329361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:11:06.652749Z","title":"Proceedings of the 8th text retrieval conference,","venue":null,"work_id":"f5eec0c0-9e92-437e-8732-38d32ab9d2a7","year":1999},"citing_paper":{"arxiv_id":"2504.18950","last_updated":"2025-04-29T09:48:21Z","snapshot_observed_at":"2026-08-16T10:03:14.288076Z","submitted_at":"2025-04-26T15:21:14Z","title":"Speaker Retrieval in the Wild: Challenges, Effectiveness and Robustness","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-16T10:11:06.334028Z"},"links":{"citing_paper":"/paper/2504.18950"},"observation_digest":"sha256:9b5e95ef20489acab1af28ad854936497106cbba19a6df8fe41e8476a1c6738b","observation_id":"cf5608e3-5efa-4019-8ba5-ed0b774a065a","resolution":{"observed_at":"2026-08-16T10:11:06.657498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:11:06.636854Z","title":"Cumulated gain-based evaluation of ir techniques,","venue":null,"work_id":"c190cc91-f499-4510-94ec-a8449e2ce647","year":2002},"citing_paper":{"arxiv_id":"2504.18950","last_updated":"2025-04-29T09:48:21Z","snapshot_observed_at":"2026-08-16T10:03:14.288076Z","submitted_at":"2025-04-26T15:21:14Z","title":"Speaker Retrieval in the Wild: Challenges, Effectiveness and Robustness","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-16T10:11:06.339031Z"},"links":{"citing_paper":"/paper/2504.18950"},"observation_digest":"sha256:58cd47412101d2b7b2ec51c90a66bf5431036f28bf526a6ea6785ba150cbdcd3","observation_id":"264fdc27-782f-4453-8328-76b34e0a4856","resolution":{"observed_at":"2026-08-16T10:11:06.642064Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:11:06.620651Z","title":"A theoretical analysis of NDCG ranking measures,","venue":null,"work_id":"72dafee9-744c-4a19-b0a7-f915b054a486","year":2013},"citing_paper":{"arxiv_id":"2504.18950","last_updated":"2025-04-29T09:48:21Z","snapshot_observed_at":"2026-08-16T10:03:14.288076Z","submitted_at":"2025-04-26T15:21:14Z","title":"Speaker Retrieval in the Wild: Challenges, Effectiveness and Robustness","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-16T10:11:06.343565Z"},"links":{"citing_paper":"/paper/2504.18950"},"observation_digest":"sha256:c7fa29d91dae324ab5f1312dfa47198be885733a7a8150cafee7912a44fb4ddf","observation_id":"dcd15614-e15f-4dc3-9d35-b23b8fc8348f","resolution":{"observed_at":"2026-08-16T10:11:06.626017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:11:06.604220Z","title":null,"venue":null,"work_id":"96a51664-8bb9-4daa-b653-abb25e2c4bb6","year":2009},"citing_paper":{"arxiv_id":"2504.18950","last_updated":"2025-04-29T09:48:21Z","snapshot_observed_at":"2026-08-16T10:03:14.288076Z","submitted_at":"2025-04-26T15:21:14Z","title":"Speaker Retrieval in the Wild: Challenges, Effectiveness and Robustness","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-16T10:11:06.348109Z"},"links":{"citing_paper":"/paper/2504.18950"},"observation_digest":"sha256:f7d50e5f199ab7dcfd3f97b959b0e96d79d6b5bb39079ae42e90f2071386ae49","observation_id":"7781d089-a593-4551-853c-a3ce6b3d250f","resolution":{"observed_at":"2026-08-16T10:11:06.609004Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:11:06.588473Z","title":"Carterette and E","venue":null,"work_id":"24c391fc-f0c9-4cde-b0cd-974f4483d50d","year":2011},"citing_paper":{"arxiv_id":"2504.18950","last_updated":"2025-04-29T09:48:21Z","snapshot_observed_at":"2026-08-16T10:03:14.288076Z","submitted_at":"2025-04-26T15:21:14Z","title":"Speaker Retrieval in the Wild: Challenges, Effectiveness and Robustness","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-16T10:11:06.352739Z"},"links":{"citing_paper":"/paper/2504.18950"},"observation_digest":"sha256:01318467d6e1aa11f83490a17c1536105ef09ad1fbeca82c7248353329ff072f","observation_id":"7dfc54d6-b6e9-4615-8307-69b6f2c768ac","resolution":{"observed_at":"2026-08-16T10:11:06.593211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:11:06.357188Z","title":"Visualizing data using t-sne","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2504.18950","last_updated":"2025-04-29T09:48:21Z","snapshot_observed_at":"2026-08-16T10:03:14.288076Z","submitted_at":"2025-04-26T15:21:14Z","title":"Speaker Retrieval in the Wild: Challenges, Effectiveness and Robustness","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-16T10:11:06.357188Z"},"links":{"citing_paper":"/paper/2504.18950"},"observation_digest":"sha256:7da9e2e2abc44c838a47c546c25d74f8bf02e19dfeb33a0c030ed9e714445750","observation_id":"3169ab3a-8834-4459-b4c1-7325870af6a3","resolution":{"observed_at":"2026-08-16T10:11:06.357188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:11:06.362191Z","title":"Scikit-learn: Machine learning in Python,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2504.18950","last_updated":"2025-04-29T09:48:21Z","snapshot_observed_at":"2026-08-16T10:03:14.288076Z","submitted_at":"2025-04-26T15:21:14Z","title":"Speaker Retrieval in the Wild: Challenges, Effectiveness and Robustness","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-16T10:11:06.362191Z"},"links":{"citing_paper":"/paper/2504.18950"},"observation_digest":"sha256:1d5d0603b87e3ec2c8df7085a480e9382b4bfd081dde966eaa65b74c1a1a164d","observation_id":"7de49c6f-8295-492b-9783-3b09611eeb54","resolution":{"observed_at":"2026-08-16T10:11:06.362191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:11:06.552941Z","title":"Silhouettes: a graphical aid to the interpretation and validation of cluster analysis,","venue":null,"work_id":"9051536c-47e8-4ddd-9878-bad8b2dbe152","year":1987},"citing_paper":{"arxiv_id":"2504.18950","last_updated":"2025-04-29T09:48:21Z","snapshot_observed_at":"2026-08-16T10:03:14.288076Z","submitted_at":"2025-04-26T15:21:14Z","title":"Speaker Retrieval in the Wild: Challenges, Effectiveness and Robustness","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-16T10:11:06.366628Z"},"links":{"citing_paper":"/paper/2504.18950"},"observation_digest":"sha256:175e849b0b2350e8410f0e9ef5df33bde1a15bf64949c9efc9aab037e8c20d4f","observation_id":"e867fc6d-c3de-4f59-b350-378f6f6e714a","resolution":{"observed_at":"2026-08-16T10:11:06.557832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:11:06.536823Z","title":"A binaural room impulse response database for the evaluation of dereverberation algorithms,","venue":null,"work_id":"209f5402-fd92-4180-9dac-1e0eff72a372","year":2009},"citing_paper":{"arxiv_id":"2504.18950","last_updated":"2025-04-29T09:48:21Z","snapshot_observed_at":"2026-08-16T10:03:14.288076Z","submitted_at":"2025-04-26T15:21:14Z","title":"Speaker Retrieval in the Wild: Challenges, Effectiveness and Robustness","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-16T10:11:06.371167Z"},"links":{"citing_paper":"/paper/2504.18950"},"observation_digest":"sha256:938be2b1d2b32d76b3aec854d654c6c3667f9c759ffcb1d265f20ad43e345266","observation_id":"fa53caf8-e07b-4eb2-ba3d-f597f414bc17","resolution":{"observed_at":"2026-08-16T10:11:06.542027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:11:06.520090Z","title":"Do we need dereverberation for hand-held telephony?","venue":null,"work_id":"45324248-a342-4c5e-aa3d-49994480854f","year":2010},"citing_paper":{"arxiv_id":"2504.18950","last_updated":"2025-04-29T09:48:21Z","snapshot_observed_at":"2026-08-16T10:03:14.288076Z","submitted_at":"2025-04-26T15:21:14Z","title":"Speaker Retrieval in the Wild: Challenges, Effectiveness and Robustness","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-16T10:11:06.375739Z"},"links":{"citing_paper":"/paper/2504.18950"},"observation_digest":"sha256:f563a90915edbeb6459ce18f5b04c1aba64ab57cdae80209e25363bb4b207001","observation_id":"270d8275-ee54-4585-afa4-a43969749faf","resolution":{"observed_at":"2026-08-16T10:11:06.525461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:11:06.504406Z","title":"RIR-Generator,","venue":null,"work_id":"fde0df8c-6c3e-49cf-9ea0-ba74798bd2ec","year":2022},"citing_paper":{"arxiv_id":"2504.18950","last_updated":"2025-04-29T09:48:21Z","snapshot_observed_at":"2026-08-16T10:03:14.288076Z","submitted_at":"2025-04-26T15:21:14Z","title":"Speaker Retrieval in the Wild: Challenges, Effectiveness and Robustness","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-16T10:11:06.380197Z"},"links":{"citing_paper":"/paper/2504.18950"},"observation_digest":"sha256:dc1d41cb572bc762a6509e87fb6f52c57fe3a2d0c888edc646051ea33c03b0a6","observation_id":"86c4d5c1-b231-45ee-88ca-e5c6b940d848","resolution":{"observed_at":"2026-08-16T10:11:06.509243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:11:06.487826Z","title":"Room impulse response generator,","venue":null,"work_id":"c8a7deed-6234-4a1e-b2e0-a2e1399d50d1","year":2006},"citing_paper":{"arxiv_id":"2504.18950","last_updated":"2025-04-29T09:48:21Z","snapshot_observed_at":"2026-08-16T10:03:14.288076Z","submitted_at":"2025-04-26T15:21:14Z","title":"Speaker Retrieval in the Wild: Challenges, Effectiveness and Robustness","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-16T10:11:06.384737Z"},"links":{"citing_paper":"/paper/2504.18950"},"observation_digest":"sha256:7949d9b05f24425f0a245b599379cfa6ab3707a9cc8a7fb17b422f27ffedcc4d","observation_id":"8a5d6f3a-a689-4d87-b56d-3abe2fef0130","resolution":{"observed_at":"2026-08-16T10:11:06.493923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:11:06.472301Z","title":"Image method for efficiently simulating small-room acoustics,","venue":null,"work_id":"b821faff-2a4f-4d0f-b6f4-d99c1bc42a4d","year":1979},"citing_paper":{"arxiv_id":"2504.18950","last_updated":"2025-04-29T09:48:21Z","snapshot_observed_at":"2026-08-16T10:03:14.288076Z","submitted_at":"2025-04-26T15:21:14Z","title":"Speaker Retrieval in the Wild: Challenges, Effectiveness and Robustness","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-16T10:11:06.390185Z"},"links":{"citing_paper":"/paper/2504.18950"},"observation_digest":"sha256:814b25dc00ba9f67a5c604776a5a7cb0eeb41e8331283f8077040e521da79e42","observation_id":"94ab5aa4-f26a-4cb2-b497-41bc2e157121","resolution":{"observed_at":"2026-08-16T10:11:06.477142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2504.18950","last_updated":"2025-04-29T09:48:21Z","latest_version":2,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-16T10:03:14.288076Z","submitted_at":"2025-04-26T15:21:14Z","title":"Speaker Retrieval in the Wild: Challenges, Effectiveness and Robustness"},"reference_resolution":{"displayed":76,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":2,"verified_fuzzy":60},"total_outbound_references":76},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 76 of 76 outbound references and 1 inbound Pith citation observation for arXiv:2504.18950."}