{"as_of":"2026-08-08T11:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8b166bab3b7f34945d15e4304cd92a6c3def596cb0d0b64604223684dbaec916","coverage":[{"denominator":42,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:23:26.148077Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:23:24.209433Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T12:23:26.439493Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.24545","last_updated":"2025-05-30T12:53:27Z","snapshot_observed_at":"2026-08-07T12:16:25.508317Z","submitted_at":"2025-05-30T12:53:27Z","title":"Pretraining Multi-Speaker Identification for Neural Speaker Diarization","version":1},"cited_work":{"arxiv_id":"2505.24545","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.24545","snapshot_observed_at":"2026-08-07T12:23:26.439493Z","title":"Pretraining Multi-Speaker Identification for Neural Speaker Diarization","venue":"eess.AS","work_id":"25dd815c-0c4d-4978-8d28-a0b968fad9d1","year":2025},"citing_paper":{"arxiv_id":"2505.24545","last_updated":"2025-05-30T12:53:27Z","snapshot_observed_at":"2026-08-07T12:16:25.508317Z","submitted_at":"2025-05-30T12:53:27Z","title":"Pretraining Multi-Speaker Identification for Neural Speaker Diarization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:23:24.209433Z"},"links":{"cited_paper":"/paper/2505.24545","citing_paper":"/paper/2505.24545"},"observation_digest":"sha256:46528124335261592b6127c8b73d06f01ea6a6c72763e3798e6a9e664713e171","observation_id":"7a67bcdb-cc66-49d2-bb45-d46264868983","resolution":{"observed_at":"2026-08-07T12:23:26.470279Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.24545/citation-record","integrity":"/paper/2505.24545/integrity","json":"/paper/2505.24545/citation-record.json","paper":"/paper/2505.24545"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:23:31.705580Z","title":null,"venue":null,"work_id":"5315d043-907d-406b-93da-9f7466aa4b36","year":null},"citing_paper":{"arxiv_id":"2505.24545","last_updated":"2025-05-30T12:53:27Z","snapshot_observed_at":"2026-08-07T12:16:25.508317Z","submitted_at":"2025-05-30T12:53:27Z","title":"Pretraining Multi-Speaker Identification for Neural Speaker Diarization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:23:24.167552Z"},"links":{"citing_paper":"/paper/2505.24545"},"observation_digest":"sha256:ec7404a1ce5049c03a5c34f8613dbb855c998819b151655139c061988a19e287","observation_id":"fa6f38c3-d3bf-45dc-9408-30a1217e80c4","resolution":{"observed_at":"2026-08-07T12:23:31.824700Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24545","last_updated":"2025-05-30T12:53:27Z","snapshot_observed_at":"2026-08-07T12:16:25.508317Z","submitted_at":"2025-05-30T12:53:27Z","title":"Pretraining Multi-Speaker Identification for Neural Speaker Diarization","version":1},"cited_work":{"arxiv_id":"2505.24545","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.24545","snapshot_observed_at":"2026-08-07T12:23:26.439493Z","title":"Pretraining Multi-Speaker Identification for Neural Speaker Diarization","venue":"eess.AS","work_id":"25dd815c-0c4d-4978-8d28-a0b968fad9d1","year":2025},"citing_paper":{"arxiv_id":"2505.24545","last_updated":"2025-05-30T12:53:27Z","snapshot_observed_at":"2026-08-07T12:16:25.508317Z","submitted_at":"2025-05-30T12:53:27Z","title":"Pretraining Multi-Speaker Identification for Neural Speaker Diarization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:23:24.209433Z"},"links":{"cited_paper":"/paper/2505.24545","citing_paper":"/paper/2505.24545"},"observation_digest":"sha256:46528124335261592b6127c8b73d06f01ea6a6c72763e3798e6a9e664713e171","observation_id":"7a67bcdb-cc66-49d2-bb45-d46264868983","resolution":{"observed_at":"2026-08-07T12:23:26.470279Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:23:31.605380Z","title":null,"venue":null,"work_id":"c5996d5d-7492-44e7-8742-ed28d712150b","year":null},"citing_paper":{"arxiv_id":"2505.24545","last_updated":"2025-05-30T12:53:27Z","snapshot_observed_at":"2026-08-07T12:16:25.508317Z","submitted_at":"2025-05-30T12:53:27Z","title":"Pretraining Multi-Speaker Identification for Neural Speaker Diarization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:23:24.257239Z"},"links":{"citing_paper":"/paper/2505.24545"},"observation_digest":"sha256:fa4adb37c4f6ac4b812f423961c6ad9931bc445af440c61209cb75889661bce7","observation_id":"302b6b9b-cae0-4555-80a6-7fa951886a7e","resolution":{"observed_at":"2026-08-07T12:23:31.648141Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:23:31.483352Z","title":"Dataset Table 1 lists the datasets used in our experiments, all monaural with a 16 kHz sampling rate and 16 bit depth","venue":null,"work_id":"9aa1f0ec-2eed-47dc-97b5-eb6749a2db12","year":null},"citing_paper":{"arxiv_id":"2505.24545","last_updated":"2025-05-30T12:53:27Z","snapshot_observed_at":"2026-08-07T12:16:25.508317Z","submitted_at":"2025-05-30T12:53:27Z","title":"Pretraining Multi-Speaker Identification for Neural Speaker Diarization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:23:24.292240Z"},"links":{"citing_paper":"/paper/2505.24545"},"observation_digest":"sha256:404b461cf9c28bdfc1f69bcc5d6826c2c279168abcfd4e4ba4326bd6b058c819","observation_id":"04e71035-2c7e-4996-a8f3-55f81d408bf3","resolution":{"observed_at":"2026-08-07T12:23:31.551212Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"7710.0015","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:23:26.353250Z","title":null,"venue":null,"work_id":"fe02487f-49e2-4b4a-b343-103bd6f90505","year":null},"citing_paper":{"arxiv_id":"2505.24545","last_updated":"2025-05-30T12:53:27Z","snapshot_observed_at":"2026-08-07T12:16:25.508317Z","submitted_at":"2025-05-30T12:53:27Z","title":"Pretraining Multi-Speaker Identification for Neural Speaker Diarization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:23:24.332072Z"},"links":{"citing_paper":"/paper/2505.24545"},"observation_digest":"sha256:be6a6e090aadc90f3bbc7a427e0e8e29fa0c2ea3d536d57fbf44843e6a529272","observation_id":"7cc67e4a-0ad7-4932-898f-1fc177eef11b","resolution":{"observed_at":"2026-08-07T12:23:26.376459Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:23:31.287085Z","title":"The method is storage-friendly, simulation-agnostic, and outperformed diarization-based pre- training, with further gains from additional DIA pretraining","venue":null,"work_id":"573c0204-0856-4254-a3cd-88ca5c41b9f5","year":null},"citing_paper":{"arxiv_id":"2505.24545","last_updated":"2025-05-30T12:53:27Z","snapshot_observed_at":"2026-08-07T12:16:25.508317Z","submitted_at":"2025-05-30T12:53:27Z","title":"Pretraining Multi-Speaker Identification for Neural Speaker Diarization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:23:24.375554Z"},"links":{"citing_paper":"/paper/2505.24545"},"observation_digest":"sha256:90b6c2b5f3443f94475ebfc37301102bf9175eb497054255889771c598166647","observation_id":"56c5e90b-284c-4297-9c08-33dc0cd619f1","resolution":{"observed_at":"2026-08-07T12:23:31.336895Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:23:31.194470Z","title":"Front-end processing for the CHiME-5 dinner party scenario,","venue":null,"work_id":"32a42881-c3be-4081-ace9-db404387893d","year":2018},"citing_paper":{"arxiv_id":"2505.24545","last_updated":"2025-05-30T12:53:27Z","snapshot_observed_at":"2026-08-07T12:16:25.508317Z","submitted_at":"2025-05-30T12:53:27Z","title":"Pretraining Multi-Speaker Identification for Neural Speaker Diarization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:23:24.422764Z"},"links":{"citing_paper":"/paper/2505.24545"},"observation_digest":"sha256:2ba8604158b232ff85213c7ce4e8c308492d2f5d9041dd93a16f4bcb03a5544a","observation_id":"b8809d20-5737-460d-a984-dbe51c289502","resolution":{"observed_at":"2026-08-07T12:23:31.232159Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:23:31.092856Z","title":"BUT/JHU system description for CHiME-8 NOTSOFAR-1 challenge,","venue":null,"work_id":"4afd3fc1-f0e8-4ac9-bcd3-48e6a98d9430","year":2024},"citing_paper":{"arxiv_id":"2505.24545","last_updated":"2025-05-30T12:53:27Z","snapshot_observed_at":"2026-08-07T12:16:25.508317Z","submitted_at":"2025-05-30T12:53:27Z","title":"Pretraining Multi-Speaker Identification for Neural Speaker Diarization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:23:24.466431Z"},"links":{"citing_paper":"/paper/2505.24545"},"observation_digest":"sha256:851d0bd85a99ac80278a3e0506a6f586a604b6d07e5d99ce67cb0a617a1588d6","observation_id":"b0c7ff37-6e07-4931-815b-d549eeaa551a","resolution":{"observed_at":"2026-08-07T12:23:31.130816Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-07-06T20:14:54.297131Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00114","snapshot_observed_at":"2026-08-07T12:23:24.503068Z","title":"Di- CoW: Diarization-conditioned whisper for target speaker auto- matic speech recognition,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24545","last_updated":"2025-05-30T12:53:27Z","snapshot_observed_at":"2026-08-07T12:16:25.508317Z","submitted_at":"2025-05-30T12:53:27Z","title":"Pretraining Multi-Speaker Identification for Neural Speaker Diarization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:23:24.503068Z"},"links":{"cited_paper":"/paper/2501.00114","citing_paper":"/paper/2505.24545"},"observation_digest":"sha256:ea5fbc52b7c3fbcaa8961bc59acd90151048bc81abdc192339124e0636f4a078","observation_id":"4fd78155-4eda-4b50-bdae-3aa0155d3660","resolution":{"observed_at":"2026-08-07T12:23:24.503068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:23:30.980948Z","title":"Bayesian HMM clustering of x-vector sequences (VBx) in speaker diarization: Theory, implementation and analysis on standard tasks,","venue":null,"work_id":"4bf8b699-1817-479f-9e7c-4c1fdecf01ba","year":2022},"citing_paper":{"arxiv_id":"2505.24545","last_updated":"2025-05-30T12:53:27Z","snapshot_observed_at":"2026-08-07T12:16:25.508317Z","submitted_at":"2025-05-30T12:53:27Z","title":"Pretraining Multi-Speaker Identification for Neural Speaker Diarization","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:23:24.556543Z"},"links":{"citing_paper":"/paper/2505.24545"},"observation_digest":"sha256:9bf6cb30dfb21553bc5684257b0ee56421b58dfa9de5fd20d2ce8015b148097f","observation_id":"8f0886cf-8faf-47d2-8ef1-b87c599b7fcc","resolution":{"observed_at":"2026-08-07T12:23:31.031489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:23:30.867062Z","title":"End-to-end neural speaker diarization with permutation-free objectives,","venue":null,"work_id":"23b1b920-7114-425b-bbfa-6a658ac97519","year":2019},"citing_paper":{"arxiv_id":"2505.24545","last_updated":"2025-05-30T12:53:27Z","snapshot_observed_at":"2026-08-07T12:16:25.508317Z","submitted_at":"2025-05-30T12:53:27Z","title":"Pretraining Multi-Speaker Identification for Neural Speaker Diarization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:23:24.607387Z"},"links":{"citing_paper":"/paper/2505.24545"},"observation_digest":"sha256:4586f0ba7c2e8b8e0ce53f4fa55ad99b27adefd3ce7945c38937f7cf3ab846d4","observation_id":"8a0c71fa-f231-4cc8-b515-78c5257bf4b9","resolution":{"observed_at":"2026-08-07T12:23:30.911215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:23:30.728580Z","title":"Integrating end-to- end neural and clustering-based diarization: Getting the best of both worlds,","venue":null,"work_id":"483797df-0e06-4927-ae1e-a97c14637972","year":2021},"citing_paper":{"arxiv_id":"2505.24545","last_updated":"2025-05-30T12:53:27Z","snapshot_observed_at":"2026-08-07T12:16:25.508317Z","submitted_at":"2025-05-30T12:53:27Z","title":"Pretraining Multi-Speaker Identification for Neural Speaker Diarization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:23:24.642725Z"},"links":{"citing_paper":"/paper/2505.24545"},"observation_digest":"sha256:3da6a0472acc1b91699e158fd6588907244471894589810f30f9feefc39a9774","observation_id":"b3a0e7b8-0949-4373-89f4-314dfc595c78","resolution":{"observed_at":"2026-08-07T12:23:30.787427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:23:30.526521Z","title":"Towards neural diarization for unlimited num- bers of speakers using global and local attractors,","venue":null,"work_id":"60c88f62-f984-444a-a825-e6eb9ea03dad","year":2021},"citing_paper":{"arxiv_id":"2505.24545","last_updated":"2025-05-30T12:53:27Z","snapshot_observed_at":"2026-08-07T12:16:25.508317Z","submitted_at":"2025-05-30T12:53:27Z","title":"Pretraining Multi-Speaker Identification for Neural Speaker Diarization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:23:24.676486Z"},"links":{"citing_paper":"/paper/2505.24545"},"observation_digest":"sha256:4461c1076135965e0a7b6cb510c0c7c76c8512ca883366a55002bea539e84d28","observation_id":"eb4bbdf1-6d12-4cf3-a6cc-2fff10a74ebe","resolution":{"observed_at":"2026-08-07T12:23:30.621558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:23:30.310883Z","title":"pyannote.audio 2.1 speaker diarization pipeline: prin- ciple, benchmark, and recipe,","venue":null,"work_id":"b980ce6e-6f60-4f24-ab7c-7fc3f6b056fb","year":2023},"citing_paper":{"arxiv_id":"2505.24545","last_updated":"2025-05-30T12:53:27Z","snapshot_observed_at":"2026-08-07T12:16:25.508317Z","submitted_at":"2025-05-30T12:53:27Z","title":"Pretraining Multi-Speaker Identification for Neural Speaker Diarization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:23:24.718602Z"},"links":{"citing_paper":"/paper/2505.24545"},"observation_digest":"sha256:ff37657072c918a8b17fce1c4c354f506353a2000f5c71825bb4614ebcbf1501","observation_id":"b398ad51-2fe1-4de3-8846-b22baa1f975f","resolution":{"observed_at":"2026-08-07T12:23:30.416238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:23:24.757297Z","title":"Powerset multi-class cross entropy loss for neural speaker diarization,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24545","last_updated":"2025-05-30T12:53:27Z","snapshot_observed_at":"2026-08-07T12:16:25.508317Z","submitted_at":"2025-05-30T12:53:27Z","title":"Pretraining Multi-Speaker Identification for Neural Speaker Diarization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:23:24.757297Z"},"links":{"citing_paper":"/paper/2505.24545"},"observation_digest":"sha256:c62df37ada2a45d9b95dca1468882deea7e54c2c2ed1998e74a2def5e576069a","observation_id":"ec649530-f800-4d20-b183-f6c97078bb05","resolution":{"observed_at":"2026-08-07T12:23:24.757297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:23:30.047947Z","title":"End-to-end diarization for variable number of speakers with local-global networks and discriminative speaker embeddings,","venue":null,"work_id":"d564f192-c1fb-4e4b-ab94-4a27430c4d03","year":2021},"citing_paper":{"arxiv_id":"2505.24545","last_updated":"2025-05-30T12:53:27Z","snapshot_observed_at":"2026-08-07T12:16:25.508317Z","submitted_at":"2025-05-30T12:53:27Z","title":"Pretraining Multi-Speaker Identification for Neural Speaker Diarization","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:23:24.812647Z"},"links":{"citing_paper":"/paper/2505.24545"},"observation_digest":"sha256:142eb2bc6d774571e016b48f05d5df84f02b0584000122770ab631bfecf8aab3","observation_id":"96c7f9b9-a98b-413e-ab9f-fcfc510c4289","resolution":{"observed_at":"2026-08-07T12:23:30.194665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:23:29.834036Z","title":"Improving the nat- uralness of simulated conversations for end-to-end neural diariza- tion,","venue":null,"work_id":"6be969f3-19b1-4479-8433-f0334dff251a","year":2022},"citing_paper":{"arxiv_id":"2505.24545","last_updated":"2025-05-30T12:53:27Z","snapshot_observed_at":"2026-08-07T12:16:25.508317Z","submitted_at":"2025-05-30T12:53:27Z","title":"Pretraining Multi-Speaker Identification for Neural Speaker Diarization","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:23:24.859897Z"},"links":{"citing_paper":"/paper/2505.24545"},"observation_digest":"sha256:7ff2181a0721d2eed9e6891a23aebd1c6f778646a577eb7bc476a0fa60b8f3b9","observation_id":"af22441e-1ddf-4bfd-ad56-afb18b638ad7","resolution":{"observed_at":"2026-08-07T12:23:29.935478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:23:29.643624Z","title":"From simu- lated mixtures to simulated conversations as training data for end- to-end neural diarization,","venue":null,"work_id":"b0459da2-4bf2-454c-bffe-1752f09f408c","year":2022},"citing_paper":{"arxiv_id":"2505.24545","last_updated":"2025-05-30T12:53:27Z","snapshot_observed_at":"2026-08-07T12:16:25.508317Z","submitted_at":"2025-05-30T12:53:27Z","title":"Pretraining Multi-Speaker Identification for Neural Speaker Diarization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:23:24.909554Z"},"links":{"citing_paper":"/paper/2505.24545"},"observation_digest":"sha256:58e311a29fe9b8aa73804a19a73685dab6e54fef98824c46be1ea47946543cf1","observation_id":"4640bd14-4b51-4c7e-9f4f-2348443458ab","resolution":{"observed_at":"2026-08-07T12:23:29.733367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:23:24.948296Z","title":"Leveraging self-supervised learning for speaker diarization,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24545","last_updated":"2025-05-30T12:53:27Z","snapshot_observed_at":"2026-08-07T12:16:25.508317Z","submitted_at":"2025-05-30T12:53:27Z","title":"Pretraining Multi-Speaker Identification for Neural Speaker Diarization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:23:24.948296Z"},"links":{"citing_paper":"/paper/2505.24545"},"observation_digest":"sha256:b9108d459fa4cda0312c62869cb0775bd1b79615db31cb0a7d5817e3337b7cee","observation_id":"4866b203-bbb6-4968-96b2-47775bc03f2c","resolution":{"observed_at":"2026-08-07T12:23:24.948296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:23:29.462013Z","title":"Recursive attentive pooling for ex- tracting speaker embeddings from multi-speaker recordings,","venue":null,"work_id":"1ddbb958-a858-44b3-b380-d96931869030","year":2024},"citing_paper":{"arxiv_id":"2505.24545","last_updated":"2025-05-30T12:53:27Z","snapshot_observed_at":"2026-08-07T12:16:25.508317Z","submitted_at":"2025-05-30T12:53:27Z","title":"Pretraining Multi-Speaker Identification for Neural Speaker Diarization","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:23:24.986999Z"},"links":{"citing_paper":"/paper/2505.24545"},"observation_digest":"sha256:a4352326e42ce2bdebc4b0ad207954e47fe4764b7b4467626302dcf5027a623a","observation_id":"2cdd0398-508a-47e6-8a3a-b80229a50690","resolution":{"observed_at":"2026-08-07T12:23:29.533149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:23:29.223408Z","title":"Frame-wise and overlap-robust speaker em- beddings for meeting diarization,","venue":null,"work_id":"b560bdc8-b150-4a3a-8b55-2bb23800b36e","year":2023},"citing_paper":{"arxiv_id":"2505.24545","last_updated":"2025-05-30T12:53:27Z","snapshot_observed_at":"2026-08-07T12:16:25.508317Z","submitted_at":"2025-05-30T12:53:27Z","title":"Pretraining Multi-Speaker Identification for Neural Speaker Diarization","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:23:25.042846Z"},"links":{"citing_paper":"/paper/2505.24545"},"observation_digest":"sha256:8ba1067780cb04f5b584c9aaa29655a4e0aeb2072ccfc1fab4d8674c0acbbc7f","observation_id":"dbd191cc-3ed4-4c50-bc9c-d252b9ec8d39","resolution":{"observed_at":"2026-08-07T12:23:29.327882Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:23:29.009273Z","title":"Leverag- ing speaker embeddings in end-to-end neural diarization for two- speaker scenarios,","venue":null,"work_id":"9cd0ea81-ac0d-4bf6-a581-c97b1842d193","year":2024},"citing_paper":{"arxiv_id":"2505.24545","last_updated":"2025-05-30T12:53:27Z","snapshot_observed_at":"2026-08-07T12:16:25.508317Z","submitted_at":"2025-05-30T12:53:27Z","title":"Pretraining Multi-Speaker Identification for Neural Speaker Diarization","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:23:25.122201Z"},"links":{"citing_paper":"/paper/2505.24545"},"observation_digest":"sha256:dad8a2c946e3ee834aa2350925c3dd4b2b1bf69b9b99e86c1f2cc09518bfaceb","observation_id":"56bfb1df-580a-45e6-9424-d00bd60606d0","resolution":{"observed_at":"2026-08-07T12:23:29.093717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:23:28.791754Z","title":"ECAPA- TDNN: Emphasized channel attention, propagation and aggrega- tion in TDNN based speaker verification,","venue":null,"work_id":"38006425-acd8-45b6-bc50-2714c8028f7e","year":2020},"citing_paper":{"arxiv_id":"2505.24545","last_updated":"2025-05-30T12:53:27Z","snapshot_observed_at":"2026-08-07T12:16:25.508317Z","submitted_at":"2025-05-30T12:53:27Z","title":"Pretraining Multi-Speaker Identification for Neural Speaker Diarization","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:23:25.178936Z"},"links":{"citing_paper":"/paper/2505.24545"},"observation_digest":"sha256:407ed6f1ff5c7b208a68293b0606d65eac1802c0e279c2896848ef2325d3f9f4","observation_id":"6ca7aa5a-6933-4a38-8733-c216fca7ca2c","resolution":{"observed_at":"2026-08-07T12:23:28.859536Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:23:28.671516Z","title":"Reshape dimensions network for speaker recognition,","venue":null,"work_id":"965fd4c7-e25b-4476-a633-e649d6480b48","year":2024},"citing_paper":{"arxiv_id":"2505.24545","last_updated":"2025-05-30T12:53:27Z","snapshot_observed_at":"2026-08-07T12:16:25.508317Z","submitted_at":"2025-05-30T12:53:27Z","title":"Pretraining Multi-Speaker Identification for Neural Speaker Diarization","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:23:25.221462Z"},"links":{"citing_paper":"/paper/2505.24545"},"observation_digest":"sha256:5d3c6a7d655e858b883c702886e21eda39b1dc0fda53000e305ca90d18583038","observation_id":"1f3a1947-1320-4bcd-949c-0c8d2221052f","resolution":{"observed_at":"2026-08-07T12:23:28.722290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:23:28.531766Z","title":"Advances in inte- gration of end-to-end neural and clustering-based diarization for real conversational speech,","venue":null,"work_id":"e8d66a9c-4a91-4b4e-bd8b-b3ddce9c3e5e","year":2021},"citing_paper":{"arxiv_id":"2505.24545","last_updated":"2025-05-30T12:53:27Z","snapshot_observed_at":"2026-08-07T12:16:25.508317Z","submitted_at":"2025-05-30T12:53:27Z","title":"Pretraining Multi-Speaker Identification for Neural Speaker Diarization","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:23:25.263807Z"},"links":{"citing_paper":"/paper/2505.24545"},"observation_digest":"sha256:d527e65025aec6f568bfee99de91df711c063f0db0e48ff5e83bc1b35b4e96d0","observation_id":"de2e1446-1b7f-493e-a055-3a7700970a66","resolution":{"observed_at":"2026-08-07T12:23:28.588649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:23:28.377097Z","title":"BUT system for the Second DIHARD Speech Diarization Challenge,","venue":null,"work_id":"864b63ed-ad96-4def-bbf7-5e4a9d1b18f0","year":2020},"citing_paper":{"arxiv_id":"2505.24545","last_updated":"2025-05-30T12:53:27Z","snapshot_observed_at":"2026-08-07T12:16:25.508317Z","submitted_at":"2025-05-30T12:53:27Z","title":"Pretraining Multi-Speaker Identification for Neural Speaker Diarization","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:23:25.311513Z"},"links":{"citing_paper":"/paper/2505.24545"},"observation_digest":"sha256:4081119086b253defcd9f8de948fec831ac7ca4ce205eec1c20f491707150cb1","observation_id":"cd6c1782-ba22-4039-8b68-711ca17f8fd7","resolution":{"observed_at":"2026-08-07T12:23:28.417571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:23:28.192921Z","title":"Overlap-aware diarization: Resegmentation using neural end-to-end overlapped speech detection,","venue":null,"work_id":"fd6848ab-4b44-4b14-b4e0-39ae96d1497d","year":2020},"citing_paper":{"arxiv_id":"2505.24545","last_updated":"2025-05-30T12:53:27Z","snapshot_observed_at":"2026-08-07T12:16:25.508317Z","submitted_at":"2025-05-30T12:53:27Z","title":"Pretraining Multi-Speaker Identification for Neural Speaker Diarization","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:23:25.359230Z"},"links":{"citing_paper":"/paper/2505.24545"},"observation_digest":"sha256:fae94fa8121a83ba5361da95bd008291bf6d822973627f3ffc3fc4e6697a3791","observation_id":"4899405e-6860-4eee-9c96-7cdbbd5ed1ce","resolution":{"observed_at":"2026-08-07T12:23:28.252601Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:23:27.984904Z","title":"End-to-end speaker diarization as post-processing,","venue":null,"work_id":"12f9305f-20d7-4642-82bb-7f249ba8f680","year":2021},"citing_paper":{"arxiv_id":"2505.24545","last_updated":"2025-05-30T12:53:27Z","snapshot_observed_at":"2026-08-07T12:16:25.508317Z","submitted_at":"2025-05-30T12:53:27Z","title":"Pretraining Multi-Speaker Identification for Neural Speaker Diarization","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:23:25.413374Z"},"links":{"citing_paper":"/paper/2505.24545"},"observation_digest":"sha256:af8d958f73c69563da88671f97390d278a656ad7a17fcfca000d7bb4bfbe69e7","observation_id":"726fe55b-17bc-4a87-8b89-1090e5347b9d","resolution":{"observed_at":"2026-08-07T12:23:28.090233Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:23:25.476790Z","title":"V oxCeleb: Large-scale speaker verification in the wild,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.24545","last_updated":"2025-05-30T12:53:27Z","snapshot_observed_at":"2026-08-07T12:16:25.508317Z","submitted_at":"2025-05-30T12:53:27Z","title":"Pretraining Multi-Speaker Identification for Neural Speaker Diarization","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:23:25.476790Z"},"links":{"citing_paper":"/paper/2505.24545"},"observation_digest":"sha256:df4dbf28a077a6c5a5a9e40eabc6af3cbfcf896328d42d61f1fc9a362da6441d","observation_id":"91cc6fbe-5938-4df6-ac68-07e0df910299","resolution":{"observed_at":"2026-08-07T12:23:25.476790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:23:27.814047Z","title":"AISHELL-4: An open source dataset for speech enhancement, separation, recognition and speaker diarization in conference scenario,","venue":null,"work_id":"bea1f14a-ca77-4a50-8753-d9833c503773","year":2021},"citing_paper":{"arxiv_id":"2505.24545","last_updated":"2025-05-30T12:53:27Z","snapshot_observed_at":"2026-08-07T12:16:25.508317Z","submitted_at":"2025-05-30T12:53:27Z","title":"Pretraining Multi-Speaker Identification for Neural Speaker Diarization","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:23:25.540343Z"},"links":{"citing_paper":"/paper/2505.24545"},"observation_digest":"sha256:d2c34d172d04c5eac0c7a5185348385ae9f52accb9da9e26f17ddac2dcdf3fb7","observation_id":"34ab085d-3ddb-4273-a435-464d5cd83218","resolution":{"observed_at":"2026-08-07T12:23:27.876180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:23:27.697367Z","title":"M2MeT: The ICASSP 2022 multi-channel multi-party meeting transcription challenge,","venue":null,"work_id":"e40aea86-f357-417d-9769-33439e1a94fb","year":2022},"citing_paper":{"arxiv_id":"2505.24545","last_updated":"2025-05-30T12:53:27Z","snapshot_observed_at":"2026-08-07T12:16:25.508317Z","submitted_at":"2025-05-30T12:53:27Z","title":"Pretraining Multi-Speaker Identification for Neural Speaker Diarization","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:23:25.590807Z"},"links":{"citing_paper":"/paper/2505.24545"},"observation_digest":"sha256:883b1bec75e01a8ca42b419b705652d46ffab425caac8a9be1c25463e3af9c7c","observation_id":"04b31024-6d93-4ea6-8fae-0f9dbfd7d4dd","resolution":{"observed_at":"2026-08-07T12:23:27.725928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:23:25.654858Z","title":"Unleashing the killer corpus: experiences in creating the multi-everything AMI Meeting Corpus,","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2505.24545","last_updated":"2025-05-30T12:53:27Z","snapshot_observed_at":"2026-08-07T12:16:25.508317Z","submitted_at":"2025-05-30T12:53:27Z","title":"Pretraining Multi-Speaker Identification for Neural Speaker Diarization","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:23:25.654858Z"},"links":{"citing_paper":"/paper/2505.24545"},"observation_digest":"sha256:d997445edfd4389c28f5a0650388db57553c678d12b490e32dc94b730dc247ae","observation_id":"cbc61f7e-cf58-4393-ad8c-947602ca255f","resolution":{"observed_at":"2026-08-07T12:23:25.654858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:23:27.543425Z","title":"Open source MagicData-RAMC: A rich annotated Mandarin conversational (RAMC) speech dataset,","venue":null,"work_id":"89a566fe-c708-4aeb-9b54-d98349c497c9","year":2022},"citing_paper":{"arxiv_id":"2505.24545","last_updated":"2025-05-30T12:53:27Z","snapshot_observed_at":"2026-08-07T12:16:25.508317Z","submitted_at":"2025-05-30T12:53:27Z","title":"Pretraining Multi-Speaker Identification for Neural Speaker Diarization","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:23:25.689636Z"},"links":{"citing_paper":"/paper/2505.24545"},"observation_digest":"sha256:4fedab8de2480050a53970a10d9efd845b840d63198e605137e2c1318fa45a3f","observation_id":"f58573fb-f466-444b-9592-5939b85072ec","resolution":{"observed_at":"2026-08-07T12:23:27.586119Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:23:27.444129Z","title":"MSDWild: Multi- modal speaker diarization dataset in the wild,","venue":null,"work_id":"1b0af471-d422-45d5-b488-c1fd151c788f","year":2022},"citing_paper":{"arxiv_id":"2505.24545","last_updated":"2025-05-30T12:53:27Z","snapshot_observed_at":"2026-08-07T12:16:25.508317Z","submitted_at":"2025-05-30T12:53:27Z","title":"Pretraining Multi-Speaker Identification for Neural Speaker Diarization","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:23:25.732137Z"},"links":{"citing_paper":"/paper/2505.24545"},"observation_digest":"sha256:65a671c280ec67235535837f16efc9163c75d855102b7bf02615975431e0a46d","observation_id":"4ec45dcc-566a-4e00-bb24-dc6159583a7f","resolution":{"observed_at":"2026-08-07T12:23:27.487926Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:23:27.337086Z","title":"Spot the conversation: Speaker diarisation in the wild,","venue":null,"work_id":"0e72afaf-5e5a-4f65-916d-8809aaabc6f0","year":2020},"citing_paper":{"arxiv_id":"2505.24545","last_updated":"2025-05-30T12:53:27Z","snapshot_observed_at":"2026-08-07T12:16:25.508317Z","submitted_at":"2025-05-30T12:53:27Z","title":"Pretraining Multi-Speaker Identification for Neural Speaker Diarization","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:23:25.780219Z"},"links":{"citing_paper":"/paper/2505.24545"},"observation_digest":"sha256:a19f33145ec409b1e976f4e38d2fa0ac188600814b3a47f5b9ab8e5248c1d74a","observation_id":"2776752f-c287-48e1-9e9b-3223340ddcdd","resolution":{"observed_at":"2026-08-07T12:23:27.368891Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:23:27.186505Z","title":"Mamba-based segmentation model for speaker diariza- tion,","venue":null,"work_id":"88ef2962-5f5f-43e2-9201-1e690ffec2c8","year":2025},"citing_paper":{"arxiv_id":"2505.24545","last_updated":"2025-05-30T12:53:27Z","snapshot_observed_at":"2026-08-07T12:16:25.508317Z","submitted_at":"2025-05-30T12:53:27Z","title":"Pretraining Multi-Speaker Identification for Neural Speaker Diarization","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:23:25.841849Z"},"links":{"citing_paper":"/paper/2505.24545"},"observation_digest":"sha256:ccc65e6f55960a8807d8bd1ffe213eb54126728e1c9b7f58d867f7c95e1d4b04","observation_id":"ab377e1a-3d41-4596-b408-a8823e459ddb","resolution":{"observed_at":"2026-08-07T12:23:27.268159Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:23:27.029921Z","title":"FunASR: A fundamental end-to- end speech recognition toolkit,","venue":null,"work_id":"9b508278-8dea-4c8a-aae7-64036d0e415a","year":2023},"citing_paper":{"arxiv_id":"2505.24545","last_updated":"2025-05-30T12:53:27Z","snapshot_observed_at":"2026-08-07T12:16:25.508317Z","submitted_at":"2025-05-30T12:53:27Z","title":"Pretraining Multi-Speaker Identification for Neural Speaker Diarization","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:23:25.891003Z"},"links":{"citing_paper":"/paper/2505.24545"},"observation_digest":"sha256:cc57a0ec3831825c93d8688353c8de149a41929f65a19f114d91dab9ad1ea187","observation_id":"5bb5f6e7-1629-4b54-8eec-8e3d1fc084f6","resolution":{"observed_at":"2026-08-07T12:23:27.127955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:23:25.928738Z","title":"Adam: A method for stochastic opti- mization,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.24545","last_updated":"2025-05-30T12:53:27Z","snapshot_observed_at":"2026-08-07T12:16:25.508317Z","submitted_at":"2025-05-30T12:53:27Z","title":"Pretraining Multi-Speaker Identification for Neural Speaker Diarization","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:23:25.928738Z"},"links":{"citing_paper":"/paper/2505.24545"},"observation_digest":"sha256:b2c3d4e4108444fa2461250c7e6f5762e71fab32f6cc355fa6bd034da2977fdb","observation_id":"e6d6392e-8038-4318-b0e3-6156ff8dcab9","resolution":{"observed_at":"2026-08-07T12:23:25.928738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:23:26.836213Z","title":"Speaker recognition from raw wave- form with SincNet,","venue":null,"work_id":"3fc7ac78-d607-40f3-85b2-d1dfcff3a5e6","year":2018},"citing_paper":{"arxiv_id":"2505.24545","last_updated":"2025-05-30T12:53:27Z","snapshot_observed_at":"2026-08-07T12:16:25.508317Z","submitted_at":"2025-05-30T12:53:27Z","title":"Pretraining Multi-Speaker Identification for Neural Speaker Diarization","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:23:25.980172Z"},"links":{"citing_paper":"/paper/2505.24545"},"observation_digest":"sha256:cdc1f5f283e150cb56c64ee63ea01211f500501b8ba769f8addbcaa9980cbc87","observation_id":"596f3de0-db7e-4c60-91eb-bfffefa9b36d","resolution":{"observed_at":"2026-08-07T12:23:26.902853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:23:26.036715Z","title":"WavLM: Large-scale self- supervised pre-training for full stack speech processing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.24545","last_updated":"2025-05-30T12:53:27Z","snapshot_observed_at":"2026-08-07T12:16:25.508317Z","submitted_at":"2025-05-30T12:53:27Z","title":"Pretraining Multi-Speaker Identification for Neural Speaker Diarization","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T12:23:26.036715Z"},"links":{"citing_paper":"/paper/2505.24545"},"observation_digest":"sha256:be3eac39d71ff446b5fb6415649983850966836c7900f8a85d5fa0790f1d8e8c","observation_id":"45a5248f-e6c9-4385-a67a-f68767665b13","resolution":{"observed_at":"2026-08-07T12:23:26.036715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:23:26.708570Z","title":"pyan- note.audio speaker diarization pipeline at V oxSRC 2023,","venue":null,"work_id":"f7c2f8fd-3279-42f7-8c19-5c507f3ac12c","year":2023},"citing_paper":{"arxiv_id":"2505.24545","last_updated":"2025-05-30T12:53:27Z","snapshot_observed_at":"2026-08-07T12:16:25.508317Z","submitted_at":"2025-05-30T12:53:27Z","title":"Pretraining Multi-Speaker Identification for Neural Speaker Diarization","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T12:23:26.099762Z"},"links":{"citing_paper":"/paper/2505.24545"},"observation_digest":"sha256:989ec9f25f1707037f3d44a7e476e934715d9d5184f93eb833ef797365c1516b","observation_id":"b2d5bea5-8bfe-4d6a-b3db-4cb21d3cab49","resolution":{"observed_at":"2026-08-07T12:23:26.780187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:23:26.531352Z","title":"NTT speaker diarization system for CHiME-7: Multi-domain, multi- microphone end-to-end and vector clustering diarization,","venue":null,"work_id":"11d5ce7d-21f9-4632-b380-0e62fedf3491","year":2024},"citing_paper":{"arxiv_id":"2505.24545","last_updated":"2025-05-30T12:53:27Z","snapshot_observed_at":"2026-08-07T12:16:25.508317Z","submitted_at":"2025-05-30T12:53:27Z","title":"Pretraining Multi-Speaker Identification for Neural Speaker Diarization","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T12:23:26.148077Z"},"links":{"citing_paper":"/paper/2505.24545"},"observation_digest":"sha256:69589fcdb02eb1e1fe823f8ab6c969242dfa41adac4942196470358cb79c6fa5","observation_id":"a57dcd30-dee0-4630-aebf-44ed39609dfa","resolution":{"observed_at":"2026-08-07T12:23:26.629779Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.24545","last_updated":"2025-05-30T12:53:27Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-07T12:16:25.508317Z","submitted_at":"2025-05-30T12:53:27Z","title":"Pretraining Multi-Speaker Identification for Neural Speaker Diarization"},"reference_resolution":{"displayed":42,"state_counts":{"malformed_identifier":2,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":9,"verified_exact":0,"verified_fuzzy":30},"total_outbound_references":42},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 42 of 42 outbound references and 1 inbound Pith citation observation for arXiv:2505.24545."}