{"as_of":"2026-08-09T06:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bd14605cecff85762c834849c54e347c5b35bda9f69a2ba60974f15c6512cfee","coverage":[{"denominator":52,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":52,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:21:58.204834Z","state":"measured"},{"denominator":53,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":53,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-09T15:07:52.715880Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-09T15:16:18.188094Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"cited_work":{"arxiv_id":"2506.14427","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.14427","snapshot_observed_at":"2026-07-09T15:16:18.188094Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","venue":"eess.AS","work_id":"db36c197-ca04-42f0-bb53-7e219303e575","year":2025},"citing_paper":{"arxiv_id":"2607.07294","last_updated":"2026-07-08T11:34:00Z","snapshot_observed_at":"2026-08-08T06:24:18.456938Z","submitted_at":"2026-07-08T11:34:00Z","title":"Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-09T15:07:52.715880Z"},"links":{"cited_paper":"/paper/2506.14427","citing_paper":"/paper/2607.07294"},"observation_digest":"sha256:eebcaad16ad050a7dd219c600b913917bbeae872d6207c0e9352d082e47310ee","observation_id":"627f9364-7480-480c-a8e3-e381cc071047","resolution":{"observed_at":"2026-07-09T15:16:18.189364Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.14427/citation-record","integrity":"/paper/2506.14427/integrity","json":"/paper/2506.14427/citation-record.json","paper":"/paper/2506.14427"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:22:13.584743Z","title":"A review of speaker diarization: Recent advances with deep learning,","venue":null,"work_id":"5d91e1f0-0108-4ba6-b20f-6326148dfe39","year":2022},"citing_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T00:21:50.470683Z"},"links":{"citing_paper":"/paper/2506.14427"},"observation_digest":"sha256:9098cdbef3f9436f9fdc4702159c3a6e568beb5ec1ee076d95b3d63022cda7d6","observation_id":"d3f82b19-44d6-435f-9c02-be0f261f38bb","resolution":{"observed_at":"2026-08-07T00:22:13.659626Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:22:13.373229Z","title":"Speaker diarization: A review of recent research,","venue":null,"work_id":"a01d96bf-80e4-4eed-8388-eac8367d6f5f","year":2012},"citing_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T00:21:50.640545Z"},"links":{"citing_paper":"/paper/2506.14427"},"observation_digest":"sha256:07ad6820379116bda87b8f8d66ccd9e1bbbfa099b4f73cefb8f90f71e17e3202","observation_id":"e13f9fe6-6fd1-4b5a-961a-4aeb8dd64713","resolution":{"observed_at":"2026-08-07T00:22:13.458552Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:22:13.156012Z","title":"Speaker diarization with lstm,","venue":null,"work_id":"2f290009-5ada-4fd0-a4b4-10e7b437f159","year":2018},"citing_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T00:21:50.787115Z"},"links":{"citing_paper":"/paper/2506.14427"},"observation_digest":"sha256:1033f57e8af36ea649346de948851a55ed2c2648d7711fd0cc66c9759e6e82da","observation_id":"ec32f24c-0d18-4624-b2e7-4f1c8a84a765","resolution":{"observed_at":"2026-08-07T00:22:13.238820Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:21:50.865767Z","title":"Front- end factor analysis for speaker verification,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T00:21:50.865767Z"},"links":{"citing_paper":"/paper/2506.14427"},"observation_digest":"sha256:6d56d23ba2dfb7b371fc7274a6581e312fcce2b2146c1ed73d35b3e96cbd6dd4","observation_id":"73ef4eec-b169-4a19-99fd-25a05bff166e","resolution":{"observed_at":"2026-08-07T00:21:50.865767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:22:12.843132Z","title":"X- vectors: Robust dnn embeddings for speaker recognition,","venue":null,"work_id":"67e39f1f-3a14-40e5-b4a9-18fc05857737","year":2018},"citing_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T00:21:51.002901Z"},"links":{"citing_paper":"/paper/2506.14427"},"observation_digest":"sha256:ceb89635194326f8b6042153cc75904a567e645b3db9138224acd3db227789a1","observation_id":"9c5e0ead-22dd-4f87-8f96-979565dfbea6","resolution":{"observed_at":"2026-08-07T00:22:12.974964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:22:12.495048Z","title":"Developing on-line speaker diarization system","venue":null,"work_id":"4efe856f-08ab-470d-a265-5ef246775228","year":2017},"citing_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T00:21:51.144910Z"},"links":{"citing_paper":"/paper/2506.14427"},"observation_digest":"sha256:414f361fe73956fb646ffbfee80066c49e5d2195b0d9941c3890a781b058b0f2","observation_id":"56007a15-7a95-4dad-9254-627bcce8099a","resolution":{"observed_at":"2026-08-07T00:22:12.703109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:22:12.080840Z","title":"A study of the cosine distance-based mean shift for telephone speech diarization,","venue":null,"work_id":"7540a336-ad50-47de-addf-431903cb81a8","year":2013},"citing_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T00:21:51.314753Z"},"links":{"citing_paper":"/paper/2506.14427"},"observation_digest":"sha256:2ceb522e64cc990ac23c11537530939f46180fdefef245959cb306b3df9dc7b7","observation_id":"1efab697-e996-43c9-b157-0884261e392a","resolution":{"observed_at":"2026-08-07T00:22:12.304830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:22:11.601836Z","title":"Speaker diarization with lstm,","venue":null,"work_id":"b4dd57e7-2ce5-4a4d-a526-04ae050482c4","year":2018},"citing_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T00:21:51.517631Z"},"links":{"citing_paper":"/paper/2506.14427"},"observation_digest":"sha256:6d53eba6b922cd1b73e7be223e6e4ecd7a487b4143ffddd2973325eab36701a3","observation_id":"09e744c1-aa83-4cfa-bc3a-41559e4f6828","resolution":{"observed_at":"2026-08-07T00:22:11.883861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:22:11.248168Z","title":"A robust stopping criterion for agglomerative hierarchical clustering in a speaker diarization system","venue":null,"work_id":"61fb5ede-1c68-4fcf-869b-5fa3a00ea75d","year":2007},"citing_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T00:21:51.731444Z"},"links":{"citing_paper":"/paper/2506.14427"},"observation_digest":"sha256:37afde4e34ed8ae7b1910488de12d32995e256462d32b44b53eea79d42738db9","observation_id":"fde14acd-eef8-4b76-a3dd-e02491bab023","resolution":{"observed_at":"2026-08-07T00:22:11.374824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:22:10.645811Z","title":"Characterizing performance of speaker diarization systems on far-field speech using standard methods,","venue":null,"work_id":"f9af5436-19bd-40e7-bfbc-cec678a5b280","year":2018},"citing_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T00:21:51.890542Z"},"links":{"citing_paper":"/paper/2506.14427"},"observation_digest":"sha256:c414115b31d024d9870bc49983bc2c45c995def5b8e5ecb6b49d29bcdd2894eb","observation_id":"ad39687d-62ea-4546-9eb8-9db7c3a523f3","resolution":{"observed_at":"2026-08-07T00:22:10.884984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:22:10.332439Z","title":"Discriminative neural clustering for speaker diarisation,","venue":null,"work_id":"da6fa763-76e1-4c4a-9560-ef7346e490b6","year":2021},"citing_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T00:21:52.094815Z"},"links":{"citing_paper":"/paper/2506.14427"},"observation_digest":"sha256:040e022fb58947f23db0fa1fd0a8aad8f913482f036f98375e04ce03192ccbfe","observation_id":"f87ca2c2-33fb-4503-8ebe-fe82f85839e9","resolution":{"observed_at":"2026-08-07T00:22:10.494758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:22:09.984749Z","title":"Bayesian hmm clustering of x-vector sequences (vbx) in speaker diarization: theory, implemen- tation and analysis on standard tasks,","venue":null,"work_id":"080ccc3b-9321-4ffb-bb57-343f14b0c019","year":2022},"citing_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T00:21:52.305116Z"},"links":{"citing_paper":"/paper/2506.14427"},"observation_digest":"sha256:5f13bdea0f12a53d679d4fe82a642b0e1500439920e34ecb1fe32bdcd1addd44","observation_id":"1799a67a-a6c6-4938-a63d-5af4012ce448","resolution":{"observed_at":"2026-08-07T00:22:10.129979Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:22:09.795887Z","title":"End-to-End Neural Speaker Diarization with Permutation-Free Objec- tives,","venue":null,"work_id":"ba9f8cbd-ccf6-4d69-8ff4-43a5a9340ae8","year":2019},"citing_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T00:21:52.444837Z"},"links":{"citing_paper":"/paper/2506.14427"},"observation_digest":"sha256:384c3eb6a41ea38245d58577955795685f4223852e5b6db14354d5713bd47c77","observation_id":"6c09ff5f-6367-4f97-b3af-add1a7bd70f9","resolution":{"observed_at":"2026-08-07T00:22:09.865817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:21:52.593916Z","title":"End-to-end neural speaker diarization with self-attention,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T00:21:52.593916Z"},"links":{"citing_paper":"/paper/2506.14427"},"observation_digest":"sha256:c5e8a03ae92d294ec31c7f34cc7b53b54f8c6f09e2a0608f9b5d235511282682","observation_id":"6962df6d-2f1d-46a9-b7ff-7e1488b08cd9","resolution":{"observed_at":"2026-08-07T00:21:52.593916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:22:09.458601Z","title":"Auxiliary loss of transformer with residual connection for end-to-end speaker diarization,","venue":null,"work_id":"336011a1-b4f0-4885-a92c-c32c4ae7cef1","year":2022},"citing_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T00:21:52.694892Z"},"links":{"citing_paper":"/paper/2506.14427"},"observation_digest":"sha256:e6f03f7ab8bb0c856c8fca9231784c1faebe08575f2d4843e50aab580ee968c0","observation_id":"7a66dfec-ffab-4768-bbe7-c47f87b803ec","resolution":{"observed_at":"2026-08-07T00:22:09.614817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:22:08.864846Z","title":"Incorporating end-to-end framework into target- speaker voice activity detection,","venue":null,"work_id":"daf0299c-2612-425e-91a3-311441dc2d70","year":2022},"citing_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T00:21:52.834754Z"},"links":{"citing_paper":"/paper/2506.14427"},"observation_digest":"sha256:9950d3e964bae1cd764a3544f92e137310a9dd26f3b3e9790e5448a36c6002a4","observation_id":"91d2595b-6fe6-4cd8-ac5e-ddf332add929","resolution":{"observed_at":"2026-08-07T00:22:09.328883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:22:08.385831Z","title":"Target-Speaker V oice Activity Detection: A Novel Approach for Multi-Speaker Diarization in a Dinner Party Scenario,","venue":null,"work_id":"944e1826-400e-4601-9e48-7656c1d3ace5","year":2020},"citing_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T00:21:52.935871Z"},"links":{"citing_paper":"/paper/2506.14427"},"observation_digest":"sha256:4c2c843ede563dd848717ef436371705fa41a429d2b15fe7e1ed9bfccfd29928","observation_id":"48b1ea25-89ef-42ed-8019-a486ea98782c","resolution":{"observed_at":"2026-08-07T00:22:08.528593Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:22:07.994765Z","title":"Ansd-ma-mse: Adaptive neural speaker diarization using memory-aware multi-speaker embed- ding,","venue":null,"work_id":"bcdfbb65-9cd7-4b2a-bbd3-3f2ac52edfa5","year":2023},"citing_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T00:21:53.134746Z"},"links":{"citing_paper":"/paper/2506.14427"},"observation_digest":"sha256:e5cb656237db37531cc3c69f196aa946822b931272f366f3df7cd20a4698e9fa","observation_id":"e72957de-844b-4af2-b005-b6d83bdb7240","resolution":{"observed_at":"2026-08-07T00:22:08.157893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13734","last_updated":"2023-07-14T09:45:21Z","snapshot_observed_at":"2026-07-06T15:46:06.220522Z","submitted_at":"2023-06-23T18:49:20Z","title":"The CHiME-7 DASR Challenge: Distant Meeting Transcription with Multiple Devices in Diverse Scenarios","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13734","snapshot_observed_at":"2026-08-07T00:21:53.248557Z","title":"The chime- 7 dasr challenge: Distant meeting transcription with multiple devices in diverse scenarios,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T00:21:53.248557Z"},"links":{"cited_paper":"/paper/2306.13734","citing_paper":"/paper/2506.14427"},"observation_digest":"sha256:1adb0e9ad9cb276ba1783125d703ebe1f649f10a0b1d32ec4a476cc3bd6cb119","observation_id":"2716b444-1e63-4fc5-9248-731d85914f91","resolution":{"observed_at":"2026-08-07T00:21:53.248557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:22:07.600591Z","title":"The ustc-nercslip systems for chime-7 challenge,","venue":null,"work_id":"6c4c1083-723f-4818-b4c3-acd19e9d7184","year":2023},"citing_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T00:21:53.427755Z"},"links":{"citing_paper":"/paper/2506.14427"},"observation_digest":"sha256:11ccdfdde9251de3aa234158ecb4caa83e22663b81cc8c8ea94c4faaa4f77cb6","observation_id":"8ff547e6-29f0-42fd-a60f-6f86231dddc2","resolution":{"observed_at":"2026-08-07T00:22:07.773098Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:22:07.453060Z","title":"Audio-visual speaker diarization based on spatiotemporal bayesian fusion,","venue":null,"work_id":"28a71f4c-5389-4db0-875d-53b7820455aa","year":2017},"citing_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T00:21:53.571500Z"},"links":{"citing_paper":"/paper/2506.14427"},"observation_digest":"sha256:e71966ddde1a0161b2524b12a3235b75fdb51d608a8aab539422a604cba0ecd0","observation_id":"bca27e2b-c9db-4d31-a9a3-d0314d2ed985","resolution":{"observed_at":"2026-08-07T00:22:07.537163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:22:07.184885Z","title":"Quantitative association of vocal-tract and facial behavior,","venue":null,"work_id":"c779484a-de98-47c6-b088-4f5d5a1fcdc4","year":1998},"citing_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T00:21:53.778190Z"},"links":{"citing_paper":"/paper/2506.14427"},"observation_digest":"sha256:a521f21c6674e2f6da58787a169e4752a63e2a50b25fd5e6668189ce68a70124","observation_id":"c773421d-5f15-4cde-850b-8864ec10fbf1","resolution":{"observed_at":"2026-08-07T00:22:07.309079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:22:06.969497Z","title":"Multimodal speaker diarization,","venue":null,"work_id":"8a17d53d-a027-45f0-a6f6-8592b4e7a079","year":2011},"citing_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T00:21:53.934772Z"},"links":{"citing_paper":"/paper/2506.14427"},"observation_digest":"sha256:088381ba6cf7a323045fb20d0c919f7e5915ac7d2fb8c0ba4ba44aa9c9ef6b40","observation_id":"e43a8855-a018-4c74-aa81-c275a07f6cf7","resolution":{"observed_at":"2026-08-07T00:22:07.064881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:22:06.617520Z","title":"Who said that?: Audio-visual speaker diarisation of real-world meetings,","venue":null,"work_id":"b9f43188-c13f-4c61-9c8b-92cea4786871","year":2019},"citing_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T00:21:54.094834Z"},"links":{"citing_paper":"/paper/2506.14427"},"observation_digest":"sha256:33092df1b53b7f8f019dfce131f623b081116c1757307673f908af602346ae97","observation_id":"ce9ae35e-a165-40e7-985d-40c08a73cb89","resolution":{"observed_at":"2026-08-07T00:22:06.764776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:22:06.294758Z","title":"Spot the conversation: Speaker diarisation in the wild,","venue":null,"work_id":"3e555924-6af6-4beb-ae76-6329cd0b2861","year":2020},"citing_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T00:21:54.254227Z"},"links":{"citing_paper":"/paper/2506.14427"},"observation_digest":"sha256:36db3e2c10e201cfb58e95dae83dc7f4d314250f54b971c81db3eef76bb7e756","observation_id":"2e95f8fa-c44d-44f1-87d8-08440b71e7b2","resolution":{"observed_at":"2026-08-07T00:22:06.436582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:22:05.798774Z","title":"End-to-end audio-visual neural speaker diarization,","venue":null,"work_id":"1d69cf39-873b-4c5b-b563-6f36ae03d8c0","year":2022},"citing_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T00:21:54.571101Z"},"links":{"citing_paper":"/paper/2506.14427"},"observation_digest":"sha256:9500889342841693ab31110911840f73226210fac7f5ad3f349a15b4f5a5e6bc","observation_id":"428b31c9-85f8-4f23-9c29-9dac8e0da984","resolution":{"observed_at":"2026-08-07T00:22:05.908267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08052","last_updated":"2025-07-31T10:50:49Z","snapshot_observed_at":"2026-08-09T02:11:53.896653Z","submitted_at":"2024-01-16T02:06:28Z","title":"Multi-Input Multi-Output Target-Speaker Voice Activity Detection For Unified, Flexible, and Robust Audio-Visual Speaker Diarization","version":3},"cited_work":{"arxiv_id":"2401.08052","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.08052","snapshot_observed_at":"2026-08-07T00:21:59.600878Z","title":"Multi-Input Multi-Output Target-Speaker Voice Activity Detection For Unified, Flexible, and Robust Audio-Visual Speaker Diarization","venue":"eess.AS","work_id":"ecab30e6-7498-4cb6-a64a-6b8655278b5f","year":2024},"citing_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T00:21:54.869454Z"},"links":{"cited_paper":"/paper/2401.08052","citing_paper":"/paper/2506.14427"},"observation_digest":"sha256:7167b9a500eaf722359f6a6ddb7bbbfac72c4b670773d4cb0f07615d58601bb6","observation_id":"c140ea81-7ae9-40be-b600-f63c29793861","resolution":{"observed_at":"2026-08-07T00:21:59.726773Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.22350","last_updated":"2024-10-15T05:48:30Z","snapshot_observed_at":"2026-08-03T14:22:05.833322Z","submitted_at":"2024-10-15T05:48:30Z","title":"Quality-Aware End-to-End Audio-Visual Neural Speaker Diarization","version":1},"cited_work":{"arxiv_id":"2410.22350","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.22350","snapshot_observed_at":"2026-08-07T00:21:59.227055Z","title":"Quality-Aware End-to-End Audio-Visual Neural Speaker Diarization","venue":"cs.MM","work_id":"52fd8f8e-bdae-445e-b82a-c019f98cd649","year":2024},"citing_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T00:21:55.024954Z"},"links":{"cited_paper":"/paper/2410.22350","citing_paper":"/paper/2506.14427"},"observation_digest":"sha256:c3bb52da2c7c9d26a55bc5f629a422e02b65935ccea8f14a5cbb85decfe59b8d","observation_id":"0fa53158-fd14-451c-907c-60b3a82249c7","resolution":{"observed_at":"2026-08-07T00:21:59.396178Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:22:05.461422Z","title":"Semi-supervised multi-channel speaker diarization with cross- channel attention,","venue":null,"work_id":"c7b70c82-a93c-4072-9caf-2305fabe3cc3","year":2023},"citing_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T00:21:55.124886Z"},"links":{"citing_paper":"/paper/2506.14427"},"observation_digest":"sha256:0ec4ce58b886213d0b439a6f4f38dbf8f55967cf4166e311830333f50e84be50","observation_id":"2ffe891a-1a73-45a7-907e-004876e43b21","resolution":{"observed_at":"2026-08-07T00:22:05.602331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:22:05.305383Z","title":"Aishell-4: An open source dataset for speech enhancement, separation, recognition and speaker diarization in conference scenario,","venue":null,"work_id":"2596af0d-c886-4093-b652-1242ae75e07e","year":2021},"citing_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T00:21:55.207393Z"},"links":{"citing_paper":"/paper/2506.14427"},"observation_digest":"sha256:982f4e9bdc4ae4c3d9c3599b425557a5edb1e5a6be4490f44666ec3861fce0a8","observation_id":"e1c36b09-1a9e-4a1b-8abf-6cfe9b2aafed","resolution":{"observed_at":"2026-08-07T00:22:05.349237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:22:05.015949Z","title":"Ava-avd: Audio-visual speaker diarization in the wild,","venue":null,"work_id":"a0adfa91-92b7-4a9b-b821-719b25d29a62","year":2022},"citing_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T00:21:55.324692Z"},"links":{"citing_paper":"/paper/2506.14427"},"observation_digest":"sha256:aae6b87a6abcab3834c062fb133b1505a264b0df231b5a6c83608536544fabc3","observation_id":"026db9a8-134e-4b29-b845-835258614c2c","resolution":{"observed_at":"2026-08-07T00:22:05.115533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:22:04.618941Z","title":"Semi-supervised training with pseudo-labeling for end- to-end neural diarization,","venue":null,"work_id":"f6fcad2f-0e8d-49fe-8988-d264ffb55874","year":2021},"citing_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T00:21:55.483931Z"},"links":{"citing_paper":"/paper/2506.14427"},"observation_digest":"sha256:34670ac397b4a5baddcc226575aed004139681d0d413a899abf8afd80cae8c1d","observation_id":"05fbe6af-a073-45db-bb76-3551a48e1ab3","resolution":{"observed_at":"2026-08-07T00:22:04.756713Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:22:04.152555Z","title":"Chime-6 challenge: Tackling multispeaker speech recognition for unsegmented recordings,","venue":null,"work_id":"b7dd7ef8-c878-4ac3-a046-0dcc1b1f9f56","year":2020},"citing_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T00:21:55.624749Z"},"links":{"citing_paper":"/paper/2506.14427"},"observation_digest":"sha256:feaa6e4754716aa41fc5c556e45f31f141a1dcb9d0a85032215fd555b7f54567","observation_id":"f4fd928c-abbd-4ec0-8ea1-5b27ae7b4a26","resolution":{"observed_at":"2026-08-07T00:22:04.309737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:22:03.814741Z","title":"The multimodal information based speech processing (misp) 2022 challenge: Audio- visual diarization and recognition,","venue":null,"work_id":"a0df532f-4e35-4f05-8605-375296c8f8ca","year":2022},"citing_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T00:21:55.784828Z"},"links":{"citing_paper":"/paper/2506.14427"},"observation_digest":"sha256:ec3abc9caf9545ebb25908b4792e147337c6955e648f9d8c1c2ea0135eb48688","observation_id":"ac8da1ae-9ff5-4ccc-b653-e77e25873ae7","resolution":{"observed_at":"2026-08-07T00:22:03.958320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:22:03.555759Z","title":"Notsofar-1 challenge: New datasets, baseline, and tasks for distant meeting transcription,","venue":null,"work_id":"aeca271b-836c-4420-b1c2-1fd1a21321ad","year":2024},"citing_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T00:21:55.902011Z"},"links":{"citing_paper":"/paper/2506.14427"},"observation_digest":"sha256:6d0b61ac436ed1f26fab3b9c9dc29b43ea3e06e810393d1ff3b411f1e2203bef","observation_id":"284f3f73-a188-42a9-86b4-331cfea318fa","resolution":{"observed_at":"2026-08-07T00:22:03.664897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:22:03.314743Z","title":"The nist speaker recognition evaluations: 1996-2001","venue":null,"work_id":"06cc0967-3aeb-43aa-ae8e-3cfa899cc913","year":1996},"citing_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T00:21:56.047128Z"},"links":{"citing_paper":"/paper/2506.14427"},"observation_digest":"sha256:391b7274af8d4b0394263e00a53a4fd0c2b9b7e62c2a00afed5a164df3e408bd","observation_id":"cedac64d-e72b-4cea-976f-faf267d75d7e","resolution":{"observed_at":"2026-08-07T00:22:03.410058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:22:03.133506Z","title":"First dihard challenge evaluation plan,","venue":null,"work_id":"b7fab959-602a-49ab-b5bd-f71fccd3e8f7","year":2018},"citing_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T00:21:56.162241Z"},"links":{"citing_paper":"/paper/2506.14427"},"observation_digest":"sha256:8296c128bccfde84c846004b3d4d700a4914d26f997da7bb104501852f9f9739","observation_id":"6dad5101-8ed9-4e39-b33c-813a367f287b","resolution":{"observed_at":"2026-08-07T00:22:03.186514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.07839","last_updated":"2019-06-18T23:04:09Z","snapshot_observed_at":"2026-07-06T08:01:15.989832Z","submitted_at":"2019-06-18T23:04:09Z","title":"The Second DIHARD Diarization Challenge: Dataset, task, and baselines","version":1},"cited_work":{"arxiv_id":"1906.07839","doi":null,"metadata_source":"pith","pith_arxiv_id":"1906.07839","snapshot_observed_at":"2026-08-07T00:21:58.794074Z","title":"The Second DIHARD Diarization Challenge: Dataset, task, and baselines","venue":"eess.AS","work_id":"372f86ac-b03b-4101-9890-1c654ca339e8","year":2019},"citing_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T00:21:56.288230Z"},"links":{"cited_paper":"/paper/1906.07839","citing_paper":"/paper/2506.14427"},"observation_digest":"sha256:9b8fcdf4f7496e8ffcca6a1acad9e99affbd421e2d359f825fec5d2425131762","observation_id":"68cf3cf7-1053-4eba-8bcb-860721340f5e","resolution":{"observed_at":"2026-08-07T00:21:58.984753Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.01477","last_updated":"2021-04-05T17:23:19Z","snapshot_observed_at":"2026-08-09T01:50:18.004960Z","submitted_at":"2020-12-02T19:33:44Z","title":"The Third DIHARD Diarization Challenge","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.01477","snapshot_observed_at":"2026-08-07T00:21:56.433967Z","title":"The third dihard diarization challenge,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T00:21:56.433967Z"},"links":{"cited_paper":"/paper/2012.01477","citing_paper":"/paper/2506.14427"},"observation_digest":"sha256:532e4ce48e6901f5fa6580bc125dd0a51a9e101ad9865536935c4d27590ea5a1","observation_id":"7b1e1bb5-efde-4eee-9410-07ad6e9434eb","resolution":{"observed_at":"2026-08-07T00:21:56.433967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:22:02.754798Z","title":"M2met: The icassp 2022 multi- channel multi-party meeting transcription challenge,","venue":null,"work_id":"6d0a0e91-edb2-4c17-acf7-3ee2ca40655c","year":2022},"citing_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T00:21:56.562953Z"},"links":{"citing_paper":"/paper/2506.14427"},"observation_digest":"sha256:23d7880c4245413fe704830bfd2a0581cfc71735834ce1775e5ef6092051fc8d","observation_id":"5daffbd3-c75b-4dee-adf6-aea506583848","resolution":{"observed_at":"2026-08-07T00:22:02.864740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:22:02.468667Z","title":"The ami meeting corpus,","venue":null,"work_id":"daa77022-d0c2-4b18-a5e2-b0054fcf99d3","year":2005},"citing_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T00:21:56.667720Z"},"links":{"citing_paper":"/paper/2506.14427"},"observation_digest":"sha256:2fcea64047602e658970256a62b40dfd2badafad640be7d9e985d683fb32c054","observation_id":"f88caf64-7715-4f24-94b6-681e862c35be","resolution":{"observed_at":"2026-08-07T00:22:02.615362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13971","last_updated":"2025-05-27T05:03:46Z","snapshot_observed_at":"2026-08-08T08:23:35.619235Z","submitted_at":"2025-05-20T06:11:51Z","title":"The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13971","snapshot_observed_at":"2026-08-07T00:21:56.777201Z","title":"The multimodal information based speech processing (misp) 2025 challenge: Audio-visual diarization and recognition,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T00:21:56.777201Z"},"links":{"cited_paper":"/paper/2505.13971","citing_paper":"/paper/2506.14427"},"observation_digest":"sha256:623398c14538e0ead60c50f767bcbfb2c05db6a2ab0e7b721c041fed0db25911","observation_id":"dca6c443-3407-4b0b-92fb-977eb884cbde","resolution":{"observed_at":"2026-08-07T00:21:56.777201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:22:02.175762Z","title":"Msdwild: Multi-modal speaker diarization dataset in the wild","venue":null,"work_id":"6a1ba3c1-0d15-4ae4-8d28-8f3a6cd41205","year":2022},"citing_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T00:21:56.893682Z"},"links":{"citing_paper":"/paper/2506.14427"},"observation_digest":"sha256:9b300b9871bf746d7854ea4f19781ec9543cc5e8711fb10424ecc7c8493a662f","observation_id":"5438a602-d4a0-4270-b8f1-af5dabe50ec5","resolution":{"observed_at":"2026-08-07T00:22:02.314881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:22:01.944839Z","title":"An approach to scene change detection,","venue":null,"work_id":"9a689d94-de87-433b-9481-d72707e782ce","year":2021},"citing_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T00:21:56.984747Z"},"links":{"citing_paper":"/paper/2506.14427"},"observation_digest":"sha256:18dca5be22e7c4ab11cb2d6ea614b39dcaa389d7c3c48ce1dbda124da8d07ecd","observation_id":"17e3e495-23e7-4b84-b33e-6598d3733f73","resolution":{"observed_at":"2026-08-07T00:22:02.056694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:22:01.650711Z","title":"Dnsmos p. 835: A non- intrusive perceptual objective speech quality metric to evaluate noise suppressors,","venue":null,"work_id":"1c16c6d2-c06a-46ff-acb9-ceb6c33786c2","year":2022},"citing_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T00:21:57.111910Z"},"links":{"citing_paper":"/paper/2506.14427"},"observation_digest":"sha256:8ee68113413c0f7d22b41fab2b4dc51c1b15cd965a96f1ea3178f1237ee6b010","observation_id":"d947b473-73bc-4c55-b50d-545945fa1c29","resolution":{"observed_at":"2026-08-07T00:22:01.804829Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:22:01.401925Z","title":"Md-vqa: Multi-dimensional quality assessment for ugc live videos,","venue":null,"work_id":"378a7277-1778-4c71-82bb-6fdb799db8f6","year":2023},"citing_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T00:21:57.220765Z"},"links":{"citing_paper":"/paper/2506.14427"},"observation_digest":"sha256:e7e0d2191f1e922ab425624f52717c212a4bab5a90cff1cede67add2caffeda1","observation_id":"b6875ee2-91e5-4828-9401-ffd2f0c4e60b","resolution":{"observed_at":"2026-08-07T00:22:01.506885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:22:01.179739Z","title":"Out of time: automated lip sync in the wild,","venue":null,"work_id":"84bf16d5-aba3-4923-a8ff-496443a41a0e","year":2016},"citing_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T00:21:57.380226Z"},"links":{"citing_paper":"/paper/2506.14427"},"observation_digest":"sha256:1f3dab3153be82470952ae6dc5f343f5474de18007d10708fee8d88b2d70befc","observation_id":"c6a24fa6-3ee0-42bd-a628-9d00325f3f8b","resolution":{"observed_at":"2026-08-07T00:22:01.255798Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:22:00.894544Z","title":"Retinaface: Single-shot multi-level face localisation in the wild,","venue":null,"work_id":"c5a04e21-88f5-4af1-9604-0d2dc0f883f9","year":2020},"citing_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T00:21:57.559593Z"},"links":{"citing_paper":"/paper/2506.14427"},"observation_digest":"sha256:65bc43cd8cb9af5de3fa47cd6b6ad92d49a186d1ea749dd4fcfd2c38ebb20a8a","observation_id":"8a3154c0-925e-43c5-bf15-519b2d0f01ca","resolution":{"observed_at":"2026-08-07T00:22:00.979743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:22:00.624748Z","title":"Simple online and realtime tracking with a deep association metric,","venue":null,"work_id":"badd624a-81f8-4107-bd68-627274596d0b","year":2017},"citing_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T00:21:57.702925Z"},"links":{"citing_paper":"/paper/2506.14427"},"observation_digest":"sha256:fab4d0f746543022f6dbefa54bf95c9f87dd87aee782bd0e8bd77200fb26999e","observation_id":"6c5c5a94-fc8e-4f58-be3c-5990295ce602","resolution":{"observed_at":"2026-08-07T00:22:00.738802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.08172","last_updated":"2019-06-14T05:49:22Z","snapshot_observed_at":"2026-08-05T19:15:35.517082Z","submitted_at":"2019-06-14T05:49:22Z","title":"MediaPipe: A Framework for Building Perception Pipelines","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.08172","snapshot_observed_at":"2026-08-07T00:21:57.834750Z","title":"Mediapipe: A framework for building perception pipelines,","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T00:21:57.834750Z"},"links":{"cited_paper":"/paper/1906.08172","citing_paper":"/paper/2506.14427"},"observation_digest":"sha256:47322d5f852a96e4703d7e03c7776d8bff90cd1900ebcd502c67114c4ca6baf8","observation_id":"a6efce1f-5493-45e2-acdb-574c78d25f91","resolution":{"observed_at":"2026-08-07T00:21:57.834750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:22:00.364751Z","title":"3d-speaker-toolkit: An open-source toolkit for multimodal speaker verification and diarization,","venue":null,"work_id":"3ad3d72f-74fb-4842-9c9a-97b0aa744504","year":2025},"citing_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T00:21:58.044836Z"},"links":{"citing_paper":"/paper/2506.14427"},"observation_digest":"sha256:006228aa0412d07291e433111fe3cdb9181177df8fbe1e4d7f04fb04b3f7b136","observation_id":"7e4dfd2a-1d75-4bae-a506-09f2c1823712","resolution":{"observed_at":"2026-08-07T00:22:00.464756Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:22:00.146674Z","title":"Dover-lap: A method for combining overlap- aware diarization outputs,","venue":null,"work_id":"14e3e625-488f-45a4-b598-63d928f4923f","year":2021},"citing_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T00:21:58.204834Z"},"links":{"citing_paper":"/paper/2506.14427"},"observation_digest":"sha256:72fba884156fdc9faed88bb16af70e8855181830fe7f332fd9aaa3eee9b77d83","observation_id":"10058e43-5b10-47f4-b6a0-c3e06c096d82","resolution":{"observed_at":"2026-08-07T00:22:00.209099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","latest_version":2,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset"},"reference_resolution":{"displayed":52,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":6,"verified_exact":3,"verified_fuzzy":43},"total_outbound_references":52},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 1 inbound Pith citation observation for arXiv:2506.14427."}