{"as_of":"2026-08-13T16:23:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ea45d46836ab1efe29869d17eb82f5e0e7d9bd8fe5e74867a6cd35a7e7c7eab1","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T11:30:39.417629Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.18152/citation-record","integrity":"/paper/2411.18152/integrity","json":"/paper/2411.18152/citation-record.json","paper":"/paper/2411.18152"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:30:39.866855Z","title":"Mul- timodal people id for a multimedia meeting browser,","venue":null,"work_id":"69264fc4-4f5e-4d59-98bd-402a4dbdc04b","year":1999},"citing_paper":{"arxiv_id":"2411.18152","last_updated":"2025-01-15T15:34:13Z","snapshot_observed_at":"2026-08-12T11:25:41.317705Z","submitted_at":"2024-11-27T09:01:08Z","title":"MSA-ASR: Efficient Multilingual Speaker Attribution with frozen ASR Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:39.287041Z"},"links":{"citing_paper":"/paper/2411.18152"},"observation_digest":"sha256:ae926ae2d37b6d4322e1776ce6ba300e71b4ad6161cac86b49c855563baf85e9","observation_id":"51d052de-8e1f-4d1a-a84c-71403b68ae9c","resolution":{"observed_at":"2026-08-12T11:30:39.870937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:30:39.854366Z","title":"Towards a multimodal meeting record,","venue":null,"work_id":"dec75c2b-ff1a-4231-9f74-e4715afed5f9","year":2000},"citing_paper":{"arxiv_id":"2411.18152","last_updated":"2025-01-15T15:34:13Z","snapshot_observed_at":"2026-08-12T11:25:41.317705Z","submitted_at":"2024-11-27T09:01:08Z","title":"MSA-ASR: Efficient Multilingual Speaker Attribution with frozen ASR Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:39.291444Z"},"links":{"citing_paper":"/paper/2411.18152"},"observation_digest":"sha256:da380d0de215cf0031e6a8a4ca4c84986dfaaa061bb6429708725580ca5c98e0","observation_id":"d0c26278-0a66-4e9b-8473-9160739f552c","resolution":{"observed_at":"2026-08-12T11:30:39.859605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:30:39.842021Z","title":"Estimating focus of attention based on gaze and sound,","venue":null,"work_id":"65f69e1a-a643-4c07-b77f-bfdc90726180","year":2001},"citing_paper":{"arxiv_id":"2411.18152","last_updated":"2025-01-15T15:34:13Z","snapshot_observed_at":"2026-08-12T11:25:41.317705Z","submitted_at":"2024-11-27T09:01:08Z","title":"MSA-ASR: Efficient Multilingual Speaker Attribution with frozen ASR Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:39.295516Z"},"links":{"citing_paper":"/paper/2411.18152"},"observation_digest":"sha256:cbf518ff81973e75c4316a48fc5fc894dcc57620971ac26f3e5c637efdbc58e1","observation_id":"b9877797-a978-46e5-bda5-1c6e18a9015d","resolution":{"observed_at":"2026-08-12T11:30:39.846495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:30:39.829369Z","title":"Estimating focus of attention based on gaze and sound,","venue":null,"work_id":"b85a5f08-518c-4ee4-b984-92a49b7aa31b","year":2001},"citing_paper":{"arxiv_id":"2411.18152","last_updated":"2025-01-15T15:34:13Z","snapshot_observed_at":"2026-08-12T11:25:41.317705Z","submitted_at":"2024-11-27T09:01:08Z","title":"MSA-ASR: Efficient Multilingual Speaker Attribution with frozen ASR Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:39.299284Z"},"links":{"citing_paper":"/paper/2411.18152"},"observation_digest":"sha256:aaeb797eb488513ac4813c3e1cccf8a4bafafdcee751c6c650e66d70dcbe054e","observation_id":"d14c4476-d5b6-49a0-a78e-ef0ac395d090","resolution":{"observed_at":"2026-08-12T11:30:39.833442Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:30:39.816988Z","title":"Chil: Computers in the human interaction loop,","venue":null,"work_id":"fb5fee42-6a79-4320-b85d-9eb55532819d","year":2005},"citing_paper":{"arxiv_id":"2411.18152","last_updated":"2025-01-15T15:34:13Z","snapshot_observed_at":"2026-08-12T11:25:41.317705Z","submitted_at":"2024-11-27T09:01:08Z","title":"MSA-ASR: Efficient Multilingual Speaker Attribution with frozen ASR Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:39.303374Z"},"links":{"citing_paper":"/paper/2411.18152"},"observation_digest":"sha256:f07c5ab1c3880667f9dabd31523877d915ba200acbb068eb338209f9cf0d539e","observation_id":"0c9044f3-f4b6-4a2f-9263-5b3b92b29d83","resolution":{"observed_at":"2026-08-12T11:30:39.821133Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:30:39.802899Z","title":"Simultaneous translation of open domain lectures and speeches,","venue":null,"work_id":"5449fa91-7665-48e0-8418-9bd705148a53","year":2012},"citing_paper":{"arxiv_id":"2411.18152","last_updated":"2025-01-15T15:34:13Z","snapshot_observed_at":"2026-08-12T11:25:41.317705Z","submitted_at":"2024-11-27T09:01:08Z","title":"MSA-ASR: Efficient Multilingual Speaker Attribution with frozen ASR Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:39.307274Z"},"links":{"citing_paper":"/paper/2411.18152"},"observation_digest":"sha256:6903697fc35fb590c9c03ea8ad1354d401cb95eb24c22e704146c7ab88b6d564","observation_id":"0b46f92e-f25c-49ec-8822-02e789ebc894","resolution":{"observed_at":"2026-08-12T11:30:39.808101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:30:39.790995Z","title":"Integration of speech separation, diarization, and recognition for multi-speaker meetings: System de- scription, comparison, and analysis,","venue":null,"work_id":"475a15c8-4ef8-4d46-ae9b-161d02db80b8","year":2021},"citing_paper":{"arxiv_id":"2411.18152","last_updated":"2025-01-15T15:34:13Z","snapshot_observed_at":"2026-08-12T11:25:41.317705Z","submitted_at":"2024-11-27T09:01:08Z","title":"MSA-ASR: Efficient Multilingual Speaker Attribution with frozen ASR Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:39.311868Z"},"links":{"citing_paper":"/paper/2411.18152"},"observation_digest":"sha256:157575911935bb0a8b91f92882fc02de90eeb77c94bd2b4c7db9ede1faba9534","observation_id":"810b8fec-0165-498d-b329-b7d96f6f3d4c","resolution":{"observed_at":"2026-08-12T11:30:39.795278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:30:39.778351Z","title":"A comparative study of modular and joint approaches for speaker-attributed asr on monaural long-form audio,","venue":null,"work_id":"536c4432-459a-40a8-8343-4f558779794b","year":2021},"citing_paper":{"arxiv_id":"2411.18152","last_updated":"2025-01-15T15:34:13Z","snapshot_observed_at":"2026-08-12T11:25:41.317705Z","submitted_at":"2024-11-27T09:01:08Z","title":"MSA-ASR: Efficient Multilingual Speaker Attribution with frozen ASR Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:39.315470Z"},"links":{"citing_paper":"/paper/2411.18152"},"observation_digest":"sha256:84840d8f01fb61b449d08e2297c236abd5f68ace07f59ae95322565117bdc86e","observation_id":"f49bbed3-c36a-404d-a1f1-1bcc49b97110","resolution":{"observed_at":"2026-08-12T11:30:39.783014Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:30:39.766307Z","title":"Improving speaker assignment in speaker-attributed asr for real meeting applications,","venue":null,"work_id":"5d14a9b3-f5d9-4c5a-871b-fdbe77ed3ba6","year":2024},"citing_paper":{"arxiv_id":"2411.18152","last_updated":"2025-01-15T15:34:13Z","snapshot_observed_at":"2026-08-12T11:25:41.317705Z","submitted_at":"2024-11-27T09:01:08Z","title":"MSA-ASR: Efficient Multilingual Speaker Attribution with frozen ASR Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:39.319005Z"},"links":{"citing_paper":"/paper/2411.18152"},"observation_digest":"sha256:63fc3e2096ed261423098004958b9bd128a91dfe00ecbef3ef3256e18582c0f0","observation_id":"ac48bc19-296f-4be7-8f81-9ac4012dfc36","resolution":{"observed_at":"2026-08-12T11:30:39.770364Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:30:39.755268Z","title":"A Comparative Study on Speaker-attributed Automatic Speech Recognition in Multi-party Meetings,","venue":null,"work_id":"494651af-2d22-4e84-87fd-b7a095a8e48e","year":2022},"citing_paper":{"arxiv_id":"2411.18152","last_updated":"2025-01-15T15:34:13Z","snapshot_observed_at":"2026-08-12T11:25:41.317705Z","submitted_at":"2024-11-27T09:01:08Z","title":"MSA-ASR: Efficient Multilingual Speaker Attribution with frozen ASR Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:39.322731Z"},"links":{"citing_paper":"/paper/2411.18152"},"observation_digest":"sha256:f631ec23803aad2559b568229110762909130fc7398b4ac103f1cbc206ac5985","observation_id":"7ab44f07-89c0-4696-a44e-6ad9bbb89e7f","resolution":{"observed_at":"2026-08-12T11:30:39.759262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:30:39.742853Z","title":"Convoifilter: A case study of doing cock- tail party speech recognition,","venue":null,"work_id":"c128b315-cb07-4a4c-b79b-057c4f4eae05","year":2024},"citing_paper":{"arxiv_id":"2411.18152","last_updated":"2025-01-15T15:34:13Z","snapshot_observed_at":"2026-08-12T11:25:41.317705Z","submitted_at":"2024-11-27T09:01:08Z","title":"MSA-ASR: Efficient Multilingual Speaker Attribution with frozen ASR Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:39.326289Z"},"links":{"citing_paper":"/paper/2411.18152"},"observation_digest":"sha256:843650815e784f03c3d370a5061d9cfb3f61468fc4902025b6b4728d526edb72","observation_id":"d1f9edea-50a5-4a9c-9fd3-2bb7717d18ba","resolution":{"observed_at":"2026-08-12T11:30:39.747118Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:30:39.729633Z","title":"Investigation of end-to-end speaker-attributed asr for continuous multi-talker recordings,","venue":null,"work_id":"40da6385-2f80-418d-b523-04e837a9232a","year":2021},"citing_paper":{"arxiv_id":"2411.18152","last_updated":"2025-01-15T15:34:13Z","snapshot_observed_at":"2026-08-12T11:25:41.317705Z","submitted_at":"2024-11-27T09:01:08Z","title":"MSA-ASR: Efficient Multilingual Speaker Attribution with frozen ASR Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:39.329971Z"},"links":{"citing_paper":"/paper/2411.18152"},"observation_digest":"sha256:69a2859fec7cb053dcf807ff83bbe2b02578b5b491dbcac601b4d608dc17a24f","observation_id":"990cfb95-ed10-4702-8dc4-e7ead7b9fbf5","resolution":{"observed_at":"2026-08-12T11:30:39.734483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:30:39.715450Z","title":"Transcribe-to-diarize: Neural speaker diarization for unlimited number of speakers using end-to-end speaker-attributed asr,","venue":null,"work_id":"3b9e8e00-772d-48a7-94c3-8db2daa15189","year":2022},"citing_paper":{"arxiv_id":"2411.18152","last_updated":"2025-01-15T15:34:13Z","snapshot_observed_at":"2026-08-12T11:25:41.317705Z","submitted_at":"2024-11-27T09:01:08Z","title":"MSA-ASR: Efficient Multilingual Speaker Attribution with frozen ASR Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:39.333717Z"},"links":{"citing_paper":"/paper/2411.18152"},"observation_digest":"sha256:8ded7e73bb447d38c994dee89988e4921d1d4d40a9a34c85bd7eec049d938d57","observation_id":"1bb4c1f2-ae08-414d-a1db-53c853c1461d","resolution":{"observed_at":"2026-08-12T11:30:39.719689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:30:39.703869Z","title":"Streaming speaker-attributed asr with token-level speaker embeddings,","venue":null,"work_id":"7af5eb67-3046-40e2-a53f-d96a6cb56283","year":2022},"citing_paper":{"arxiv_id":"2411.18152","last_updated":"2025-01-15T15:34:13Z","snapshot_observed_at":"2026-08-12T11:25:41.317705Z","submitted_at":"2024-11-27T09:01:08Z","title":"MSA-ASR: Efficient Multilingual Speaker Attribution with frozen ASR Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:39.337117Z"},"links":{"citing_paper":"/paper/2411.18152"},"observation_digest":"sha256:0b13ec53f819cd044618f6ad245d77435c08cd5708c28f7a419fa31c2a61903d","observation_id":"56b43b74-8a30-453a-a65a-a27e25b7fe92","resolution":{"observed_at":"2026-08-12T11:30:39.707780Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:30:39.692350Z","title":"Sa- paraformer: Non-autoregressive end-to-end speaker-attributed asr,","venue":null,"work_id":"bafcdd73-5564-4d1a-8886-7430de8194df","year":2023},"citing_paper":{"arxiv_id":"2411.18152","last_updated":"2025-01-15T15:34:13Z","snapshot_observed_at":"2026-08-12T11:25:41.317705Z","submitted_at":"2024-11-27T09:01:08Z","title":"MSA-ASR: Efficient Multilingual Speaker Attribution with frozen ASR Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:39.340623Z"},"links":{"citing_paper":"/paper/2411.18152"},"observation_digest":"sha256:dd5bde48bfc9909b2204c55763ecc049d90fbe1c0fe5e74f46fbd89805ff0c64","observation_id":"e05daba3-6c98-4730-a5cc-6ba2b14607c6","resolution":{"observed_at":"2026-08-12T11:30:39.696634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:30:39.680923Z","title":"End-to-End Speaker-Attributed ASR with Transformer,","venue":null,"work_id":"f286f0ff-9ba9-443e-94e4-1121184b8d71","year":2021},"citing_paper":{"arxiv_id":"2411.18152","last_updated":"2025-01-15T15:34:13Z","snapshot_observed_at":"2026-08-12T11:25:41.317705Z","submitted_at":"2024-11-27T09:01:08Z","title":"MSA-ASR: Efficient Multilingual Speaker Attribution with frozen ASR Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:39.344006Z"},"links":{"citing_paper":"/paper/2411.18152"},"observation_digest":"sha256:2bf2fe33b09e2747a74bb7ce4a0034dc182b2f3ae8e7139e6c1aa80b63808364","observation_id":"4b6a1525-b119-4024-a1c3-ed32e9f66022","resolution":{"observed_at":"2026-08-12T11:30:39.684789Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:30:39.669890Z","title":"CASA-ASR: Context-Aware Speaker-Attributed ASR,","venue":null,"work_id":"29996399-e3af-45c3-bcad-66dbd244c260","year":2023},"citing_paper":{"arxiv_id":"2411.18152","last_updated":"2025-01-15T15:34:13Z","snapshot_observed_at":"2026-08-12T11:25:41.317705Z","submitted_at":"2024-11-27T09:01:08Z","title":"MSA-ASR: Efficient Multilingual Speaker Attribution with frozen ASR Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:39.347327Z"},"links":{"citing_paper":"/paper/2411.18152"},"observation_digest":"sha256:61a929534010faa7fc9f2272bb85577b7ff0a3233655e9b400a3433e7f427291","observation_id":"a1a9acdc-7da6-4db9-a0f0-a87255e1e24e","resolution":{"observed_at":"2026-08-12T11:30:39.673764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:30:39.350468Z","title":"One model to rule them all? towards end-to-end joint speaker diarization and speech recognition,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18152","last_updated":"2025-01-15T15:34:13Z","snapshot_observed_at":"2026-08-12T11:25:41.317705Z","submitted_at":"2024-11-27T09:01:08Z","title":"MSA-ASR: Efficient Multilingual Speaker Attribution with frozen ASR Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:39.350468Z"},"links":{"citing_paper":"/paper/2411.18152"},"observation_digest":"sha256:2c22a50dfdc567d68757cef140ee58b1e94abc6479447d932694727c422d8a53","observation_id":"86b0c70a-df67-4eaa-92fc-7de8b133464d","resolution":{"observed_at":"2026-08-12T11:30:39.350468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:30:39.354036Z","title":"Robust speech recognition via large-scale weak supervi- sion,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18152","last_updated":"2025-01-15T15:34:13Z","snapshot_observed_at":"2026-08-12T11:25:41.317705Z","submitted_at":"2024-11-27T09:01:08Z","title":"MSA-ASR: Efficient Multilingual Speaker Attribution with frozen ASR Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:39.354036Z"},"links":{"citing_paper":"/paper/2411.18152"},"observation_digest":"sha256:3328019a9a402bbfe4d4d344cb67a582d082cfdce099c550fb21dc9e64680098","observation_id":"698017b1-cc6c-443c-a994-19d89f241525","resolution":{"observed_at":"2026-08-12T11:30:39.354036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:30:39.642736Z","title":"Speaker identification using mul- tilingual phone strings,","venue":null,"work_id":"02eaf517-bf58-458a-9267-a8204dc04e17","year":2002},"citing_paper":{"arxiv_id":"2411.18152","last_updated":"2025-01-15T15:34:13Z","snapshot_observed_at":"2026-08-12T11:25:41.317705Z","submitted_at":"2024-11-27T09:01:08Z","title":"MSA-ASR: Efficient Multilingual Speaker Attribution with frozen ASR Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:39.357755Z"},"links":{"citing_paper":"/paper/2411.18152"},"observation_digest":"sha256:796567a17ecea2c9f2442ec120f2a0a2c1f2d8a20a946abde59076db81e8497f","observation_id":"2c0fe57b-d986-40fb-93ae-78b91801d6e8","resolution":{"observed_at":"2026-08-12T11:30:39.646703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:30:39.630693Z","title":"Phonetic speaker identification","venue":null,"work_id":"5dd4427b-9446-4b7e-a434-8b8977f13b8a","year":2002},"citing_paper":{"arxiv_id":"2411.18152","last_updated":"2025-01-15T15:34:13Z","snapshot_observed_at":"2026-08-12T11:25:41.317705Z","submitted_at":"2024-11-27T09:01:08Z","title":"MSA-ASR: Efficient Multilingual Speaker Attribution with frozen ASR Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:39.361230Z"},"links":{"citing_paper":"/paper/2411.18152"},"observation_digest":"sha256:bab09c1c84e01bdcb1e53cc186db201fb7432404494e2a1fa6ad0deb998ef43c","observation_id":"0d87146a-02c9-4d9a-bb4c-9e461472c8e7","resolution":{"observed_at":"2026-08-12T11:30:39.634781Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:30:39.617269Z","title":"How multilingual is multilingual BERT?","venue":null,"work_id":"d8181098-d255-41f1-b09b-23bf10dd45e7","year":2019},"citing_paper":{"arxiv_id":"2411.18152","last_updated":"2025-01-15T15:34:13Z","snapshot_observed_at":"2026-08-12T11:25:41.317705Z","submitted_at":"2024-11-27T09:01:08Z","title":"MSA-ASR: Efficient Multilingual Speaker Attribution with frozen ASR Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:39.365640Z"},"links":{"citing_paper":"/paper/2411.18152"},"observation_digest":"sha256:3a778007dd1422ce478c745883da45601b62ef96ec73fe01fde3df159e3a3369","observation_id":"4ba8bfcf-b3f7-4291-8b66-5578696b26d4","resolution":{"observed_at":"2026-08-12T11:30:39.621623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:30:39.605399Z","title":"Synthetic conversations improve multi- talker asr,","venue":null,"work_id":"261bf5bb-f465-4ac7-8b60-dceec9088c2d","year":2024},"citing_paper":{"arxiv_id":"2411.18152","last_updated":"2025-01-15T15:34:13Z","snapshot_observed_at":"2026-08-12T11:25:41.317705Z","submitted_at":"2024-11-27T09:01:08Z","title":"MSA-ASR: Efficient Multilingual Speaker Attribution with frozen ASR Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:39.369810Z"},"links":{"citing_paper":"/paper/2411.18152"},"observation_digest":"sha256:ef81ea277157453541c4c6ab6cf0a095495ac9552f48d2dc7075cfec399fb8a5","observation_id":"bf424552-c899-41e2-b469-a74f2ae97292","resolution":{"observed_at":"2026-08-12T11:30:39.609367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:30:39.593212Z","title":"Simulating realistic speech overlaps improves multi- talker asr,","venue":null,"work_id":"f1165430-6e37-49ff-ab11-be136812d25c","year":2023},"citing_paper":{"arxiv_id":"2411.18152","last_updated":"2025-01-15T15:34:13Z","snapshot_observed_at":"2026-08-12T11:25:41.317705Z","submitted_at":"2024-11-27T09:01:08Z","title":"MSA-ASR: Efficient Multilingual Speaker Attribution with frozen ASR Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:39.373452Z"},"links":{"citing_paper":"/paper/2411.18152"},"observation_digest":"sha256:b4183858fa66553bddf6c7b1bb0b1cea307a9e67e412b8820ad4e797610a27ce","observation_id":"e341851f-4244-4a11-960b-812d46934aba","resolution":{"observed_at":"2026-08-12T11:30:39.597429Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:30:39.581022Z","title":"Overlaps and gender analysis in the context of broadcast media,","venue":null,"work_id":"a4a03ba5-02b7-428f-9f86-59af1221ee77","year":2022},"citing_paper":{"arxiv_id":"2411.18152","last_updated":"2025-01-15T15:34:13Z","snapshot_observed_at":"2026-08-12T11:25:41.317705Z","submitted_at":"2024-11-27T09:01:08Z","title":"MSA-ASR: Efficient Multilingual Speaker Attribution with frozen ASR Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:39.377197Z"},"links":{"citing_paper":"/paper/2411.18152"},"observation_digest":"sha256:7d7d6f9a93d3cdf12e3fc656f3617a12eae4efa6588ca223d096157931cf2625","observation_id":"35783a24-0f3d-49ae-bef8-922ecdceaded","resolution":{"observed_at":"2026-08-12T11:30:39.585043Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:30:39.568691Z","title":"Detecting double-talk (overlapping speech) in conversations using deep learning,","venue":null,"work_id":"e0d17d5d-6bd1-436e-89e0-690d07c2d732","year":2017},"citing_paper":{"arxiv_id":"2411.18152","last_updated":"2025-01-15T15:34:13Z","snapshot_observed_at":"2026-08-12T11:25:41.317705Z","submitted_at":"2024-11-27T09:01:08Z","title":"MSA-ASR: Efficient Multilingual Speaker Attribution with frozen ASR Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:39.380784Z"},"links":{"citing_paper":"/paper/2411.18152"},"observation_digest":"sha256:ff3e70858d683063ab964a1daf6f7758634fcdee2398f6d3c9fbf80929e0d4cb","observation_id":"ac3d53bb-0e97-4022-8a27-db3962160082","resolution":{"observed_at":"2026-08-12T11:30:39.573212Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:30:39.556722Z","title":"Detecting and counting overlapping speakers in distant speech scenarios,","venue":null,"work_id":"b868751f-beae-4165-bd59-e7bf391c3190","year":2020},"citing_paper":{"arxiv_id":"2411.18152","last_updated":"2025-01-15T15:34:13Z","snapshot_observed_at":"2026-08-12T11:25:41.317705Z","submitted_at":"2024-11-27T09:01:08Z","title":"MSA-ASR: Efficient Multilingual Speaker Attribution with frozen ASR Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:39.384474Z"},"links":{"citing_paper":"/paper/2411.18152"},"observation_digest":"sha256:3befa4540446675ef4b99cfa9b85587b423535680c325fd8f91a60a9a0f6e212","observation_id":"bc7b08d2-2ec7-49b7-bedb-4f5c33134285","resolution":{"observed_at":"2026-08-12T11:30:39.560819Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:30:39.542393Z","title":"A comparison of metric learning loss functions for end-to-end speaker verification,","venue":null,"work_id":"437f4e8e-4165-497e-8ded-69d28fcf924b","year":2020},"citing_paper":{"arxiv_id":"2411.18152","last_updated":"2025-01-15T15:34:13Z","snapshot_observed_at":"2026-08-12T11:25:41.317705Z","submitted_at":"2024-11-27T09:01:08Z","title":"MSA-ASR: Efficient Multilingual Speaker Attribution with frozen ASR Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:39.388092Z"},"links":{"citing_paper":"/paper/2411.18152"},"observation_digest":"sha256:f4d9925665856c765c15c023ff3955881f78487c5d9fae20d20e6079c641f2e6","observation_id":"25ade89e-cf79-4ca0-9ce9-2c6e12abb31f","resolution":{"observed_at":"2026-08-12T11:30:39.547090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:30:39.529617Z","title":"Titanet: Neural model for speaker representation with 1d depth-wise separable convolutions and global context,","venue":null,"work_id":"e8dcfe97-1743-478d-b02d-80969c2abd8f","year":2022},"citing_paper":{"arxiv_id":"2411.18152","last_updated":"2025-01-15T15:34:13Z","snapshot_observed_at":"2026-08-12T11:25:41.317705Z","submitted_at":"2024-11-27T09:01:08Z","title":"MSA-ASR: Efficient Multilingual Speaker Attribution with frozen ASR Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:39.391838Z"},"links":{"citing_paper":"/paper/2411.18152"},"observation_digest":"sha256:f4263ebcab0189111c0a7f95dfce72502556fa2fc14df85c53b42a0b2bf51bba","observation_id":"07b1b713-7ab9-41f9-9fc1-6e2d38f1702e","resolution":{"observed_at":"2026-08-12T11:30:39.533959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:30:39.517098Z","title":"V oxPopuli: A large-scale multilingual speech corpus for representation learning, semi-supervised learning and interpretation,","venue":null,"work_id":"2de799e7-7795-4813-867d-03b4d4ff1787","year":2021},"citing_paper":{"arxiv_id":"2411.18152","last_updated":"2025-01-15T15:34:13Z","snapshot_observed_at":"2026-08-12T11:25:41.317705Z","submitted_at":"2024-11-27T09:01:08Z","title":"MSA-ASR: Efficient Multilingual Speaker Attribution with frozen ASR Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:39.395399Z"},"links":{"citing_paper":"/paper/2411.18152"},"observation_digest":"sha256:f29a5c468788100dd83bcfb681c877ad17c61c52773465925cd4335f04cb7151","observation_id":"ca68eff6-5f70-4c3f-9154-00ca4b89bf7d","resolution":{"observed_at":"2026-08-12T11:30:39.521096Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:30:39.505206Z","title":"The ami meeting corpus: A pre-announcement,","venue":null,"work_id":"95f520fb-050b-456d-9c8e-fd297a469d93","year":2005},"citing_paper":{"arxiv_id":"2411.18152","last_updated":"2025-01-15T15:34:13Z","snapshot_observed_at":"2026-08-12T11:25:41.317705Z","submitted_at":"2024-11-27T09:01:08Z","title":"MSA-ASR: Efficient Multilingual Speaker Attribution with frozen ASR Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:39.399393Z"},"links":{"citing_paper":"/paper/2411.18152"},"observation_digest":"sha256:9bdd8b753f047bd7866f8d5469144e80dc64b3050ae21b85c57206d142cd0fe9","observation_id":"30419bf8-7cf5-4219-b0d2-8b5e07ce1fe0","resolution":{"observed_at":"2026-08-12T11:30:39.509311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:30:39.493147Z","title":"Continuous speech separation: Dataset and analysis,","venue":null,"work_id":"72608644-b1f8-48e4-83a3-d40a302f1f31","year":2020},"citing_paper":{"arxiv_id":"2411.18152","last_updated":"2025-01-15T15:34:13Z","snapshot_observed_at":"2026-08-12T11:25:41.317705Z","submitted_at":"2024-11-27T09:01:08Z","title":"MSA-ASR: Efficient Multilingual Speaker Attribution with frozen ASR Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:39.403198Z"},"links":{"citing_paper":"/paper/2411.18152"},"observation_digest":"sha256:b8198cd5cf27e4179a676ed6f9a5dba4cb215be5dc81fddd2d4f3641dab1a7c5","observation_id":"4ba6e221-5544-488c-8299-54c6de87b763","resolution":{"observed_at":"2026-08-12T11:30:39.497252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:30:39.481814Z","title":"Chime-6 challenge: Tackling multispeaker speech recognition for unsegmented recordings,","venue":null,"work_id":"1a2c3416-f557-4765-a444-2cf5a85cb042","year":2020},"citing_paper":{"arxiv_id":"2411.18152","last_updated":"2025-01-15T15:34:13Z","snapshot_observed_at":"2026-08-12T11:25:41.317705Z","submitted_at":"2024-11-27T09:01:08Z","title":"MSA-ASR: Efficient Multilingual Speaker Attribution with frozen ASR Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:39.406735Z"},"links":{"citing_paper":"/paper/2411.18152"},"observation_digest":"sha256:9247fe9713945504f56285fe481ab0f35b7bb36ebd8a242c0f52be2cd8f1b99b","observation_id":"dc097906-6a68-49cf-a965-72e92ffabe64","resolution":{"observed_at":"2026-08-12T11:30:39.485895Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:30:39.410342Z","title":"pyannote.audio 2.1 speaker diarization pipeline: principle, benchmark, and recipe,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18152","last_updated":"2025-01-15T15:34:13Z","snapshot_observed_at":"2026-08-12T11:25:41.317705Z","submitted_at":"2024-11-27T09:01:08Z","title":"MSA-ASR: Efficient Multilingual Speaker Attribution with frozen ASR Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:39.410342Z"},"links":{"citing_paper":"/paper/2411.18152"},"observation_digest":"sha256:531538492b748fec1d5931ad8566dc459eaae0b9b6def88d81726deb8ca634dc","observation_id":"33cce82d-cef0-4bd4-a4ee-5278a9c4c29e","resolution":{"observed_at":"2026-08-12T11:30:39.410342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:30:39.461426Z","title":"Speaker diarization with lstm,","venue":null,"work_id":"685b1a51-396e-4247-9b43-70c248066115","year":2018},"citing_paper":{"arxiv_id":"2411.18152","last_updated":"2025-01-15T15:34:13Z","snapshot_observed_at":"2026-08-12T11:25:41.317705Z","submitted_at":"2024-11-27T09:01:08Z","title":"MSA-ASR: Efficient Multilingual Speaker Attribution with frozen ASR Models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:39.414058Z"},"links":{"citing_paper":"/paper/2411.18152"},"observation_digest":"sha256:ffddeb14ded75c1b0e819213415072fdb9429e0b6001445be3ea3489de80900d","observation_id":"bc238998-684b-45ab-a667-328b117d0351","resolution":{"observed_at":"2026-08-12T11:30:39.465483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:30:39.446988Z","title":"Silero vad: pre-trained enterprise-grade voice activity detector (vad), number detector and language classifier,","venue":null,"work_id":"deda5315-9f68-41e0-8109-498f1aacc36b","year":2021},"citing_paper":{"arxiv_id":"2411.18152","last_updated":"2025-01-15T15:34:13Z","snapshot_observed_at":"2026-08-12T11:25:41.317705Z","submitted_at":"2024-11-27T09:01:08Z","title":"MSA-ASR: Efficient Multilingual Speaker Attribution with frozen ASR Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:39.417629Z"},"links":{"citing_paper":"/paper/2411.18152"},"observation_digest":"sha256:f429e1abdb00af3e4ec5e58cd8e76b531bf9c60f1e79b52005e142af2640eb01","observation_id":"1ae079b5-ba35-4541-ab26-0e57a0b448b6","resolution":{"observed_at":"2026-08-12T11:30:39.453336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.18152","last_updated":"2025-01-15T15:34:13Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-12T11:25:41.317705Z","submitted_at":"2024-11-27T09:01:08Z","title":"MSA-ASR: Efficient Multilingual Speaker Attribution with frozen ASR Models"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":3,"verified_exact":0,"verified_fuzzy":33},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 0 inbound Pith citation observations for arXiv:2411.18152."}