{"as_of":"2026-08-12T16:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2bf0abccf7aa987e3025703fb6b578bda56664f3fd8e77f28a19cbbb91ce487c","coverage":[{"denominator":50,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-18T21:20:00.286888Z","state":"measured"},{"denominator":53,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":53,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-14T18:22:25.235866Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-02T13:06:59.588978Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.20474","last_updated":"2026-05-13T09:49:01Z","snapshot_observed_at":"2026-08-10T09:38:47.693876Z","submitted_at":"2025-08-28T06:50:57Z","title":"Unifying Diarization, Separation, and ASR with Multi-Speaker Encoder","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.20474","snapshot_observed_at":"2026-07-13T17:09:15.281290Z","title":"Unifying diarization, separation, and asr with multi-speaker encoder,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.27205","last_updated":"2026-06-21T01:18:38Z","snapshot_observed_at":"2026-08-07T10:01:19.312395Z","submitted_at":"2026-03-28T09:14:41Z","title":"Beyond Acoustic Prefixes: Persistent Grounding in Serialized Acoustic Memory for LLM-Based Multi-Talker Speech Recognition","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-13T17:09:15.281290Z"},"links":{"cited_paper":"/paper/2508.20474","citing_paper":"/paper/2603.27205"},"observation_digest":"sha256:88bb8817582fdb54ff8f03251f87028457821993014d684c4fe4b186da80579f","observation_id":"f5605c3b-0e95-4a0b-9f50-bdb78413ef8a","resolution":{"observed_at":"2026-07-13T17:09:15.281290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.20474","last_updated":"2026-05-13T09:49:01Z","snapshot_observed_at":"2026-08-10T09:38:47.693876Z","submitted_at":"2025-08-28T06:50:57Z","title":"Unifying Diarization, Separation, and ASR with Multi-Speaker Encoder","version":2},"cited_work":{"arxiv_id":"2508.20474","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.20474","snapshot_observed_at":"2026-07-02T13:06:59.588978Z","title":"Unifying Diarization, Separation, and ASR with Multi-Speaker Encoder","venue":"eess.AS","work_id":"eb63eddd-88cb-4a22-b23a-35478f00a570","year":2025},"citing_paper":{"arxiv_id":"2606.06065","last_updated":"2026-07-11T01:06:34Z","snapshot_observed_at":"2026-08-02T13:54:54.241377Z","submitted_at":"2026-06-04T12:07:07Z","title":"Multi-task Learning is Not Enough: Representational Entanglement in Dual-output Second Language Speech Recognition","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-06-28T01:31:37.223846Z"},"links":{"cited_paper":"/paper/2508.20474","citing_paper":"/paper/2606.06065"},"observation_digest":"sha256:32f0ca8c9b2bd47e7e4dc9c5e4562d7cc3082495bc15eda8c719146113727b47","observation_id":"f8dff840-eb26-4084-ae2e-2bdd1e2ebf5e","resolution":{"observed_at":"2026-07-02T13:06:59.590126Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.20474","last_updated":"2026-05-13T09:49:01Z","snapshot_observed_at":"2026-08-10T09:38:47.693876Z","submitted_at":"2025-08-28T06:50:57Z","title":"Unifying Diarization, Separation, and ASR with Multi-Speaker Encoder","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.20474","snapshot_observed_at":"2026-07-14T18:22:25.235866Z","title":"Shakeel, M., Sudo, Y ., Peng, Y ., Lin, C.-J., and Watanabe, S","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.06065","last_updated":"2026-07-11T01:06:34Z","snapshot_observed_at":"2026-08-02T13:54:54.241377Z","submitted_at":"2026-06-04T12:07:07Z","title":"Multi-task Learning is Not Enough: Representational Entanglement in Dual-output Second Language Speech Recognition","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-14T18:22:25.235866Z"},"links":{"cited_paper":"/paper/2508.20474","citing_paper":"/paper/2606.06065"},"observation_digest":"sha256:0dc0ecc459d2027a3a73674d0d6ec8963b362c9c2da777987f79881e38f7bfc8","observation_id":"21835f3a-9d1d-4932-b954-8e1d145f9110","resolution":{"observed_at":"2026-07-14T18:22:25.235866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2508.20474/citation-record","integrity":"/paper/2508.20474/integrity","json":"/paper/2508.20474/citation-record.json","paper":"/paper/2508.20474"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A review of speaker diarization: Recent advances with deep learning","venue":null,"work_id":"d8482e41-c85c-41b4-b35a-79fa6fd75438","year":2022},"citing_paper":{"arxiv_id":"2508.20474","last_updated":"2026-05-13T09:49:01Z","snapshot_observed_at":"2026-08-10T09:38:47.693876Z","submitted_at":"2025-08-28T06:50:57Z","title":"Unifying Diarization, Separation, and ASR with Multi-Speaker Encoder","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-18T21:20:00.286888Z"},"links":{"citing_paper":"/paper/2508.20474"},"observation_digest":"sha256:aede64c1115145d18134431356ae88ff15d2f429c5060283c3269279ff5df9f0","observation_id":"cc1e516e-daf8-414e-affa-3b6d5cbd1200","resolution":{"observed_at":"2026-05-18T21:21:51.646257Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Encoder-decoder based attractors for end-to-end neural diarization","venue":null,"work_id":"45d546db-a3c6-4874-ae96-9ef9b3442698","year":2022},"citing_paper":{"arxiv_id":"2508.20474","last_updated":"2026-05-13T09:49:01Z","snapshot_observed_at":"2026-08-10T09:38:47.693876Z","submitted_at":"2025-08-28T06:50:57Z","title":"Unifying Diarization, Separation, and ASR with Multi-Speaker Encoder","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-18T21:20:00.286888Z"},"links":{"citing_paper":"/paper/2508.20474"},"observation_digest":"sha256:4a3eeb96e4db598b5224f0a5bcefdd117022714ac5e339d607006529fc86dcf3","observation_id":"1abf1080-e2d4-4d74-ab43-8d8e1c77d440","resolution":{"observed_at":"2026-05-18T21:21:51.639033Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Powerset multi-class cross entropy loss for neural speaker diarization","venue":null,"work_id":"7f86225d-e733-4a96-89c0-2c879bd178c5","year":2023},"citing_paper":{"arxiv_id":"2508.20474","last_updated":"2026-05-13T09:49:01Z","snapshot_observed_at":"2026-08-10T09:38:47.693876Z","submitted_at":"2025-08-28T06:50:57Z","title":"Unifying Diarization, Separation, and ASR with Multi-Speaker Encoder","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-18T21:20:00.286888Z"},"links":{"citing_paper":"/paper/2508.20474"},"observation_digest":"sha256:7bd04f78c625c1fb8f8a5e557386f2223c837988fdd2b82f769d7c04d2771bf2","observation_id":"a60e7931-d5e1-418e-8b2b-0d2664e07d68","resolution":{"observed_at":"2026-05-18T21:21:51.522706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Supervised speech separation based on deep learning: An overview","venue":null,"work_id":"cdd5bc9a-3961-4412-98f7-91afbb6d86c1","year":2018},"citing_paper":{"arxiv_id":"2508.20474","last_updated":"2026-05-13T09:49:01Z","snapshot_observed_at":"2026-08-10T09:38:47.693876Z","submitted_at":"2025-08-28T06:50:57Z","title":"Unifying Diarization, Separation, and ASR with Multi-Speaker Encoder","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-18T21:20:00.286888Z"},"links":{"citing_paper":"/paper/2508.20474"},"observation_digest":"sha256:00a77ce618ea2661cfee6330a72a5a69530d700a70bc0ab87ec31689df480771","observation_id":"b39f67f9-37f3-4af8-8a4b-384bd4efc6f9","resolution":{"observed_at":"2026-05-18T21:21:51.618746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Conv-TasNet: Surpassing ideal time–frequency magnitude masking for speech separation","venue":null,"work_id":"609305fd-fdfe-4af4-b870-4217074b7d1a","year":2019},"citing_paper":{"arxiv_id":"2508.20474","last_updated":"2026-05-13T09:49:01Z","snapshot_observed_at":"2026-08-10T09:38:47.693876Z","submitted_at":"2025-08-28T06:50:57Z","title":"Unifying Diarization, Separation, and ASR with Multi-Speaker Encoder","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-18T21:20:00.286888Z"},"links":{"citing_paper":"/paper/2508.20474"},"observation_digest":"sha256:5563262cdf56af8eecb7e2c90a9e6ca6944095f557f7c01cb40c298ad9603f7d","observation_id":"f67f2e83-9d22-4a3e-b71e-2f14b0e089eb","resolution":{"observed_at":"2026-05-18T21:21:51.622467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"TF-GRIDNET: Making time- frequency domain models great again for monaural speaker separation","venue":null,"work_id":"cc280950-2d58-4cb0-a228-f44bed48c241","year":2023},"citing_paper":{"arxiv_id":"2508.20474","last_updated":"2026-05-13T09:49:01Z","snapshot_observed_at":"2026-08-10T09:38:47.693876Z","submitted_at":"2025-08-28T06:50:57Z","title":"Unifying Diarization, Separation, and ASR with Multi-Speaker Encoder","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-18T21:20:00.286888Z"},"links":{"citing_paper":"/paper/2508.20474"},"observation_digest":"sha256:b94e6e82274a689e19b18a90686ea991711424b5b1f1c6607cdd3d861338daff","observation_id":"0c6da9fd-a07e-4e07-82b8-c2fb332aabaa","resolution":{"observed_at":"2026-05-18T21:21:51.519854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Single-channel multi-talker speech recognition with permutation invariant training","venue":null,"work_id":"9c84ca48-faef-41b1-9a05-56b906b9f867","year":2018},"citing_paper":{"arxiv_id":"2508.20474","last_updated":"2026-05-13T09:49:01Z","snapshot_observed_at":"2026-08-10T09:38:47.693876Z","submitted_at":"2025-08-28T06:50:57Z","title":"Unifying Diarization, Separation, and ASR with Multi-Speaker Encoder","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-18T21:20:00.286888Z"},"links":{"citing_paper":"/paper/2508.20474"},"observation_digest":"sha256:15384cdaedfa81448aa1ea15c47a15290cbb73c730f58531cafae989c4b63ea5","observation_id":"4c02c8ad-f4f3-419d-bdd3-221c81e49f65","resolution":{"observed_at":"2026-05-18T21:21:51.525725Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A purely end-to-end system for multi-speaker speech recognition","venue":null,"work_id":"d45d2e88-55e5-443b-b996-917e72c9d105","year":2018},"citing_paper":{"arxiv_id":"2508.20474","last_updated":"2026-05-13T09:49:01Z","snapshot_observed_at":"2026-08-10T09:38:47.693876Z","submitted_at":"2025-08-28T06:50:57Z","title":"Unifying Diarization, Separation, and ASR with Multi-Speaker Encoder","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-18T21:20:00.286888Z"},"links":{"citing_paper":"/paper/2508.20474"},"observation_digest":"sha256:989cac3824c5f7729aaf19560ee16512cee6bb4a4419e4b40b2be67b6774d881","observation_id":"45c099f3-3f00-47d2-bc4f-d66815e2e024","resolution":{"observed_at":"2026-05-18T21:21:51.615878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"End-to-end multi-speaker speech recognition with transformer","venue":null,"work_id":"c03f858a-5244-461c-81cd-7350cd7ca61f","year":2020},"citing_paper":{"arxiv_id":"2508.20474","last_updated":"2026-05-13T09:49:01Z","snapshot_observed_at":"2026-08-10T09:38:47.693876Z","submitted_at":"2025-08-28T06:50:57Z","title":"Unifying Diarization, Separation, and ASR with Multi-Speaker Encoder","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-18T21:20:00.286888Z"},"links":{"citing_paper":"/paper/2508.20474"},"observation_digest":"sha256:dbbc9e53f44beb2deafb6b728daf598048c7117c042ed6217efda31aca008079","observation_id":"ed1b6dfe-6b36-4689-8d4b-50422846b25a","resolution":{"observed_at":"2026-05-18T21:21:51.528530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Serialized output training for end-to-end overlapped speech recognition","venue":null,"work_id":"84ef1491-b1a5-4ec5-be76-a4739aa37ac8","year":2020},"citing_paper":{"arxiv_id":"2508.20474","last_updated":"2026-05-13T09:49:01Z","snapshot_observed_at":"2026-08-10T09:38:47.693876Z","submitted_at":"2025-08-28T06:50:57Z","title":"Unifying Diarization, Separation, and ASR with Multi-Speaker Encoder","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-18T21:20:00.286888Z"},"links":{"citing_paper":"/paper/2508.20474"},"observation_digest":"sha256:a02fc4c657edc1ce1e7a2617ae0f6056d4f0bb067a009fc86b3800ea7896b6cb","observation_id":"c52fda73-b706-4475-84dc-9bfab6b708ac","resolution":{"observed_at":"2026-05-18T21:21:51.625527Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Integration of speech separation, diarization, and recog- nition for multi-speaker meetings: System description, comparison, and analysis","venue":null,"work_id":"d1fe951f-fd01-43c7-8ee2-0c582bd7b340","year":2021},"citing_paper":{"arxiv_id":"2508.20474","last_updated":"2026-05-13T09:49:01Z","snapshot_observed_at":"2026-08-10T09:38:47.693876Z","submitted_at":"2025-08-28T06:50:57Z","title":"Unifying Diarization, Separation, and ASR with Multi-Speaker Encoder","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-18T21:20:00.286888Z"},"links":{"citing_paper":"/paper/2508.20474"},"observation_digest":"sha256:04ea1c4a61cb8d242c2d882ec4f5bed5e0dca86642402171183b5cb26cf8f2db","observation_id":"722ac973-82dc-4934-a935-e7be7630ad27","resolution":{"observed_at":"2026-05-18T21:21:51.510118Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Continuous speech separation: Dataset and analysis","venue":null,"work_id":"c3a2927e-c9dd-4140-a941-8dda0357d299","year":2020},"citing_paper":{"arxiv_id":"2508.20474","last_updated":"2026-05-13T09:49:01Z","snapshot_observed_at":"2026-08-10T09:38:47.693876Z","submitted_at":"2025-08-28T06:50:57Z","title":"Unifying Diarization, Separation, and ASR with Multi-Speaker Encoder","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-18T21:20:00.286888Z"},"links":{"citing_paper":"/paper/2508.20474"},"observation_digest":"sha256:15204b99f380c6d31373120698184001dfb12882548e040f86f789a702223538","observation_id":"1ec9cd09-1348-4340-aceb-c9a52307fb26","resolution":{"observed_at":"2026-05-18T21:21:51.512680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"CHiME-6 Challenge: Tackling multispeaker speech recognition for unsegmented recordings","venue":null,"work_id":"1721a5a7-6930-4171-9f0c-3f6d2f282b8a","year":2020},"citing_paper":{"arxiv_id":"2508.20474","last_updated":"2026-05-13T09:49:01Z","snapshot_observed_at":"2026-08-10T09:38:47.693876Z","submitted_at":"2025-08-28T06:50:57Z","title":"Unifying Diarization, Separation, and ASR with Multi-Speaker Encoder","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-18T21:20:00.286888Z"},"links":{"citing_paper":"/paper/2508.20474"},"observation_digest":"sha256:715846097babc849d469974834db6a2d0b60c8896c4430796ceccd4f89b702f2","observation_id":"67da9005-dfa6-4c8b-b8b9-5b543763bf9a","resolution":{"observed_at":"2026-05-18T21:21:51.628622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tandem multitask training of speaker diarisation and speech recognition for meeting transcription","venue":null,"work_id":"dc0e6bcd-191e-4478-a9bc-1e5084dbe054","year":2022},"citing_paper":{"arxiv_id":"2508.20474","last_updated":"2026-05-13T09:49:01Z","snapshot_observed_at":"2026-08-10T09:38:47.693876Z","submitted_at":"2025-08-28T06:50:57Z","title":"Unifying Diarization, Separation, and ASR with Multi-Speaker Encoder","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-18T21:20:00.286888Z"},"links":{"citing_paper":"/paper/2508.20474"},"observation_digest":"sha256:308d363d6efe741b5243783d6a10a742d584f7d1ddeac9de76a856441f9a565a","observation_id":"bc4b6450-3be1-4b7e-8761-49fc6e2debab","resolution":{"observed_at":"2026-05-18T21:21:51.506479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"pyannote.audio 2.1 speaker diarization pipeline: principle, benchmark, and recipe","venue":null,"work_id":"1615de68-9c9e-48ef-88bd-8cea6a48b915","year":2023},"citing_paper":{"arxiv_id":"2508.20474","last_updated":"2026-05-13T09:49:01Z","snapshot_observed_at":"2026-08-10T09:38:47.693876Z","submitted_at":"2025-08-28T06:50:57Z","title":"Unifying Diarization, Separation, and ASR with Multi-Speaker Encoder","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-18T21:20:00.286888Z"},"links":{"citing_paper":"/paper/2508.20474"},"observation_digest":"sha256:ea7b819680468624ed6cbf4bcbd43416a4f143cec47dd259aa7aa018fe0e0b5b","observation_id":"762a0fee-3104-4434-9b49-a94fb67e76c3","resolution":{"observed_at":"2026-05-18T21:21:51.515654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"TS-SEP: Joint di- arization and separation conditioned on estimated speaker embeddings","venue":null,"work_id":"58576887-0c0f-4044-955f-ea9f957309dc","year":2024},"citing_paper":{"arxiv_id":"2508.20474","last_updated":"2026-05-13T09:49:01Z","snapshot_observed_at":"2026-08-10T09:38:47.693876Z","submitted_at":"2025-08-28T06:50:57Z","title":"Unifying Diarization, Separation, and ASR with Multi-Speaker Encoder","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-18T21:20:00.286888Z"},"links":{"citing_paper":"/paper/2508.20474"},"observation_digest":"sha256:1597f92b3aa4daa0e70d0ed0354b56de6314f48b60d697141250adf099d5754d","observation_id":"df07468f-a45d-4196-8c01-690fdcf01e29","resolution":{"observed_at":"2026-05-18T21:21:51.534509Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"PixIT: Joint training of speaker diarization and speech separation from real-world multi-speaker recordings","venue":null,"work_id":"2d8d59a4-802d-44bb-a849-70b1ef57586d","year":2024},"citing_paper":{"arxiv_id":"2508.20474","last_updated":"2026-05-13T09:49:01Z","snapshot_observed_at":"2026-08-10T09:38:47.693876Z","submitted_at":"2025-08-28T06:50:57Z","title":"Unifying Diarization, Separation, and ASR with Multi-Speaker Encoder","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-18T21:20:00.286888Z"},"links":{"citing_paper":"/paper/2508.20474"},"observation_digest":"sha256:97756d1c156fcd2e73995a368b966b1dd346a464d67f5e7276c8590922390dac","observation_id":"50689e6e-e261-4bb3-a9b4-77eb36952239","resolution":{"observed_at":"2026-05-18T21:21:51.558302Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Adapting multi-lingual asr models for handling multiple talkers","venue":null,"work_id":"899f7122-49c7-4d35-ada1-e3461c76b35b","year":2023},"citing_paper":{"arxiv_id":"2508.20474","last_updated":"2026-05-13T09:49:01Z","snapshot_observed_at":"2026-08-10T09:38:47.693876Z","submitted_at":"2025-08-28T06:50:57Z","title":"Unifying Diarization, Separation, and ASR with Multi-Speaker Encoder","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-18T21:20:00.286888Z"},"links":{"citing_paper":"/paper/2508.20474"},"observation_digest":"sha256:53f4de62812a1738e9e7806e0dbff76b65e83741a1a23e9e3e9ff8f23e66de6b","observation_id":"f1bb6545-f1ad-499e-93bd-24ef735f654e","resolution":{"observed_at":"2026-05-18T21:21:51.595289Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Speech recog- nition and multi-speaker diarization of long conversations","venue":null,"work_id":"62c88663-2d90-4e9c-b8e4-7a3306501c00","year":2020},"citing_paper":{"arxiv_id":"2508.20474","last_updated":"2026-05-13T09:49:01Z","snapshot_observed_at":"2026-08-10T09:38:47.693876Z","submitted_at":"2025-08-28T06:50:57Z","title":"Unifying Diarization, Separation, and ASR with Multi-Speaker Encoder","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-18T21:20:00.286888Z"},"links":{"citing_paper":"/paper/2508.20474"},"observation_digest":"sha256:5f859c4b58b6ca073c673d705a6289cd2494395753ee9661e7a6d81d53f7f6b6","observation_id":"960184b7-bad8-465d-8ef3-12012ca61b0a","resolution":{"observed_at":"2026-05-18T21:21:51.598407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"One model to rule them all ? towards end-to-end joint speaker diarization and speech recognition","venue":null,"work_id":"0bd1d341-d622-424a-af40-523a1ed69d61","year":2024},"citing_paper":{"arxiv_id":"2508.20474","last_updated":"2026-05-13T09:49:01Z","snapshot_observed_at":"2026-08-10T09:38:47.693876Z","submitted_at":"2025-08-28T06:50:57Z","title":"Unifying Diarization, Separation, and ASR with Multi-Speaker Encoder","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-18T21:20:00.286888Z"},"links":{"citing_paper":"/paper/2508.20474"},"observation_digest":"sha256:c6a49c77ae888611bc65686868a3479cb292c5ad93ad84d392285428209eb12f","observation_id":"c2e1733f-1936-42c1-bd33-400d120e93d1","resolution":{"observed_at":"2026-05-18T21:21:51.601475Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Streaming speaker-attributed ASR with token-level speaker embeddings","venue":null,"work_id":"0c9ee280-ff90-4bf1-9703-2a9333eb107c","year":2022},"citing_paper":{"arxiv_id":"2508.20474","last_updated":"2026-05-13T09:49:01Z","snapshot_observed_at":"2026-08-10T09:38:47.693876Z","submitted_at":"2025-08-28T06:50:57Z","title":"Unifying Diarization, Separation, and ASR with Multi-Speaker Encoder","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-18T21:20:00.286888Z"},"links":{"citing_paper":"/paper/2508.20474"},"observation_digest":"sha256:2ff858b539e25f1793f9c65fe54bff5749e01473e425160626ee970bfddd6cf5","observation_id":"76cb90c1-5a35-40e0-ba7b-2d067aaae32f","resolution":{"observed_at":"2026-05-18T21:21:51.607693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"MIMO-Speech: End-to-end multi-channel multi- speaker speech recognition","venue":null,"work_id":"aa2c7839-debe-4d18-b9b7-22e0c9a95ab2","year":2019},"citing_paper":{"arxiv_id":"2508.20474","last_updated":"2026-05-13T09:49:01Z","snapshot_observed_at":"2026-08-10T09:38:47.693876Z","submitted_at":"2025-08-28T06:50:57Z","title":"Unifying Diarization, Separation, and ASR with Multi-Speaker Encoder","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-18T21:20:00.286888Z"},"links":{"citing_paper":"/paper/2508.20474"},"observation_digest":"sha256:6f468058702c58515b4bec6139136e50bb89df294e906ea5309844f02b6d19a8","observation_id":"236d8abc-7075-4136-87f8-49b22738ab0d","resolution":{"observed_at":"2026-05-18T21:21:51.545023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multi-talker ASR for an unknown number of sources: Joint training of source counting, separation and ASR","venue":null,"work_id":"d1d21911-7a70-4560-af8c-d755d4bcff1f","year":2020},"citing_paper":{"arxiv_id":"2508.20474","last_updated":"2026-05-13T09:49:01Z","snapshot_observed_at":"2026-08-10T09:38:47.693876Z","submitted_at":"2025-08-28T06:50:57Z","title":"Unifying Diarization, Separation, and ASR with Multi-Speaker Encoder","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-18T21:20:00.286888Z"},"links":{"citing_paper":"/paper/2508.20474"},"observation_digest":"sha256:98632651d2619ce429d1bbdcb7d1a405b4e68c83efd4630bdf325e590417be10","observation_id":"f8614a95-9226-4d32-9ae6-05d74efd289c","resolution":{"observed_at":"2026-05-18T21:21:51.547777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"All-neural online source separation, counting, and diarization for meeting analysis","venue":null,"work_id":"eb611dfc-bf14-4bc8-989b-474515df3380","year":2019},"citing_paper":{"arxiv_id":"2508.20474","last_updated":"2026-05-13T09:49:01Z","snapshot_observed_at":"2026-08-10T09:38:47.693876Z","submitted_at":"2025-08-28T06:50:57Z","title":"Unifying Diarization, Separation, and ASR with Multi-Speaker Encoder","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-18T21:20:00.286888Z"},"links":{"citing_paper":"/paper/2508.20474"},"observation_digest":"sha256:5a6292c2e7f2ba8a2c19466aed24abebd47c1e8a793fff9ba6489be96be21474","observation_id":"cf027948-31a7-4b95-997e-cd92bcc796b3","resolution":{"observed_at":"2026-05-18T21:21:51.553118Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Neural blind source separa- tion and diarization for distant speech recognition","venue":null,"work_id":"9410dc81-6d7a-4cba-a56f-09a7a1d6d804","year":2024},"citing_paper":{"arxiv_id":"2508.20474","last_updated":"2026-05-13T09:49:01Z","snapshot_observed_at":"2026-08-10T09:38:47.693876Z","submitted_at":"2025-08-28T06:50:57Z","title":"Unifying Diarization, Separation, and ASR with Multi-Speaker Encoder","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-18T21:20:00.286888Z"},"links":{"citing_paper":"/paper/2508.20474"},"observation_digest":"sha256:cec5b1bc619bfe94aeff2c962a26832130c0c560f2984a0d12b6c44618284cd6","observation_id":"1f10084c-135a-4091-a0c4-fc7efeb7c4ff","resolution":{"observed_at":"2026-05-18T21:21:51.550143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Stcon system for the chime-8 challenge","venue":null,"work_id":"bf0f4549-b2cd-4147-9615-84a8e2eb0abb","year":2024},"citing_paper":{"arxiv_id":"2508.20474","last_updated":"2026-05-13T09:49:01Z","snapshot_observed_at":"2026-08-10T09:38:47.693876Z","submitted_at":"2025-08-28T06:50:57Z","title":"Unifying Diarization, Separation, and ASR with Multi-Speaker Encoder","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-18T21:20:00.286888Z"},"links":{"citing_paper":"/paper/2508.20474"},"observation_digest":"sha256:b3d1f7a30aac76ea128c545d7b144294921ff44fc221d52bc192cda437eeaf60","observation_id":"7cab4107-4143-4bef-a3cc-505c4e95f314","resolution":{"observed_at":"2026-05-18T21:21:51.580282Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"BUT/JHU system description for CHiME-8 NOTSOFAR-1 challenge","venue":null,"work_id":"f4ba808f-5cba-4bff-813b-49cad6d92a0e","year":2024},"citing_paper":{"arxiv_id":"2508.20474","last_updated":"2026-05-13T09:49:01Z","snapshot_observed_at":"2026-08-10T09:38:47.693876Z","submitted_at":"2025-08-28T06:50:57Z","title":"Unifying Diarization, Separation, and ASR with Multi-Speaker Encoder","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-18T21:20:00.286888Z"},"links":{"citing_paper":"/paper/2508.20474"},"observation_digest":"sha256:052100000141e169f3bbaa04848303161e4f29ef9a1c40b7a36dc09d6133ac9d","observation_id":"0bb1b868-855a-4ca0-92f0-b9e0733d44bb","resolution":{"observed_at":"2026-05-18T21:21:51.582915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The USTC-NERCSLIP systems for the CHiME-8 NOTSOFAR-1 challenge","venue":null,"work_id":"8d91bc3f-a9e4-4357-99eb-dfc2d761713a","year":2024},"citing_paper":{"arxiv_id":"2508.20474","last_updated":"2026-05-13T09:49:01Z","snapshot_observed_at":"2026-08-10T09:38:47.693876Z","submitted_at":"2025-08-28T06:50:57Z","title":"Unifying Diarization, Separation, and ASR with Multi-Speaker Encoder","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-18T21:20:00.286888Z"},"links":{"citing_paper":"/paper/2508.20474"},"observation_digest":"sha256:02982bdc1be363c1111a241d264fd14cd1e0d010f7c21d3836dbdb11831a4136","observation_id":"606b2f6a-6520-46ee-b716-b15d4e638f9b","resolution":{"observed_at":"2026-05-18T21:21:51.542070Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"NTT multi-speaker asr system for the DASR task of CHiME-8 challenge","venue":null,"work_id":"6c4867f9-40e0-4823-8470-74a003af0445","year":2024},"citing_paper":{"arxiv_id":"2508.20474","last_updated":"2026-05-13T09:49:01Z","snapshot_observed_at":"2026-08-10T09:38:47.693876Z","submitted_at":"2025-08-28T06:50:57Z","title":"Unifying Diarization, Separation, and ASR with Multi-Speaker Encoder","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-18T21:20:00.286888Z"},"links":{"citing_paper":"/paper/2508.20474"},"observation_digest":"sha256:8b7876889fbc16bd35c02e30f2eaddeb771a7ffac17897af6171c0fbfd9bd0f8","observation_id":"f7bdd670-a1ac-4663-a1fa-9f2266ec0e9f","resolution":{"observed_at":"2026-05-18T21:21:51.588753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"wav2vec 2.0: a framework for self-supervised learning of speech representations","venue":null,"work_id":"9a520c4c-8d36-464a-a388-e3135ffdfca7","year":2020},"citing_paper":{"arxiv_id":"2508.20474","last_updated":"2026-05-13T09:49:01Z","snapshot_observed_at":"2026-08-10T09:38:47.693876Z","submitted_at":"2025-08-28T06:50:57Z","title":"Unifying Diarization, Separation, and ASR with Multi-Speaker Encoder","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-18T21:20:00.286888Z"},"links":{"citing_paper":"/paper/2508.20474"},"observation_digest":"sha256:5606436ff9d5630e98e1d0b51ea3e88d32de4f229f4c2d2eec1d9e10290f1011","observation_id":"ab504eb1-b0bf-4581-a620-6f8fad373239","resolution":{"observed_at":"2026-05-18T21:21:51.570585Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"HuBERT: Self-supervised speech representation learning by masked prediction of hidden units","venue":null,"work_id":"b67d1cd8-14b4-4c50-8597-a102d348b818","year":2021},"citing_paper":{"arxiv_id":"2508.20474","last_updated":"2026-05-13T09:49:01Z","snapshot_observed_at":"2026-08-10T09:38:47.693876Z","submitted_at":"2025-08-28T06:50:57Z","title":"Unifying Diarization, Separation, and ASR with Multi-Speaker Encoder","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-18T21:20:00.286888Z"},"links":{"citing_paper":"/paper/2508.20474"},"observation_digest":"sha256:5783eaaab13d930260b6b7155559d32467555f4f8be6dbb00507d8973716f95e","observation_id":"343e67f3-df0d-41cb-b46d-05d4a14b0da1","resolution":{"observed_at":"2026-05-18T21:21:51.560928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"WavLM: Large-scale self-supervised pre-training for full stack speech processing","venue":null,"work_id":"820b0de1-33d3-4ecb-b717-ada77e90e56a","year":2022},"citing_paper":{"arxiv_id":"2508.20474","last_updated":"2026-05-13T09:49:01Z","snapshot_observed_at":"2026-08-10T09:38:47.693876Z","submitted_at":"2025-08-28T06:50:57Z","title":"Unifying Diarization, Separation, and ASR with Multi-Speaker Encoder","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-18T21:20:00.286888Z"},"links":{"citing_paper":"/paper/2508.20474"},"observation_digest":"sha256:cfce87f59a7d6e78ff17cafdda194a36dad63356e91af366085b75b76ec7ea6c","observation_id":"4858d18b-79bb-4bdc-964d-49e7c49d7d8c","resolution":{"observed_at":"2026-05-18T21:21:51.612811Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Robust speech recognition via large-scale weak supervision","venue":null,"work_id":"eae65e7b-c029-4a7e-b78c-36bd82207171","year":2023},"citing_paper":{"arxiv_id":"2508.20474","last_updated":"2026-05-13T09:49:01Z","snapshot_observed_at":"2026-08-10T09:38:47.693876Z","submitted_at":"2025-08-28T06:50:57Z","title":"Unifying Diarization, Separation, and ASR with Multi-Speaker Encoder","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-18T21:20:00.286888Z"},"links":{"citing_paper":"/paper/2508.20474"},"observation_digest":"sha256:80d40f7a2952e297a756242c3b8098d8730475900dee4eb90ad8e739bcf7085a","observation_id":"20417b24-cf3d-49ab-bbbb-f36cea69aadc","resolution":{"observed_at":"2026-05-18T21:21:51.538557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"OWSM-CTC: An open encoder-only speech foundation model for speech recognition, translation, and language identification","venue":null,"work_id":"81997308-5371-4a2f-82da-4635e0e2b0b4","year":2024},"citing_paper":{"arxiv_id":"2508.20474","last_updated":"2026-05-13T09:49:01Z","snapshot_observed_at":"2026-08-10T09:38:47.693876Z","submitted_at":"2025-08-28T06:50:57Z","title":"Unifying Diarization, Separation, and ASR with Multi-Speaker Encoder","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-18T21:20:00.286888Z"},"links":{"citing_paper":"/paper/2508.20474"},"observation_digest":"sha256:f7784437d710f80090af62b262f90ea8e9607ac09d5921313895df36cd3e69ff","observation_id":"05ade4e2-ba05-4679-b0c2-5cca8698f5e5","resolution":{"observed_at":"2026-05-18T21:21:51.568408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"SUPERB: Speech processing universal performance benchmark","venue":null,"work_id":"63c7edc4-d80d-45dd-ac02-343e4f6a520c","year":2021},"citing_paper":{"arxiv_id":"2508.20474","last_updated":"2026-05-13T09:49:01Z","snapshot_observed_at":"2026-08-10T09:38:47.693876Z","submitted_at":"2025-08-28T06:50:57Z","title":"Unifying Diarization, Separation, and ASR with Multi-Speaker Encoder","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-18T21:20:00.286888Z"},"links":{"citing_paper":"/paper/2508.20474"},"observation_digest":"sha256:a90d69347beb60738985e5178dfbd8d9c672890ba56286b532aaee13e01abb91","observation_id":"a4e2f819-fca3-42b5-b06a-7089112f9394","resolution":{"observed_at":"2026-05-18T21:21:51.573026Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"OWSM v3.1: Better and faster open whisper-style speech models based on e-branchformer","venue":null,"work_id":"bc3bb4e5-dc37-4e5e-91da-76fa08e907b0","year":2024},"citing_paper":{"arxiv_id":"2508.20474","last_updated":"2026-05-13T09:49:01Z","snapshot_observed_at":"2026-08-10T09:38:47.693876Z","submitted_at":"2025-08-28T06:50:57Z","title":"Unifying Diarization, Separation, and ASR with Multi-Speaker Encoder","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-18T21:20:00.286888Z"},"links":{"citing_paper":"/paper/2508.20474"},"observation_digest":"sha256:a1462d5f274b911502b427f7af69b76ddc52ab7c2bc22f9391efb4da7e6d38c7","observation_id":"e0559b20-3460-4a95-9f9c-c98b6852082c","resolution":{"observed_at":"2026-05-18T21:21:51.565979Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"LibriMix: An open-source dataset for generalizable speech separation","venue":null,"work_id":"66a74468-9581-45fc-8f72-c5e30b50165a","year":2020},"citing_paper":{"arxiv_id":"2508.20474","last_updated":"2026-05-13T09:49:01Z","snapshot_observed_at":"2026-08-10T09:38:47.693876Z","submitted_at":"2025-08-28T06:50:57Z","title":"Unifying Diarization, Separation, and ASR with Multi-Speaker Encoder","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-18T21:20:00.286888Z"},"links":{"citing_paper":"/paper/2508.20474"},"observation_digest":"sha256:5a81c242aa14e48714f5548d08ded0f6a21c84125a603384425285597808dee3","observation_id":"a776efa8-d7a7-4d1d-ab6e-595abfbe18a7","resolution":{"observed_at":"2026-05-18T21:21:51.563365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"E-Branchformer: Branchformer with enhanced merging for speech recognition","venue":null,"work_id":"e18cdfdb-b7df-4c0c-b9d1-52302ba0e074","year":2023},"citing_paper":{"arxiv_id":"2508.20474","last_updated":"2026-05-13T09:49:01Z","snapshot_observed_at":"2026-08-10T09:38:47.693876Z","submitted_at":"2025-08-28T06:50:57Z","title":"Unifying Diarization, Separation, and ASR with Multi-Speaker Encoder","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-18T21:20:00.286888Z"},"links":{"citing_paper":"/paper/2508.20474"},"observation_digest":"sha256:c2c92626bf28df6b8019cf4fe59ae843829591ad4db47ca206b3fc6f7d551580","observation_id":"e8d22c95-1384-41b7-9533-7b1c6676ca72","resolution":{"observed_at":"2026-05-18T21:21:51.592039Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"End-to-end training of time domain audio separation and recognition","venue":null,"work_id":"157876b1-363b-4e50-99a5-ae889fc6e4c3","year":2020},"citing_paper":{"arxiv_id":"2508.20474","last_updated":"2026-05-13T09:49:01Z","snapshot_observed_at":"2026-08-10T09:38:47.693876Z","submitted_at":"2025-08-28T06:50:57Z","title":"Unifying Diarization, Separation, and ASR with Multi-Speaker Encoder","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-18T21:20:00.286888Z"},"links":{"citing_paper":"/paper/2508.20474"},"observation_digest":"sha256:15fb30a295f2edbb3ea5374ea86f9ce9d5422b29263e13d4652fed9baf886239","observation_id":"1aa5f4f6-74fd-42a4-aafb-56df01fc1f70","resolution":{"observed_at":"2026-05-18T21:21:51.575655Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The AMI meeting corpus: A pre-announcement","venue":null,"work_id":"2f8e01a5-ff2d-4aca-9f47-b52b4707169c","year":2006},"citing_paper":{"arxiv_id":"2508.20474","last_updated":"2026-05-13T09:49:01Z","snapshot_observed_at":"2026-08-10T09:38:47.693876Z","submitted_at":"2025-08-28T06:50:57Z","title":"Unifying Diarization, Separation, and ASR with Multi-Speaker Encoder","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-18T21:20:00.286888Z"},"links":{"citing_paper":"/paper/2508.20474"},"observation_digest":"sha256:305ddf5508ac2e6c8570c6097655704cd0ed806fb4fffb1805748cb26767cf3f","observation_id":"bb4fc01a-c0d9-48fc-92eb-a61912afbfeb","resolution":{"observed_at":"2026-05-18T21:21:51.531268Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The Hitachi-JHU DIHARD III System: Competitive end-to-end neural diarization and x-vector clustering systems combined by dover-lap","venue":null,"work_id":"bf53c67e-ab23-43cf-bb79-cd0472c87c09","year":2021},"citing_paper":{"arxiv_id":"2508.20474","last_updated":"2026-05-13T09:49:01Z","snapshot_observed_at":"2026-08-10T09:38:47.693876Z","submitted_at":"2025-08-28T06:50:57Z","title":"Unifying Diarization, Separation, and ASR with Multi-Speaker Encoder","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-18T21:20:00.286888Z"},"links":{"citing_paper":"/paper/2508.20474"},"observation_digest":"sha256:0611b14f9d392bfeface7d574b17cebdb20cc7af7763fa3b758063b90f04a768","observation_id":"836dae3d-0366-450f-be64-6d9cd2690d65","resolution":{"observed_at":"2026-05-18T21:21:51.577956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The rich transcription 2006 spring meeting recognition evaluation","venue":null,"work_id":"594837b4-cce7-4385-97f4-ea15e6ed1003","year":2006},"citing_paper":{"arxiv_id":"2508.20474","last_updated":"2026-05-13T09:49:01Z","snapshot_observed_at":"2026-08-10T09:38:47.693876Z","submitted_at":"2025-08-28T06:50:57Z","title":"Unifying Diarization, Separation, and ASR with Multi-Speaker Encoder","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-18T21:20:00.286888Z"},"links":{"citing_paper":"/paper/2508.20474"},"observation_digest":"sha256:f3d5263cd45f112905415723084e63bbc8f6230c73d16845bf68e8d42441c712","observation_id":"36842d5e-d6fc-45d0-9273-c58a1a0edbf1","resolution":{"observed_at":"2026-05-18T21:21:51.585929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A short- time objective intelligibility measure for time-frequency weighted noisy speech","venue":null,"work_id":"b29dc805-b3f7-4969-b3fe-fa28b275ad69","year":2010},"citing_paper":{"arxiv_id":"2508.20474","last_updated":"2026-05-13T09:49:01Z","snapshot_observed_at":"2026-08-10T09:38:47.693876Z","submitted_at":"2025-08-28T06:50:57Z","title":"Unifying Diarization, Separation, and ASR with Multi-Speaker Encoder","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-18T21:20:00.286888Z"},"links":{"citing_paper":"/paper/2508.20474"},"observation_digest":"sha256:a867ca6edde110b99bc8433529b175a93861e84fd50209a6b989dfc45e468cb6","observation_id":"a05a1210-cd17-4742-9c24-84c1aa0bf6e8","resolution":{"observed_at":"2026-05-18T21:21:51.610432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Performance measurement in blind audio source separation","venue":null,"work_id":"aea1b3c3-c446-40aa-9613-0468b09ef982","year":2006},"citing_paper":{"arxiv_id":"2508.20474","last_updated":"2026-05-13T09:49:01Z","snapshot_observed_at":"2026-08-10T09:38:47.693876Z","submitted_at":"2025-08-28T06:50:57Z","title":"Unifying Diarization, Separation, and ASR with Multi-Speaker Encoder","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-18T21:20:00.286888Z"},"links":{"citing_paper":"/paper/2508.20474"},"observation_digest":"sha256:fb6eb1daaaae63350dc76119183f177164c476385cf5b442fbd2f5d0c6712fe5","observation_id":"f2cf1b82-09e7-42b0-b476-1ec39cfd2ef8","resolution":{"observed_at":"2026-05-18T21:21:51.555861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Streaming end-to-end multi-talker speech recognition","venue":null,"work_id":"1ecaff85-f7a5-4235-9ba1-799160d446b2","year":2021},"citing_paper":{"arxiv_id":"2508.20474","last_updated":"2026-05-13T09:49:01Z","snapshot_observed_at":"2026-08-10T09:38:47.693876Z","submitted_at":"2025-08-28T06:50:57Z","title":"Unifying Diarization, Separation, and ASR with Multi-Speaker Encoder","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-18T21:20:00.286888Z"},"links":{"citing_paper":"/paper/2508.20474"},"observation_digest":"sha256:ddd7c7c68701245312f3ad7fe17eda325cd55610e52e11c7198879649038fbf9","observation_id":"14982b27-c6e9-44cc-b12f-ea1681c0252c","resolution":{"observed_at":"2026-05-18T21:21:51.604338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"End-to-end Speaker-Attributed ASR with transformer","venue":null,"work_id":"cc3fddf6-3c58-4169-952c-6a840147fd21","year":2021},"citing_paper":{"arxiv_id":"2508.20474","last_updated":"2026-05-13T09:49:01Z","snapshot_observed_at":"2026-08-10T09:38:47.693876Z","submitted_at":"2025-08-28T06:50:57Z","title":"Unifying Diarization, Separation, and ASR with Multi-Speaker Encoder","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-18T21:20:00.286888Z"},"links":{"citing_paper":"/paper/2508.20474"},"observation_digest":"sha256:05d230890839f31a82c4072e0e55c8024b314c4ca76c9af92b398ca77ecde6d9","observation_id":"680035f5-dd40-42cb-b75e-5581cbbcf8d5","resolution":{"observed_at":"2026-05-18T21:21:51.634012Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Empowering whisper as a joint multi- talker and target-talker speech recognition system","venue":null,"work_id":"8102caba-6dcc-4aeb-be80-8db4e10dcc2c","year":2024},"citing_paper":{"arxiv_id":"2508.20474","last_updated":"2026-05-13T09:49:01Z","snapshot_observed_at":"2026-08-10T09:38:47.693876Z","submitted_at":"2025-08-28T06:50:57Z","title":"Unifying Diarization, Separation, and ASR with Multi-Speaker Encoder","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-18T21:20:00.286888Z"},"links":{"citing_paper":"/paper/2508.20474"},"observation_digest":"sha256:d397ae7eabd16b57a5fad7d654d24dff9c84d6fec62336215d5470b12301b504","observation_id":"b2996ebe-c4bb-49ca-8f35-5bd1017e589c","resolution":{"observed_at":"2026-05-18T21:21:51.631198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ESPnet: End-to-end speech processing toolkit","venue":null,"work_id":"a0ce658f-e3a2-47b5-a545-efc3ac05ad6c","year":2018},"citing_paper":{"arxiv_id":"2508.20474","last_updated":"2026-05-13T09:49:01Z","snapshot_observed_at":"2026-08-10T09:38:47.693876Z","submitted_at":"2025-08-28T06:50:57Z","title":"Unifying Diarization, Separation, and ASR with Multi-Speaker Encoder","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-18T21:20:00.286888Z"},"links":{"citing_paper":"/paper/2508.20474"},"observation_digest":"sha256:4608262b518a3184b60af520c5876dd014aeabfc09463aaf15d07dd4acbc37e9","observation_id":"8ad9e094-13de-4499-87bc-facd18ada5c5","resolution":{"observed_at":"2026-05-18T21:21:51.636553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The power of the weighted sum scalarization for approximating multiobjective optimization problems","venue":null,"work_id":"2401d4f5-3049-4a25-9048-fd3cd7d7004a","year":2022},"citing_paper":{"arxiv_id":"2508.20474","last_updated":"2026-05-13T09:49:01Z","snapshot_observed_at":"2026-08-10T09:38:47.693876Z","submitted_at":"2025-08-28T06:50:57Z","title":"Unifying Diarization, Separation, and ASR with Multi-Speaker Encoder","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-18T21:20:00.286888Z"},"links":{"citing_paper":"/paper/2508.20474"},"observation_digest":"sha256:07c1ebe4e9b7b6351c554e9a3bb1b04481efd69e012f7151bfc94feb372047b2","observation_id":"28581f29-c463-401d-a942-75821bf5a48a","resolution":{"observed_at":"2026-05-18T21:21:51.641625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Joint beam search integrating CTC, attention, and trans- ducer decoders","venue":null,"work_id":"92ffe97f-fa40-4e3d-b4dc-ccbfd2d128c4","year":2025},"citing_paper":{"arxiv_id":"2508.20474","last_updated":"2026-05-13T09:49:01Z","snapshot_observed_at":"2026-08-10T09:38:47.693876Z","submitted_at":"2025-08-28T06:50:57Z","title":"Unifying Diarization, Separation, and ASR with Multi-Speaker Encoder","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-18T21:20:00.286888Z"},"links":{"citing_paper":"/paper/2508.20474"},"observation_digest":"sha256:95a64966ff7640d3385f905ecd53f30ac47834d5a5c7f77965b1667cd12962af","observation_id":"f23eaa7c-20d3-47d0-8c89-3111cd76295b","resolution":{"observed_at":"2026-05-18T21:21:51.644161Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.20474","last_updated":"2026-05-13T09:49:01Z","latest_version":2,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-10T09:38:47.693876Z","submitted_at":"2025-08-28T06:50:57Z","title":"Unifying Diarization, Separation, and ASR with Multi-Speaker Encoder"},"reference_resolution":{"displayed":50,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":50},"total_outbound_references":50},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 3 inbound Pith citation observations for arXiv:2508.20474."}