{"as_of":"2026-08-09T02:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e8f753c491036b23505c3749fd353e4971b06ccb3b1ffa8c051e1ca22ab5ea66","coverage":[{"denominator":28,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T18:10:40.677516Z","state":"measured"},{"denominator":28,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":28,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.10143/citation-record","integrity":"/paper/2509.10143/integrity","json":"/paper/2509.10143/citation-record.json","paper":"/paper/2509.10143"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:10:38.514199Z","title":"Continuous speech separation with conformer,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.10143","last_updated":"2025-09-12T11:10:38Z","snapshot_observed_at":"2026-08-04T18:10:37.662565Z","submitted_at":"2025-09-12T11:10:38Z","title":"Error Analysis in a Modular Meeting Transcription System","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T18:10:38.514199Z"},"links":{"citing_paper":"/paper/2509.10143"},"observation_digest":"sha256:5a15f66a9e8f1e99c90b52dacf2d7ab061808dda098a05a83844f2ac3537186f","observation_id":"81b91f03-1a3e-4c87-8574-31680bcf24c7","resolution":{"observed_at":"2026-08-04T18:10:38.514199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:10:38.589962Z","title":"Mixture encoder for joint speech separation and recognition,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.10143","last_updated":"2025-09-12T11:10:38Z","snapshot_observed_at":"2026-08-04T18:10:37.662565Z","submitted_at":"2025-09-12T11:10:38Z","title":"Error Analysis in a Modular Meeting Transcription System","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T18:10:38.589962Z"},"links":{"citing_paper":"/paper/2509.10143"},"observation_digest":"sha256:8c3c9405e5badc9a418ce10741006a276e2b100efb08be3fb90114378ae37b7d","observation_id":"9b489ac8-b125-46dd-9c6e-990251338edd","resolution":{"observed_at":"2026-08-04T18:10:38.589962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:10:38.676537Z","title":"Multi-turn rnn-t for streaming recognition of multi-party speech,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.10143","last_updated":"2025-09-12T11:10:38Z","snapshot_observed_at":"2026-08-04T18:10:37.662565Z","submitted_at":"2025-09-12T11:10:38Z","title":"Error Analysis in a Modular Meeting Transcription System","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T18:10:38.676537Z"},"links":{"citing_paper":"/paper/2509.10143"},"observation_digest":"sha256:f996181941b612d6f5a2973dc018a0fc8d819ced69cb2ad692ec5c0696fc6dfb","observation_id":"3417e6ae-aeb9-4368-96f8-5f62ec8909ec","resolution":{"observed_at":"2026-08-04T18:10:38.676537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.00842","last_updated":"2022-07-14T20:40:04Z","snapshot_observed_at":"2026-08-04T03:36:16.585839Z","submitted_at":"2022-02-02T01:27:21Z","title":"Streaming Multi-Talker ASR with Token-Level Serialized Output Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.00842","snapshot_observed_at":"2026-08-04T18:10:38.759180Z","title":"Streaming multi-talker ASR with token-level serialized output train- ing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.10143","last_updated":"2025-09-12T11:10:38Z","snapshot_observed_at":"2026-08-04T18:10:37.662565Z","submitted_at":"2025-09-12T11:10:38Z","title":"Error Analysis in a Modular Meeting Transcription System","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T18:10:38.759180Z"},"links":{"cited_paper":"/paper/2202.00842","citing_paper":"/paper/2509.10143"},"observation_digest":"sha256:9c8ac969c62a332182642e9073849427255a4f5eab1ccb2f772a109fc2064cbc","observation_id":"30385cdf-1b12-43ca-a2a8-8ed326da73d0","resolution":{"observed_at":"2026-08-04T18:10:38.759180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:10:38.870161Z","title":"Continuous speech separation: Dataset and analysis,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.10143","last_updated":"2025-09-12T11:10:38Z","snapshot_observed_at":"2026-08-04T18:10:37.662565Z","submitted_at":"2025-09-12T11:10:38Z","title":"Error Analysis in a Modular Meeting Transcription System","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T18:10:38.870161Z"},"links":{"citing_paper":"/paper/2509.10143"},"observation_digest":"sha256:226576789386e70872e5555c5d30eed0007287c72fa9c3528842c06ca02981a1","observation_id":"9b6b078e-5f70-4be2-a262-4685a8dd3f81","resolution":{"observed_at":"2026-08-04T18:10:38.870161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:10:38.954881Z","title":"TF-GridNet: Integrating full- and sub-band modeling for speech separation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.10143","last_updated":"2025-09-12T11:10:38Z","snapshot_observed_at":"2026-08-04T18:10:37.662565Z","submitted_at":"2025-09-12T11:10:38Z","title":"Error Analysis in a Modular Meeting Transcription System","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T18:10:38.954881Z"},"links":{"citing_paper":"/paper/2509.10143"},"observation_digest":"sha256:360ab02fa67a12b56288932de2788b56ca4d24f8ac9d3ef897f865de69680c07","observation_id":"92ce3ad9-29f1-4c8e-8fe5-3ac53f482f5b","resolution":{"observed_at":"2026-08-04T18:10:38.954881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:10:39.012615Z","title":"TS-SEP: Joint diarization and separation conditioned on estimated speaker embeddings,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10143","last_updated":"2025-09-12T11:10:38Z","snapshot_observed_at":"2026-08-04T18:10:37.662565Z","submitted_at":"2025-09-12T11:10:38Z","title":"Error Analysis in a Modular Meeting Transcription System","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T18:10:39.012615Z"},"links":{"citing_paper":"/paper/2509.10143"},"observation_digest":"sha256:90e726f272700f647a257666bb3014674abaa0bbd316f8df296bfd867153a45b","observation_id":"f30a8c1b-5b4c-4cf0-8125-89fd3c7548f7","resolution":{"observed_at":"2026-08-04T18:10:39.012615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:10:39.098729Z","title":"M2Met: The ICASSP 2022 multi-channel multi-party meeting transcrip- tion challenge,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.10143","last_updated":"2025-09-12T11:10:38Z","snapshot_observed_at":"2026-08-04T18:10:37.662565Z","submitted_at":"2025-09-12T11:10:38Z","title":"Error Analysis in a Modular Meeting Transcription System","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T18:10:39.098729Z"},"links":{"citing_paper":"/paper/2509.10143"},"observation_digest":"sha256:a26f8e18fdc3ef8319b046be9c0b478487184867a0cd541e74b888ccce54893f","observation_id":"f9378cd3-c9d8-486d-9d76-0801c900c6a0","resolution":{"observed_at":"2026-08-04T18:10:39.098729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:10:39.153160Z","title":"How bad are artifacts?: Analyzing the impact of speech enhancement errors on ASR,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.10143","last_updated":"2025-09-12T11:10:38Z","snapshot_observed_at":"2026-08-04T18:10:37.662565Z","submitted_at":"2025-09-12T11:10:38Z","title":"Error Analysis in a Modular Meeting Transcription System","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T18:10:39.153160Z"},"links":{"citing_paper":"/paper/2509.10143"},"observation_digest":"sha256:13f651e3fe8906948d5fef54bc7c8f811d96a73b82374158ea2752a237393b5a","observation_id":"00bdcc90-6aec-4a9e-b042-5533795c3725","resolution":{"observed_at":"2026-08-04T18:10:39.153160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:10:39.235099Z","title":"Impact of residual noise and artifacts in speech enhancement errors on intelligibility of human and machine,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.10143","last_updated":"2025-09-12T11:10:38Z","snapshot_observed_at":"2026-08-04T18:10:37.662565Z","submitted_at":"2025-09-12T11:10:38Z","title":"Error Analysis in a Modular Meeting Transcription System","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T18:10:39.235099Z"},"links":{"citing_paper":"/paper/2509.10143"},"observation_digest":"sha256:cee6470be95434e33a4a179a3f6a8bc8eb248fcb4eb48fd1d233b67ae07fd53a","observation_id":"549b5d3c-3cf4-4a43-9f58-ea7130bb9f7d","resolution":{"observed_at":"2026-08-04T18:10:39.235099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:10:39.317549Z","title":"Monaural source separation: From anechoic to reverberant environments,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.10143","last_updated":"2025-09-12T11:10:38Z","snapshot_observed_at":"2026-08-04T18:10:37.662565Z","submitted_at":"2025-09-12T11:10:38Z","title":"Error Analysis in a Modular Meeting Transcription System","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T18:10:39.317549Z"},"links":{"citing_paper":"/paper/2509.10143"},"observation_digest":"sha256:433044bb9b3d0a9c4ca82ccddfd701568135c6c86f8d995780574b837bbdd44c","observation_id":"375abbde-9c4b-4169-a737-edf68eae8e97","resolution":{"observed_at":"2026-08-04T18:10:39.317549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:10:39.400331Z","title":"Explicit word error minimization using word hypothesis posterior probabilities,","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2509.10143","last_updated":"2025-09-12T11:10:38Z","snapshot_observed_at":"2026-08-04T18:10:37.662565Z","submitted_at":"2025-09-12T11:10:38Z","title":"Error Analysis in a Modular Meeting Transcription System","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T18:10:39.400331Z"},"links":{"citing_paper":"/paper/2509.10143"},"observation_digest":"sha256:f8aba2caf58fdc633426532e85c41dd67a9b4e4ed1a191fbbb1dded79f0d8ffd","observation_id":"35a01af6-0c7d-487a-964e-a9db6e622226","resolution":{"observed_at":"2026-08-04T18:10:39.400331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:10:39.454327Z","title":"Con- fidence measures for large vocabulary continuous speech recognition,","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2509.10143","last_updated":"2025-09-12T11:10:38Z","snapshot_observed_at":"2026-08-04T18:10:37.662565Z","submitted_at":"2025-09-12T11:10:38Z","title":"Error Analysis in a Modular Meeting Transcription System","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T18:10:39.454327Z"},"links":{"citing_paper":"/paper/2509.10143"},"observation_digest":"sha256:a17b380684e120c78f4fff75bcba936bbd7b5ee8a64255785ffa33fd0aeba9e4","observation_id":"4ddabb42-2a41-4b23-a410-351fb849b1b6","resolution":{"observed_at":"2026-08-04T18:10:39.454327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:10:39.538992Z","title":"Combining TF-GridNet and mixture encoder for continuous speech separation for meeting transcription,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10143","last_updated":"2025-09-12T11:10:38Z","snapshot_observed_at":"2026-08-04T18:10:37.662565Z","submitted_at":"2025-09-12T11:10:38Z","title":"Error Analysis in a Modular Meeting Transcription System","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T18:10:39.538992Z"},"links":{"citing_paper":"/paper/2509.10143"},"observation_digest":"sha256:ceea46439b8497405e862ff2dae65d40d6979fd4fc420ee5bccf0fb60c412538","observation_id":"bc96ee97-ebd7-4a75-87e3-639bb18e04a1","resolution":{"observed_at":"2026-08-04T18:10:39.538992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:10:39.625107Z","title":"Recognizing overlapped speech in meetings: A multichan- nel separation approach using neural networks,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.10143","last_updated":"2025-09-12T11:10:38Z","snapshot_observed_at":"2026-08-04T18:10:37.662565Z","submitted_at":"2025-09-12T11:10:38Z","title":"Error Analysis in a Modular Meeting Transcription System","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T18:10:39.625107Z"},"links":{"citing_paper":"/paper/2509.10143"},"observation_digest":"sha256:d734fcd51b5c4c2af2140639199d5f8144b0b81ed33b806c51d44f121833f846","observation_id":"66b8bade-1646-4fe3-ab59-a7af7b9f1eaf","resolution":{"observed_at":"2026-08-04T18:10:39.625107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:10:39.707336Z","title":"TF-GridNet: Making time-frequency domain models great again for monaural speaker separation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.10143","last_updated":"2025-09-12T11:10:38Z","snapshot_observed_at":"2026-08-04T18:10:37.662565Z","submitted_at":"2025-09-12T11:10:38Z","title":"Error Analysis in a Modular Meeting Transcription System","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T18:10:39.707336Z"},"links":{"citing_paper":"/paper/2509.10143"},"observation_digest":"sha256:cbdf1514aa03871fa366aa66521c51d3edf06a83c123fab43ac8236988c61507","observation_id":"5345d1f5-699e-43b7-97b6-d8a5dcf4fc56","resolution":{"observed_at":"2026-08-04T18:10:39.707336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:10:39.791509Z","title":"Meeting recognition with con- tinuous speech separation and transcription-supported di- arization,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10143","last_updated":"2025-09-12T11:10:38Z","snapshot_observed_at":"2026-08-04T18:10:37.662565Z","submitted_at":"2025-09-12T11:10:38Z","title":"Error Analysis in a Modular Meeting Transcription System","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T18:10:39.791509Z"},"links":{"citing_paper":"/paper/2509.10143"},"observation_digest":"sha256:d820d5a429ce470aa633c6a9e94a8baabce8df6cfb502afdb9744659ca415fd9","observation_id":"c501d8c1-80e8-476d-bcb6-3fd6d3c6963c","resolution":{"observed_at":"2026-08-04T18:10:39.791509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:10:39.845750Z","title":"Robust speech recognition via large-scale weak supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.10143","last_updated":"2025-09-12T11:10:38Z","snapshot_observed_at":"2026-08-04T18:10:37.662565Z","submitted_at":"2025-09-12T11:10:38Z","title":"Error Analysis in a Modular Meeting Transcription System","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T18:10:39.845750Z"},"links":{"citing_paper":"/paper/2509.10143"},"observation_digest":"sha256:92fbc5a415f54086363c0826654a76501c086467f65ef9c9755d0a6344bf8153","observation_id":"92e5f0f6-1c1f-4abb-88ba-5bb55a9cc080","resolution":{"observed_at":"2026-08-04T18:10:39.845750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:10:39.927965Z","title":"Integration of speech separa- tion, diarization, and recognition for multi-speaker meetings: System description, comparison, and analysis,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.10143","last_updated":"2025-09-12T11:10:38Z","snapshot_observed_at":"2026-08-04T18:10:37.662565Z","submitted_at":"2025-09-12T11:10:38Z","title":"Error Analysis in a Modular Meeting Transcription System","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T18:10:39.927965Z"},"links":{"citing_paper":"/paper/2509.10143"},"observation_digest":"sha256:3ad355fd3358487b26da0bfcd7a5ade5a3b0daea8e719825c51c6d7c4972e14e","observation_id":"bd73d1f9-474a-4cd6-999a-71d8bcc6ca43","resolution":{"observed_at":"2026-08-04T18:10:39.927965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:10:40.020375Z","title":"Once more diarization: Improving meeting transcription systems through segment-level speaker reassignment,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10143","last_updated":"2025-09-12T11:10:38Z","snapshot_observed_at":"2026-08-04T18:10:37.662565Z","submitted_at":"2025-09-12T11:10:38Z","title":"Error Analysis in a Modular Meeting Transcription System","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T18:10:40.020375Z"},"links":{"citing_paper":"/paper/2509.10143"},"observation_digest":"sha256:0cd08c2289febe1d8c9c063f403fd7552bdc941b4c092b132542a90eb39a61a8","observation_id":"ae8a23a4-3af4-4cd4-b4a0-da7a999f7e53","resolution":{"observed_at":"2026-08-04T18:10:40.020375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.06667","last_updated":"2024-12-28T02:38:02Z","snapshot_observed_at":"2026-08-05T07:51:25.401509Z","submitted_at":"2024-11-11T02:23:08Z","title":"DCF-DS: Deep Cascade Fusion of Diarization and Separation for Speech Recognition under Realistic Single-Channel Conditions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.06667","snapshot_observed_at":"2026-08-04T18:10:40.078010Z","title":"DCF-DS: Deep cascade fusion of diarization and separation for speech recognition under realistic single- channel conditions,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10143","last_updated":"2025-09-12T11:10:38Z","snapshot_observed_at":"2026-08-04T18:10:37.662565Z","submitted_at":"2025-09-12T11:10:38Z","title":"Error Analysis in a Modular Meeting Transcription System","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T18:10:40.078010Z"},"links":{"cited_paper":"/paper/2411.06667","citing_paper":"/paper/2509.10143"},"observation_digest":"sha256:977a9d7dd34163b0c2db6287b833d8735b13f48d65cf336c99f39378445499f4","observation_id":"76be257e-ad90-4e03-b668-4f3fda46443f","resolution":{"observed_at":"2026-08-04T18:10:40.078010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:10:40.157348Z","title":"MeetEval: A toolkit for computation of word error rates for meeting transcription systems,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.10143","last_updated":"2025-09-12T11:10:38Z","snapshot_observed_at":"2026-08-04T18:10:37.662565Z","submitted_at":"2025-09-12T11:10:38Z","title":"Error Analysis in a Modular Meeting Transcription System","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T18:10:40.157348Z"},"links":{"citing_paper":"/paper/2509.10143"},"observation_digest":"sha256:a59831905f1bd3f6c66b85ee392d9c51044f7929a88659083720b7ac6da8b4d4","observation_id":"87c21bf6-8b17-43d6-85ab-2e5308e7384b","resolution":{"observed_at":"2026-08-04T18:10:40.157348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:10:40.238807Z","title":"Lib- riSpeech: An ASR corpus based on public domain audio books,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2509.10143","last_updated":"2025-09-12T11:10:38Z","snapshot_observed_at":"2026-08-04T18:10:37.662565Z","submitted_at":"2025-09-12T11:10:38Z","title":"Error Analysis in a Modular Meeting Transcription System","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T18:10:40.238807Z"},"links":{"citing_paper":"/paper/2509.10143"},"observation_digest":"sha256:9392dedd87ff03bc4d8ecad9f957ea87500f243a5728fe0c35a0d28bb8e00bab","observation_id":"1fbd8dd8-80a2-4797-b78d-f4f1d0d9bd3a","resolution":{"observed_at":"2026-08-04T18:10:40.238807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.13934","last_updated":"2019-10-30T15:39:31Z","snapshot_observed_at":"2026-08-03T00:57:05.053936Z","submitted_at":"2019-10-30T15:39:31Z","title":"SMS-WSJ: Database, performance measures, and baseline recipe for multi-channel source separation and recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.13934","snapshot_observed_at":"2026-08-04T18:10:40.322325Z","title":"SMS-WSJ: Database, performance measures, and baseline recipe for multi-channel source separation and recognition,","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2509.10143","last_updated":"2025-09-12T11:10:38Z","snapshot_observed_at":"2026-08-04T18:10:37.662565Z","submitted_at":"2025-09-12T11:10:38Z","title":"Error Analysis in a Modular Meeting Transcription System","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T18:10:40.322325Z"},"links":{"cited_paper":"/paper/1910.13934","citing_paper":"/paper/2509.10143"},"observation_digest":"sha256:3fbdfd1adbf049f606e854e25b768d69c39a8905807af730253c2911f9f8f6de","observation_id":"c699054d-36e7-4dd4-aede-b0776dd0b348","resolution":{"observed_at":"2026-08-04T18:10:40.322325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:10:40.405449Z","title":"Language mod- eling with deep transformers,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.10143","last_updated":"2025-09-12T11:10:38Z","snapshot_observed_at":"2026-08-04T18:10:37.662565Z","submitted_at":"2025-09-12T11:10:38Z","title":"Error Analysis in a Modular Meeting Transcription System","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T18:10:40.405449Z"},"links":{"citing_paper":"/paper/2509.10143"},"observation_digest":"sha256:9dfce58ba2a8199d428dae77fadb2d6322eced8746f38a4d0327f8faf02aae8d","observation_id":"d920977f-7702-41cc-965b-5858e6b50eba","resolution":{"observed_at":"2026-08-04T18:10:40.405449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:10:40.488271Z","title":"Con- former: Convolution-augmented transformer for speech recognition,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.10143","last_updated":"2025-09-12T11:10:38Z","snapshot_observed_at":"2026-08-04T18:10:37.662565Z","submitted_at":"2025-09-12T11:10:38Z","title":"Error Analysis in a Modular Meeting Transcription System","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T18:10:40.488271Z"},"links":{"citing_paper":"/paper/2509.10143"},"observation_digest":"sha256:d8ba17f1aa0683589665ca91ff15fa6c99325b507a0d91f769c5c018e4cd6007","observation_id":"ae4beec9-4e1f-4528-b7e4-06fd86d080b6","resolution":{"observed_at":"2026-08-04T18:10:40.488271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:10:40.576472Z","title":"WavLM: Large-scale self-supervised pre-training for full stack speech process- ing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.10143","last_updated":"2025-09-12T11:10:38Z","snapshot_observed_at":"2026-08-04T18:10:37.662565Z","submitted_at":"2025-09-12T11:10:38Z","title":"Error Analysis in a Modular Meeting Transcription System","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T18:10:40.576472Z"},"links":{"citing_paper":"/paper/2509.10143"},"observation_digest":"sha256:8f6495f3196fe6cac2ed9b8fe41144dd2d30afd0decd2bc5d06dad780b479090","observation_id":"45e2cc10-4608-4fc7-91c5-9fb1c07307f8","resolution":{"observed_at":"2026-08-04T18:10:40.576472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:10:40.677516Z","title":"Performance measurement in blind audio source separation,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2509.10143","last_updated":"2025-09-12T11:10:38Z","snapshot_observed_at":"2026-08-04T18:10:37.662565Z","submitted_at":"2025-09-12T11:10:38Z","title":"Error Analysis in a Modular Meeting Transcription System","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T18:10:40.677516Z"},"links":{"citing_paper":"/paper/2509.10143"},"observation_digest":"sha256:9ce3e1ce1797f1105f625aa4176860a4093a873086a25a872570b12a562b857f","observation_id":"61ade70f-a860-49b4-aef1-71c4f9740ec5","resolution":{"observed_at":"2026-08-04T18:10:40.677516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.10143","last_updated":"2025-09-12T11:10:38Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-04T18:10:37.662565Z","submitted_at":"2025-09-12T11:10:38Z","title":"Error Analysis in a Modular Meeting Transcription System"},"reference_resolution":{"displayed":28,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":28,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":28},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 28 of 28 outbound references and 0 inbound Pith citation observations for arXiv:2509.10143."}