{"as_of":"2026-08-22T12:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b250dffadd71476456fc88ad1d7e0ff8ae6e8e7b09f09bfe7417cdcffd591f5a","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-13T00:46:07.473150Z","state":"measured"},{"denominator":38,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":38,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.09043/citation-record","integrity":"/paper/2607.09043/integrity","json":"/paper/2607.09043/citation-record.json","paper":"/paper/2607.09043"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2005.11262","last_updated":"2020-05-22T16:26:54Z","snapshot_observed_at":"2026-08-15T22:07:29.787968Z","submitted_at":"2020-05-22T16:26:54Z","title":"LibriMix: An Open-Source Dataset for Generalizable Speech Separation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.11262","snapshot_observed_at":"2026-07-13T00:46:07.473150Z","title":"LibriMix: An open-source dataset for generalizable speech separation,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2607.09043","last_updated":"2026-07-10T02:18:02Z","snapshot_observed_at":"2026-08-20T07:23:51.419109Z","submitted_at":"2026-07-10T02:18:02Z","title":"Technical Report for MERL's Real-TSE Challenge Submission","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-13T00:46:07.473150Z"},"links":{"cited_paper":"/paper/2005.11262","citing_paper":"/paper/2607.09043"},"observation_digest":"sha256:8b54b2705cfc13b266302d0da6d3b844cc4336e2983dcf7f45946d9e96253d97","observation_id":"45de677f-dd71-40c4-8ab4-6bc719a5a567","resolution":{"observed_at":"2026-07-13T00:46:07.473150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:46:07.473150Z","title":"CHiME-6 challenge: Tackling multispeaker speech recognition for unsegmented recordings,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.09043","last_updated":"2026-07-10T02:18:02Z","snapshot_observed_at":"2026-08-20T07:23:51.419109Z","submitted_at":"2026-07-10T02:18:02Z","title":"Technical Report for MERL's Real-TSE Challenge Submission","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-13T00:46:07.473150Z"},"links":{"citing_paper":"/paper/2607.09043"},"observation_digest":"sha256:9220d3e910edb5e6f049293640a389e4df7ed759bdf46822ba36e6ceb4e44971","observation_id":"668bc8f3-49e6-4558-87b1-75bf628efd60","resolution":{"observed_at":"2026-07-13T00:46:07.473150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:46:07.473150Z","title":"DiPCo – dinner party corpus,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.09043","last_updated":"2026-07-10T02:18:02Z","snapshot_observed_at":"2026-08-20T07:23:51.419109Z","submitted_at":"2026-07-10T02:18:02Z","title":"Technical Report for MERL's Real-TSE Challenge Submission","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-13T00:46:07.473150Z"},"links":{"citing_paper":"/paper/2607.09043"},"observation_digest":"sha256:a8dd7e0bae407622683ccca7bed076eb0919488bfd6260e6b7b10151e68689c8","observation_id":"9fb26037-5de1-48d8-a3e4-b083dbfbc968","resolution":{"observed_at":"2026-07-13T00:46:07.473150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:46:07.473150Z","title":"REAL-T: Real conversational mixtures for target speaker extraction,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09043","last_updated":"2026-07-10T02:18:02Z","snapshot_observed_at":"2026-08-20T07:23:51.419109Z","submitted_at":"2026-07-10T02:18:02Z","title":"Technical Report for MERL's Real-TSE Challenge Submission","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-13T00:46:07.473150Z"},"links":{"citing_paper":"/paper/2607.09043"},"observation_digest":"sha256:4f4d9ee5d5ac3811f7b7bc51737deabb463dc66f5640adc336dd76ca7a17dce8","observation_id":"9cafb775-b84e-439a-9050-28a2717c0306","resolution":{"observed_at":"2026-07-13T00:46:07.473150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:46:07.473150Z","title":"Multi-level speaker representation for target speaker extraction,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09043","last_updated":"2026-07-10T02:18:02Z","snapshot_observed_at":"2026-08-20T07:23:51.419109Z","submitted_at":"2026-07-10T02:18:02Z","title":"Technical Report for MERL's Real-TSE Challenge Submission","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-13T00:46:07.473150Z"},"links":{"citing_paper":"/paper/2607.09043"},"observation_digest":"sha256:fa859b3ff357943c31845170e731bfa60bc1694dc23113187102d5909bf06c92","observation_id":"46b270a8-e1b0-4b1b-8378-30cdd1ce11a8","resolution":{"observed_at":"2026-07-13T00:46:07.473150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:46:07.473150Z","title":"ECAPA-TDNN: Emphasized channel attention, propagation and aggregation in TDNN based speaker verification,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.09043","last_updated":"2026-07-10T02:18:02Z","snapshot_observed_at":"2026-08-20T07:23:51.419109Z","submitted_at":"2026-07-10T02:18:02Z","title":"Technical Report for MERL's Real-TSE Challenge Submission","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-13T00:46:07.473150Z"},"links":{"citing_paper":"/paper/2607.09043"},"observation_digest":"sha256:5b2e763574ab27279dd5a161723bb9a8a0a9106265c195511b066fb12f5ff7c7","observation_id":"53a2da5e-fbaf-4f03-a4ef-be7c2ed6ed8f","resolution":{"observed_at":"2026-07-13T00:46:07.473150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:46:07.473150Z","title":"LibriSpeech: An ASR corpus based on public domain audio books,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.09043","last_updated":"2026-07-10T02:18:02Z","snapshot_observed_at":"2026-08-20T07:23:51.419109Z","submitted_at":"2026-07-10T02:18:02Z","title":"Technical Report for MERL's Real-TSE Challenge Submission","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-13T00:46:07.473150Z"},"links":{"citing_paper":"/paper/2607.09043"},"observation_digest":"sha256:b605c89da5a677673243fa728f37c391c47a60b1eeaac24e1929e3f068e9067b","observation_id":"4f629c90-bc05-4e5d-8a1c-b62ab48e169d","resolution":{"observed_at":"2026-07-13T00:46:07.473150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:46:07.473150Z","title":"V oxCeleb2: Deep speaker recognition,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.09043","last_updated":"2026-07-10T02:18:02Z","snapshot_observed_at":"2026-08-20T07:23:51.419109Z","submitted_at":"2026-07-10T02:18:02Z","title":"Technical Report for MERL's Real-TSE Challenge Submission","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-13T00:46:07.473150Z"},"links":{"citing_paper":"/paper/2607.09043"},"observation_digest":"sha256:83d84645f6737892ed2aadf50d7750c9354963ae7a2093b9c5d089013f19afab","observation_id":"0f856eea-f753-4d19-8858-491171590f15","resolution":{"observed_at":"2026-07-13T00:46:07.473150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:46:07.473150Z","title":"Emilia: A large- scale, extensive, multilingual, and diverse dataset for speech generation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09043","last_updated":"2026-07-10T02:18:02Z","snapshot_observed_at":"2026-08-20T07:23:51.419109Z","submitted_at":"2026-07-10T02:18:02Z","title":"Technical Report for MERL's Real-TSE Challenge Submission","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-13T00:46:07.473150Z"},"links":{"citing_paper":"/paper/2607.09043"},"observation_digest":"sha256:4999da8daa09a411871428d755e4903b06c8a9442612f0d99d1019d86f8e55c7","observation_id":"26d14a16-ccc4-4176-853d-6fd028f1959d","resolution":{"observed_at":"2026-07-13T00:46:07.473150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:46:07.473150Z","title":"CSTR VCTK Corpus: English multi-speaker corpus for CSTR voice cloning toolkit (version 0.92),","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.09043","last_updated":"2026-07-10T02:18:02Z","snapshot_observed_at":"2026-08-20T07:23:51.419109Z","submitted_at":"2026-07-10T02:18:02Z","title":"Technical Report for MERL's Real-TSE Challenge Submission","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-13T00:46:07.473150Z"},"links":{"citing_paper":"/paper/2607.09043"},"observation_digest":"sha256:0d31787d44f5feedaa2e4dae92528ac74feaae63d4554ab8d83e788f3ee16c3a","observation_id":"e8c66616-16d3-48d1-8bcc-821371d9af4c","resolution":{"observed_at":"2026-07-13T00:46:07.473150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:46:07.473150Z","title":"EARS: An anechoic fullband speech dataset benchmarked for speech enhancement and dereverberation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09043","last_updated":"2026-07-10T02:18:02Z","snapshot_observed_at":"2026-08-20T07:23:51.419109Z","submitted_at":"2026-07-10T02:18:02Z","title":"Technical Report for MERL's Real-TSE Challenge Submission","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-13T00:46:07.473150Z"},"links":{"citing_paper":"/paper/2607.09043"},"observation_digest":"sha256:fc5e89fb3acbd32508171ca2472331351455dcf21062a922733ad2d5471b0e87","observation_id":"8efdac70-2656-40b4-97d2-b18a92b2fea1","resolution":{"observed_at":"2026-07-13T00:46:07.473150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:46:07.473150Z","title":"ClearerV oice-Studio: Bridging advanced speech processing research and practical deployment,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09043","last_updated":"2026-07-10T02:18:02Z","snapshot_observed_at":"2026-08-20T07:23:51.419109Z","submitted_at":"2026-07-10T02:18:02Z","title":"Technical Report for MERL's Real-TSE Challenge Submission","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-13T00:46:07.473150Z"},"links":{"citing_paper":"/paper/2607.09043"},"observation_digest":"sha256:e77002c00e958e4e76e3318c3b7cbbdece09abd7cb993652c29233efa99b2878","observation_id":"edf4b75b-03df-4d9c-b44e-adfe70774a54","resolution":{"observed_at":"2026-07-13T00:46:07.473150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:46:07.473150Z","title":"MossFormer: Pushing the performance limit of monaural speech separation using gated single-head transformer with convolution-augmented joint self-attentions,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09043","last_updated":"2026-07-10T02:18:02Z","snapshot_observed_at":"2026-08-20T07:23:51.419109Z","submitted_at":"2026-07-10T02:18:02Z","title":"Technical Report for MERL's Real-TSE Challenge Submission","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-13T00:46:07.473150Z"},"links":{"citing_paper":"/paper/2607.09043"},"observation_digest":"sha256:721688ccc1d4b0e6558dc2d335fc01da94ca4f88b33ce572223664635639d6bf","observation_id":"6547b1f9-7046-4481-b76a-7d6d386e02d9","resolution":{"observed_at":"2026-07-13T00:46:07.473150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:46:07.473150Z","title":"WeSpeaker: A research and production oriented speaker embedding learning toolkit,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09043","last_updated":"2026-07-10T02:18:02Z","snapshot_observed_at":"2026-08-20T07:23:51.419109Z","submitted_at":"2026-07-10T02:18:02Z","title":"Technical Report for MERL's Real-TSE Challenge Submission","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-13T00:46:07.473150Z"},"links":{"citing_paper":"/paper/2607.09043"},"observation_digest":"sha256:ac0ca9356a06780660f734ef4e2dfca6634bc72f73a0c524c9450718b5775a15","observation_id":"ebd377a1-a72b-48eb-99f0-ff4b4f83001f","resolution":{"observed_at":"2026-07-13T00:46:07.473150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:46:07.473150Z","title":"Montreal forced aligner: Trainable text-speech alignment using Kaldi,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.09043","last_updated":"2026-07-10T02:18:02Z","snapshot_observed_at":"2026-08-20T07:23:51.419109Z","submitted_at":"2026-07-10T02:18:02Z","title":"Technical Report for MERL's Real-TSE Challenge Submission","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-13T00:46:07.473150Z"},"links":{"citing_paper":"/paper/2607.09043"},"observation_digest":"sha256:3183d2e2a5679d175311c334b344760fe4ddf57c20e864f00a3bc9b953c519ce","observation_id":"b906c1af-a526-4703-85b7-2023a222cb54","resolution":{"observed_at":"2026-07-13T00:46:07.473150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:46:07.473150Z","title":"ICASSP 2022 deep noise suppression challenge,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.09043","last_updated":"2026-07-10T02:18:02Z","snapshot_observed_at":"2026-08-20T07:23:51.419109Z","submitted_at":"2026-07-10T02:18:02Z","title":"Technical Report for MERL's Real-TSE Challenge Submission","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-13T00:46:07.473150Z"},"links":{"citing_paper":"/paper/2607.09043"},"observation_digest":"sha256:f3528e7d5169c12647b724dcfc09a784772928735828bce1ade28d8866f2a033","observation_id":"aad424cb-ce15-4a18-bf28-b99005a720d4","resolution":{"observed_at":"2026-07-13T00:46:07.473150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:46:07.473150Z","title":"Pyroomacoustics: A python package for audio room simulation and array processing algorithms,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.09043","last_updated":"2026-07-10T02:18:02Z","snapshot_observed_at":"2026-08-20T07:23:51.419109Z","submitted_at":"2026-07-10T02:18:02Z","title":"Technical Report for MERL's Real-TSE Challenge Submission","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-13T00:46:07.473150Z"},"links":{"citing_paper":"/paper/2607.09043"},"observation_digest":"sha256:2e9cc2ff84e9652b3fb59e644d9020e4ced413776b5b02edbd54a4617b113313","observation_id":"49930dd8-35cc-4fbb-bcd5-ce4ee8d8985a","resolution":{"observed_at":"2026-07-13T00:46:07.473150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:46:07.473150Z","title":"The third CHiME speech separation and recognition challenge: Dataset, task and base- lines,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.09043","last_updated":"2026-07-10T02:18:02Z","snapshot_observed_at":"2026-08-20T07:23:51.419109Z","submitted_at":"2026-07-10T02:18:02Z","title":"Technical Report for MERL's Real-TSE Challenge Submission","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-13T00:46:07.473150Z"},"links":{"citing_paper":"/paper/2607.09043"},"observation_digest":"sha256:7beeb34832e99e6f864200e672dd9725d2c8c29698327cfd89bf33b78ac11bcc","observation_id":"2a873a62-bf88-498e-a960-aef57599ef82","resolution":{"observed_at":"2026-07-13T00:46:07.473150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:46:07.473150Z","title":"The diverse environments multi- channel acoustic noise database (DEMAND): A database of multichan- nel environmental noise recordings,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2607.09043","last_updated":"2026-07-10T02:18:02Z","snapshot_observed_at":"2026-08-20T07:23:51.419109Z","submitted_at":"2026-07-10T02:18:02Z","title":"Technical Report for MERL's Real-TSE Challenge Submission","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-13T00:46:07.473150Z"},"links":{"citing_paper":"/paper/2607.09043"},"observation_digest":"sha256:6a64db7b02dfc9f4b7b5ed8b481eb9b481c2b415fc262915904fca8c08ca1346","observation_id":"b37269b7-5a37-42bb-b8d3-1f17dc0d0571","resolution":{"observed_at":"2026-07-13T00:46:07.473150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:46:07.473150Z","title":"FMA: A dataset for music analysis,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.09043","last_updated":"2026-07-10T02:18:02Z","snapshot_observed_at":"2026-08-20T07:23:51.419109Z","submitted_at":"2026-07-10T02:18:02Z","title":"Technical Report for MERL's Real-TSE Challenge Submission","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-13T00:46:07.473150Z"},"links":{"citing_paper":"/paper/2607.09043"},"observation_digest":"sha256:6e40ccea421280b50e2b92e934ad7d0cf96b5095907f031bb4d65f098f21d200","observation_id":"2f11c419-bc0c-4a29-81fe-1a1831bdfdd1","resolution":{"observed_at":"2026-07-13T00:46:07.473150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:46:07.473150Z","title":"FSD50K: An open dataset of human-labeled sound events,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.09043","last_updated":"2026-07-10T02:18:02Z","snapshot_observed_at":"2026-08-20T07:23:51.419109Z","submitted_at":"2026-07-10T02:18:02Z","title":"Technical Report for MERL's Real-TSE Challenge Submission","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-13T00:46:07.473150Z"},"links":{"citing_paper":"/paper/2607.09043"},"observation_digest":"sha256:868db23c9c62e908edecfead10661281786141690c996b08b1fc8f1391886c27","observation_id":"93ab1202-82b7-4922-a10a-4da6f5249ef8","resolution":{"observed_at":"2026-07-13T00:46:07.473150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1510.08484","last_updated":"2015-10-28T20:59:04Z","snapshot_observed_at":"2026-08-18T07:31:38.105834Z","submitted_at":"2015-10-28T20:59:04Z","title":"MUSAN: A Music, Speech, and Noise Corpus","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1510.08484","snapshot_observed_at":"2026-07-13T00:46:07.473150Z","title":"MUSAN: A music, speech, and noise corpus,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.09043","last_updated":"2026-07-10T02:18:02Z","snapshot_observed_at":"2026-08-20T07:23:51.419109Z","submitted_at":"2026-07-10T02:18:02Z","title":"Technical Report for MERL's Real-TSE Challenge Submission","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-13T00:46:07.473150Z"},"links":{"cited_paper":"/paper/1510.08484","citing_paper":"/paper/2607.09043"},"observation_digest":"sha256:9ef27b88c02fb2eac1ac93fa44377ab1775d43742ffb1f97b46ab16d2323956b","observation_id":"82dcd745-3b1f-461e-a83d-f20d48cf7352","resolution":{"observed_at":"2026-07-13T00:46:07.473150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:46:07.473150Z","title":"WHAM!: Extending speech separation to noisy environments,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.09043","last_updated":"2026-07-10T02:18:02Z","snapshot_observed_at":"2026-08-20T07:23:51.419109Z","submitted_at":"2026-07-10T02:18:02Z","title":"Technical Report for MERL's Real-TSE Challenge Submission","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-13T00:46:07.473150Z"},"links":{"citing_paper":"/paper/2607.09043"},"observation_digest":"sha256:6954e0ca5c39d2f648c1adce8c1972b153a3a005f873c209f9cd1e7a28a861b2","observation_id":"c53e33f2-3f84-4f4a-8854-17d7b5b51aa3","resolution":{"observed_at":"2026-07-13T00:46:07.473150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:46:07.473150Z","title":"URGENT challenge: Universality, robustness, and generalizability for speech en- hancement,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09043","last_updated":"2026-07-10T02:18:02Z","snapshot_observed_at":"2026-08-20T07:23:51.419109Z","submitted_at":"2026-07-10T02:18:02Z","title":"Technical Report for MERL's Real-TSE Challenge Submission","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-13T00:46:07.473150Z"},"links":{"citing_paper":"/paper/2607.09043"},"observation_digest":"sha256:9b91e707f11b65dd482d7717b0fef3a8afe5f227e6e3c7568336f7877dd87743","observation_id":"723cf22c-f13b-49e1-9a06-190c057497e4","resolution":{"observed_at":"2026-07-13T00:46:07.473150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:46:07.473150Z","title":"The AMI meeting corpus: A pre-announcement,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2607.09043","last_updated":"2026-07-10T02:18:02Z","snapshot_observed_at":"2026-08-20T07:23:51.419109Z","submitted_at":"2026-07-10T02:18:02Z","title":"Technical Report for MERL's Real-TSE Challenge Submission","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-13T00:46:07.473150Z"},"links":{"citing_paper":"/paper/2607.09043"},"observation_digest":"sha256:fd898b9d587641206fd967a174e3a18b4a53b5f194f7112033bfe84d10f86b4f","observation_id":"b7e1005a-d13d-4b30-b8c9-5c7205714d87","resolution":{"observed_at":"2026-07-13T00:46:07.473150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:46:07.473150Z","title":"AISHELL-4: An open source dataset for speech enhancement, separation, recognition and speaker diarization in conference scenario,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.09043","last_updated":"2026-07-10T02:18:02Z","snapshot_observed_at":"2026-08-20T07:23:51.419109Z","submitted_at":"2026-07-10T02:18:02Z","title":"Technical Report for MERL's Real-TSE Challenge Submission","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-13T00:46:07.473150Z"},"links":{"citing_paper":"/paper/2607.09043"},"observation_digest":"sha256:aff77f98110053eed32f6a45058caebd7902413755251b338d822be86e9044d9","observation_id":"dadd1aa8-abb5-4279-98e2-4eec2928f85f","resolution":{"observed_at":"2026-07-13T00:46:07.473150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:46:07.473150Z","title":"AISHELL-5: The first open-source in-car multi-channel multi-speaker speech dataset for automatic speech diarization and recognition,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09043","last_updated":"2026-07-10T02:18:02Z","snapshot_observed_at":"2026-08-20T07:23:51.419109Z","submitted_at":"2026-07-10T02:18:02Z","title":"Technical Report for MERL's Real-TSE Challenge Submission","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-13T00:46:07.473150Z"},"links":{"citing_paper":"/paper/2607.09043"},"observation_digest":"sha256:74d6f540f956e8aa74b80e7f40674dc30c06e2f762af7b544e9213a5a8fb4fd8","observation_id":"ba5a1f38-f383-41c5-8afe-837b86f73594","resolution":{"observed_at":"2026-07-13T00:46:07.473150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:46:07.473150Z","title":"Front-end processing for the CHiME-5 dinner party scenario,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.09043","last_updated":"2026-07-10T02:18:02Z","snapshot_observed_at":"2026-08-20T07:23:51.419109Z","submitted_at":"2026-07-10T02:18:02Z","title":"Technical Report for MERL's Real-TSE Challenge Submission","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-13T00:46:07.473150Z"},"links":{"citing_paper":"/paper/2607.09043"},"observation_digest":"sha256:1c4418805ea6b2a42036989518a69454318063baa3e1d37aa4382bea3a2b2367","observation_id":"4e70fe3c-dff9-4c4e-8f11-3ffddb176fd6","resolution":{"observed_at":"2026-07-13T00:46:07.473150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:46:07.473150Z","title":"Gen- erating training targets for real-world speech enhancement via close- to-distant microphone projection,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09043","last_updated":"2026-07-10T02:18:02Z","snapshot_observed_at":"2026-08-20T07:23:51.419109Z","submitted_at":"2026-07-10T02:18:02Z","title":"Technical Report for MERL's Real-TSE Challenge Submission","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-13T00:46:07.473150Z"},"links":{"citing_paper":"/paper/2607.09043"},"observation_digest":"sha256:d92609131f45a84d7c3e5fb9f099ccabb4e6d47f214fa2b811e2a9b2adf72124","observation_id":"75a22edc-90d0-4b13-9650-729ddd5edb97","resolution":{"observed_at":"2026-07-13T00:46:07.473150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:46:07.473150Z","title":"Canary-1B-V2 & Parakeet- TDT-0.6B-V3: Efficient and high-performance models for multilingual ASR and AST,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09043","last_updated":"2026-07-10T02:18:02Z","snapshot_observed_at":"2026-08-20T07:23:51.419109Z","submitted_at":"2026-07-10T02:18:02Z","title":"Technical Report for MERL's Real-TSE Challenge Submission","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-13T00:46:07.473150Z"},"links":{"citing_paper":"/paper/2607.09043"},"observation_digest":"sha256:96ba694dc77cbab4cb506d370d2941ccf10ec0659a97f452de5755c45f86f955","observation_id":"36d59202-b832-4f64-825e-a6ce4319009c","resolution":{"observed_at":"2026-07-13T00:46:07.473150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:46:07.473150Z","title":"Curriculum learning,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2607.09043","last_updated":"2026-07-10T02:18:02Z","snapshot_observed_at":"2026-08-20T07:23:51.419109Z","submitted_at":"2026-07-10T02:18:02Z","title":"Technical Report for MERL's Real-TSE Challenge Submission","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-13T00:46:07.473150Z"},"links":{"citing_paper":"/paper/2607.09043"},"observation_digest":"sha256:c7e932b7d878a590bc16dfa85ee4c8fb0397a68276460982e8e971f187835671","observation_id":"1c930929-9bbb-430b-aa8a-4f1fa7511566","resolution":{"observed_at":"2026-07-13T00:46:07.473150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.15442","last_updated":"2026-05-14T21:53:10Z","snapshot_observed_at":"2026-08-16T22:49:25.391530Z","submitted_at":"2026-05-14T21:53:10Z","title":"Mind the Gap: Impact of Synthetic Conversational Data on Multi-Talker ASR and Speaker Diarization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.15442","snapshot_observed_at":"2026-07-13T00:46:07.473150Z","title":"Mind the gap: Impact of synthetic conversational data on multi-talker ASR and speaker diarization,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09043","last_updated":"2026-07-10T02:18:02Z","snapshot_observed_at":"2026-08-20T07:23:51.419109Z","submitted_at":"2026-07-10T02:18:02Z","title":"Technical Report for MERL's Real-TSE Challenge Submission","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-13T00:46:07.473150Z"},"links":{"cited_paper":"/paper/2605.15442","citing_paper":"/paper/2607.09043"},"observation_digest":"sha256:471ec64a8787f3a0f173ee3e3761606aa858f4952ed7ccb531915418a9c9d07e","observation_id":"3abfbe33-957b-4927-991a-98aa17a3c69d","resolution":{"observed_at":"2026-07-13T00:46:07.473150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:46:07.473150Z","title":"Decoupled weight decay regularization,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.09043","last_updated":"2026-07-10T02:18:02Z","snapshot_observed_at":"2026-08-20T07:23:51.419109Z","submitted_at":"2026-07-10T02:18:02Z","title":"Technical Report for MERL's Real-TSE Challenge Submission","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-13T00:46:07.473150Z"},"links":{"citing_paper":"/paper/2607.09043"},"observation_digest":"sha256:273f69801ccd639d7ffe6a544d772d09835e1ef5033871ad22346f00767a6bbf","observation_id":"cb4f4ad5-b2e0-4581-901a-a1cf75e88ed7","resolution":{"observed_at":"2026-07-13T00:46:07.473150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:46:07.473150Z","title":"SGDR: Stochastic gradient descent with warm restarts,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.09043","last_updated":"2026-07-10T02:18:02Z","snapshot_observed_at":"2026-08-20T07:23:51.419109Z","submitted_at":"2026-07-10T02:18:02Z","title":"Technical Report for MERL's Real-TSE Challenge Submission","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-13T00:46:07.473150Z"},"links":{"citing_paper":"/paper/2607.09043"},"observation_digest":"sha256:e42ce68f14d4f5f20f47e8b8d46ae5cfc4950f17f675a466a52fb10d26cbfee0","observation_id":"2bc77aa6-f45e-408c-886e-5c42411f2b26","resolution":{"observed_at":"2026-07-13T00:46:07.473150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:46:07.473150Z","title":"The text-to-speech in the wild (TITW) database,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09043","last_updated":"2026-07-10T02:18:02Z","snapshot_observed_at":"2026-08-20T07:23:51.419109Z","submitted_at":"2026-07-10T02:18:02Z","title":"Technical Report for MERL's Real-TSE Challenge Submission","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-13T00:46:07.473150Z"},"links":{"citing_paper":"/paper/2607.09043"},"observation_digest":"sha256:200eb31edb87894613474b024270ca5fcf453bf72cf5ef065cb1ce06cb5ac775","observation_id":"2016e4be-6226-4bff-ad45-286c9cb37749","resolution":{"observed_at":"2026-07-13T00:46:07.473150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:46:07.473150Z","title":"Multilayer feedforward networks are universal approximators,","venue":null,"work_id":null,"year":1989},"citing_paper":{"arxiv_id":"2607.09043","last_updated":"2026-07-10T02:18:02Z","snapshot_observed_at":"2026-08-20T07:23:51.419109Z","submitted_at":"2026-07-10T02:18:02Z","title":"Technical Report for MERL's Real-TSE Challenge Submission","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-13T00:46:07.473150Z"},"links":{"citing_paper":"/paper/2607.09043"},"observation_digest":"sha256:2801e97f5649fcc3c7d3777c833c24867cc9203034b23b25d4da9723f244714d","observation_id":"0159c16d-3bc6-46ab-8cb1-cf44a881a700","resolution":{"observed_at":"2026-07-13T00:46:07.473150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.05678","last_updated":"2026-06-04T04:00:48Z","snapshot_observed_at":"2026-08-16T03:28:58.316103Z","submitted_at":"2026-06-04T04:00:48Z","title":"Beyond Waveform Robustness: Robust Feature-Vocoder Adversarial Attacks on Automatic Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.05678","snapshot_observed_at":"2026-07-13T00:46:07.473150Z","title":"Beyond waveform robustness: Robust feature-vocoder adversarial attacks on automatic speech recognition,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09043","last_updated":"2026-07-10T02:18:02Z","snapshot_observed_at":"2026-08-20T07:23:51.419109Z","submitted_at":"2026-07-10T02:18:02Z","title":"Technical Report for MERL's Real-TSE Challenge Submission","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-13T00:46:07.473150Z"},"links":{"cited_paper":"/paper/2606.05678","citing_paper":"/paper/2607.09043"},"observation_digest":"sha256:1362e5f7e23060bace7018cc54032377c4c6759e188f41e484fbbecf038f8937","observation_id":"bdd45ca2-5143-4737-94f8-63b91b0769ea","resolution":{"observed_at":"2026-07-13T00:46:07.473150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.31105","last_updated":"2026-06-30T04:00:14Z","snapshot_observed_at":"2026-08-10T01:22:37.098903Z","submitted_at":"2026-06-30T04:00:14Z","title":"Attacking UTMOS: Probing the Robustness of a Speech Quality Assessment Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.31105","snapshot_observed_at":"2026-07-13T00:46:07.473150Z","title":"Attacking UTMOS: Probing the robustness of a speech quality assessment model,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09043","last_updated":"2026-07-10T02:18:02Z","snapshot_observed_at":"2026-08-20T07:23:51.419109Z","submitted_at":"2026-07-10T02:18:02Z","title":"Technical Report for MERL's Real-TSE Challenge Submission","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-13T00:46:07.473150Z"},"links":{"cited_paper":"/paper/2606.31105","citing_paper":"/paper/2607.09043"},"observation_digest":"sha256:34cba627f20658ea6c4bc35d64452bedf97b0b3eecc0de1ccde54b522c2f8f27","observation_id":"9ad6b160-8318-4c6f-82eb-3cd5ebb69fcf","resolution":{"observed_at":"2026-07-13T00:46:07.473150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.09043","last_updated":"2026-07-10T02:18:02Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-20T07:23:51.419109Z","submitted_at":"2026-07-10T02:18:02Z","title":"Technical Report for MERL's Real-TSE Challenge Submission"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":38,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 0 inbound Pith citation observations for arXiv:2607.09043."}