{"as_of":"2026-08-09T12:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f4d5c05e59e4695923ac1f3cb8a71663b5cfadfac36669741b532a4e139558fb","coverage":[{"denominator":27,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T22:57:13.478117Z","state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.20190/citation-record","integrity":"/paper/2506.20190/integrity","json":"/paper/2506.20190/citation-record.json","paper":"/paper/2506.20190"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/odyssey","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:57:13.963886Z","title":"In: The Speaker and Language Recognition Work- ECAPA-TDNN and x-vector Speaker Representations in Zero-shot TTS 11 shop (Odyssey 2018)","venue":null,"work_id":"5a8ad4be-d500-4449-9524-921f35d36f25","year":2018},"citing_paper":{"arxiv_id":"2506.20190","last_updated":"2025-06-25T07:31:32Z","snapshot_observed_at":"2026-08-09T10:25:36.125587Z","submitted_at":"2025-06-25T07:31:32Z","title":"An Exploration of ECAPA-TDNN and x-vector Speaker Representations in Zero-shot Multi-speaker TTS","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T22:57:11.772610Z"},"links":{"citing_paper":"/paper/2506.20190"},"observation_digest":"sha256:230acc40a79eb3745367025c1ee27666d467af61191d02cf95147eeb96d6abcf","observation_id":"dcdcf550-576f-49b6-9d69-d880bcb2704d","resolution":{"observed_at":"2026-08-06T22:57:14.013109Z","resolver_source":"doi_truncated","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:57:15.484578Z","title":"In: Pro- ceedings of the 39th International Conference on Machine Learning","venue":null,"work_id":"48da9367-c057-4969-a81d-bead6e4c3204","year":2022},"citing_paper":{"arxiv_id":"2506.20190","last_updated":"2025-06-25T07:31:32Z","snapshot_observed_at":"2026-08-09T10:25:36.125587Z","submitted_at":"2025-06-25T07:31:32Z","title":"An Exploration of ECAPA-TDNN and x-vector Speaker Representations in Zero-shot Multi-speaker TTS","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T22:57:11.825528Z"},"links":{"citing_paper":"/paper/2506.20190"},"observation_digest":"sha256:04e843a7418ebe55200fa14427a5f95fb0996ee5d3c59db00590f9dc54f1a470","observation_id":"79e30804-b4ea-4258-827c-3a0c0dfa0d2f","resolution":{"observed_at":"2026-08-06T22:57:15.488641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:57:11.883163Z","title":"IEEE Journal of Selected Topics in Signal Processing 16(6), 1505–1518 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20190","last_updated":"2025-06-25T07:31:32Z","snapshot_observed_at":"2026-08-09T10:25:36.125587Z","submitted_at":"2025-06-25T07:31:32Z","title":"An Exploration of ECAPA-TDNN and x-vector Speaker Representations in Zero-shot Multi-speaker TTS","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T22:57:11.883163Z"},"links":{"citing_paper":"/paper/2506.20190"},"observation_digest":"sha256:d5b39e4ae79de2b9ca11f4ebcd6f1be07d27fb2c3399899ca5e8562151cbb91b","observation_id":"1b2d2f7e-dc7a-4966-8978-d0bb87a19090","resolution":{"observed_at":"2026-08-06T22:57:11.883163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:57:15.471046Z","title":"In: Interspeech 2018","venue":null,"work_id":"d27fb8c7-1ed3-4bbe-a3b4-400425dae3ab","year":2018},"citing_paper":{"arxiv_id":"2506.20190","last_updated":"2025-06-25T07:31:32Z","snapshot_observed_at":"2026-08-09T10:25:36.125587Z","submitted_at":"2025-06-25T07:31:32Z","title":"An Exploration of ECAPA-TDNN and x-vector Speaker Representations in Zero-shot Multi-speaker TTS","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T22:57:11.921746Z"},"links":{"citing_paper":"/paper/2506.20190"},"observation_digest":"sha256:dba4ac80a181b449ccc7ad2cb01708dc0a8b29090488f1ce6e5d6ed2c83afc40","observation_id":"935ae19e-30b5-4026-bd2e-e2f4ef26ce70","resolution":{"observed_at":"2026-08-06T22:57:15.474977Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2020.90545","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:57:15.246594Z","title":"In: ICASSP 2020 - 2020 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)","venue":null,"work_id":"d40db6f3-e2d5-400e-9ce8-ada62a0f8161","year":2020},"citing_paper":{"arxiv_id":"2506.20190","last_updated":"2025-06-25T07:31:32Z","snapshot_observed_at":"2026-08-09T10:25:36.125587Z","submitted_at":"2025-06-25T07:31:32Z","title":"An Exploration of ECAPA-TDNN and x-vector Speaker Representations in Zero-shot Multi-speaker TTS","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T22:57:11.973949Z"},"links":{"citing_paper":"/paper/2506.20190"},"observation_digest":"sha256:bf725657868fa4701dfb95f769c40a4846a5c34f9305f74ea2c3e394b55ab2fc","observation_id":"830fd93b-1392-4659-924f-fc4aa5c13aed","resolution":{"observed_at":"2026-08-06T22:57:15.253620Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/interspeech.2021-941","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:57:13.859478Z","title":"In: Interspeech 2021","venue":null,"work_id":"bc561d5c-997d-4e33-819c-7afd2d4b3756","year":2021},"citing_paper":{"arxiv_id":"2506.20190","last_updated":"2025-06-25T07:31:32Z","snapshot_observed_at":"2026-08-09T10:25:36.125587Z","submitted_at":"2025-06-25T07:31:32Z","title":"An Exploration of ECAPA-TDNN and x-vector Speaker Representations in Zero-shot Multi-speaker TTS","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T22:57:12.045062Z"},"links":{"citing_paper":"/paper/2506.20190"},"observation_digest":"sha256:e0167d7a625cb92f9995269e1b46825c88ed48aaeb4085203b4874ad2d7713a7","observation_id":"3a17af6a-3c5b-4c01-ba62-c89b53ee2cf2","resolution":{"observed_at":"2026-08-06T22:57:13.905773Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2010.20643","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:57:15.167546Z","title":"IEEE Transactions on Audio, Speech, and Language Processing 19(4), 788–798 (2011)","venue":null,"work_id":"6e0b3266-9e51-445a-b500-e9d19ff40907","year":2011},"citing_paper":{"arxiv_id":"2506.20190","last_updated":"2025-06-25T07:31:32Z","snapshot_observed_at":"2026-08-09T10:25:36.125587Z","submitted_at":"2025-06-25T07:31:32Z","title":"An Exploration of ECAPA-TDNN and x-vector Speaker Representations in Zero-shot Multi-speaker TTS","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T22:57:12.113697Z"},"links":{"citing_paper":"/paper/2506.20190"},"observation_digest":"sha256:2c7357cb20c53974b71bfda45a33b71e58d0c844abc5ee3e71fe28118848aa4d","observation_id":"8f8f99be-926c-43cf-8b91-8725241c3c57","resolution":{"observed_at":"2026-08-06T22:57:15.175186Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:57:15.457066Z","title":"In: Interspeech 2020","venue":null,"work_id":"127506bb-7cda-4ec5-a5bb-3b8892ebca34","year":2020},"citing_paper":{"arxiv_id":"2506.20190","last_updated":"2025-06-25T07:31:32Z","snapshot_observed_at":"2026-08-09T10:25:36.125587Z","submitted_at":"2025-06-25T07:31:32Z","title":"An Exploration of ECAPA-TDNN and x-vector Speaker Representations in Zero-shot Multi-speaker TTS","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T22:57:12.151790Z"},"links":{"citing_paper":"/paper/2506.20190"},"observation_digest":"sha256:5210a587decd80711fce526b682644e2840438ab2d660382eb5f9d1dc6033989","observation_id":"6d10d5ea-369c-43fe-a40c-c03b54bc0724","resolution":{"observed_at":"2026-08-06T22:57:15.461089Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/interspeech.2017-1038","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:57:13.736799Z","title":"In: Interspeech 2017","venue":null,"work_id":"bfd1b3ed-ede0-4aad-9b4b-edb1123393e8","year":2017},"citing_paper":{"arxiv_id":"2506.20190","last_updated":"2025-06-25T07:31:32Z","snapshot_observed_at":"2026-08-09T10:25:36.125587Z","submitted_at":"2025-06-25T07:31:32Z","title":"An Exploration of ECAPA-TDNN and x-vector Speaker Representations in Zero-shot Multi-speaker TTS","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T22:57:12.220275Z"},"links":{"citing_paper":"/paper/2506.20190"},"observation_digest":"sha256:59518e3de032c254d3d5357db924a02a44b9ee826f4e053cd2aad58c700df38c","observation_id":"95f63967-11bb-49bf-90a7-8ff11f7c4738","resolution":{"observed_at":"2026-08-06T22:57:13.794106Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/interspeech.2024-2091","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:57:13.625176Z","title":"In: Interspeech 2024","venue":null,"work_id":"de9e613c-2852-45db-97db-54e818bc81ea","year":2024},"citing_paper":{"arxiv_id":"2506.20190","last_updated":"2025-06-25T07:31:32Z","snapshot_observed_at":"2026-08-09T10:25:36.125587Z","submitted_at":"2025-06-25T07:31:32Z","title":"An Exploration of ECAPA-TDNN and x-vector Speaker Representations in Zero-shot Multi-speaker TTS","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T22:57:12.259821Z"},"links":{"citing_paper":"/paper/2506.20190"},"observation_digest":"sha256:8cb0807011e384fd5ef3fede8e57d2e13d735e0403d88ebb9adaef42cfb8b74e","observation_id":"2d988177-1436-446b-ad36-1baba1b81a82","resolution":{"observed_at":"2026-08-06T22:57:13.679056Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.14153","last_updated":"2020-09-29T16:55:25Z","snapshot_observed_at":"2026-08-07T10:06:53.626763Z","submitted_at":"2020-09-29T16:55:25Z","title":"Clova Baseline System for the VoxCeleb Speaker Recognition Challenge 2020","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.14153","snapshot_observed_at":"2026-08-06T22:57:12.329772Z","title":"arXiv preprint arXiv:2009.14153 (2020)","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.20190","last_updated":"2025-06-25T07:31:32Z","snapshot_observed_at":"2026-08-09T10:25:36.125587Z","submitted_at":"2025-06-25T07:31:32Z","title":"An Exploration of ECAPA-TDNN and x-vector Speaker Representations in Zero-shot Multi-speaker TTS","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T22:57:12.329772Z"},"links":{"cited_paper":"/paper/2009.14153","citing_paper":"/paper/2506.20190"},"observation_digest":"sha256:7965e33c293ac22b1e75092d9871eeb35c0beae8092c3dd5e90da5b5811bf787","observation_id":"53f3e544-2e05-4303-b900-4bdea016a0e0","resolution":{"observed_at":"2026-08-06T22:57:12.329772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:57:15.442889Z","title":null,"venue":null,"work_id":"748efaef-dcfc-49a7-9090-5003df9cd2f8","year":2015},"citing_paper":{"arxiv_id":"2506.20190","last_updated":"2025-06-25T07:31:32Z","snapshot_observed_at":"2026-08-09T10:25:36.125587Z","submitted_at":"2025-06-25T07:31:32Z","title":"An Exploration of ECAPA-TDNN and x-vector Speaker Representations in Zero-shot Multi-speaker TTS","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T22:57:12.390150Z"},"links":{"citing_paper":"/paper/2506.20190"},"observation_digest":"sha256:575bd0d9fbfbd8babb4be3c3902456f58955b9a18fd9dfba43aa158eca0b7f82","observation_id":"d0940b8b-4921-429d-a28c-b51fe3c67298","resolution":{"observed_at":"2026-08-06T22:57:15.447286Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:57:12.456522Z","title":"In: ICASSP 2025 - 2025 IEEE International Con- ference on Acoustics, Speech and Signal Processing (ICASSP)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20190","last_updated":"2025-06-25T07:31:32Z","snapshot_observed_at":"2026-08-09T10:25:36.125587Z","submitted_at":"2025-06-25T07:31:32Z","title":"An Exploration of ECAPA-TDNN and x-vector Speaker Representations in Zero-shot Multi-speaker TTS","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T22:57:12.456522Z"},"links":{"citing_paper":"/paper/2506.20190"},"observation_digest":"sha256:fd3d77147b1a8de9b6db1325957090c4d4dee3edea04f121ee08a5688ee21369","observation_id":"739d65f2-47ac-4d0d-a81a-95c1d8181f80","resolution":{"observed_at":"2026-08-06T22:57:12.456522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:57:15.427728Z","title":"In: Proceedings of the 38th International Conference on Machine Learning","venue":null,"work_id":"4e5ad1ca-34f6-46de-b296-eaac4d9e5ac2","year":2021},"citing_paper":{"arxiv_id":"2506.20190","last_updated":"2025-06-25T07:31:32Z","snapshot_observed_at":"2026-08-09T10:25:36.125587Z","submitted_at":"2025-06-25T07:31:32Z","title":"An Exploration of ECAPA-TDNN and x-vector Speaker Representations in Zero-shot Multi-speaker TTS","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T22:57:12.538209Z"},"links":{"citing_paper":"/paper/2506.20190"},"observation_digest":"sha256:355e35e4b0b5826ff48ef12eaa0ee942234d028b7887e6c52fea4fd46a339fe8","observation_id":"c4cb917c-824f-4457-a74f-5ea7d9b94cea","resolution":{"observed_at":"2026-08-06T22:57:15.432187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:57:12.612500Z","title":"In: ICASSP 2022 - 2022 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20190","last_updated":"2025-06-25T07:31:32Z","snapshot_observed_at":"2026-08-09T10:25:36.125587Z","submitted_at":"2025-06-25T07:31:32Z","title":"An Exploration of ECAPA-TDNN and x-vector Speaker Representations in Zero-shot Multi-speaker TTS","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T22:57:12.612500Z"},"links":{"citing_paper":"/paper/2506.20190"},"observation_digest":"sha256:0bc9d96c3a93e3c56a764340b2126d97662ec5de4d24e7a05bcafa1099b1c048","observation_id":"efbbfec1-8a8e-4169-ba63-b131a0e2949b","resolution":{"observed_at":"2026-08-06T22:57:12.612500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.09577","last_updated":"2019-09-14T03:51:46Z","snapshot_observed_at":"2026-08-03T18:17:55.398298Z","submitted_at":"2019-09-14T03:51:46Z","title":"NeMo: a toolkit for building AI applications using Neural Modules","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.09577","snapshot_observed_at":"2026-08-06T22:57:12.649504Z","title":"arXiv preprint arXiv:1909.09577 (2019)","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.20190","last_updated":"2025-06-25T07:31:32Z","snapshot_observed_at":"2026-08-09T10:25:36.125587Z","submitted_at":"2025-06-25T07:31:32Z","title":"An Exploration of ECAPA-TDNN and x-vector Speaker Representations in Zero-shot Multi-speaker TTS","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T22:57:12.649504Z"},"links":{"cited_paper":"/paper/1909.09577","citing_paper":"/paper/2506.20190"},"observation_digest":"sha256:4013daeb304da0d83c42066ddda3d895da58ac70da4c8f8403e582ca9bbdbc09","observation_id":"7e56d121-3471-4b45-9b97-7ec6d9c5781f","resolution":{"observed_at":"2026-08-06T22:57:12.649504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1705.02304","last_updated":"2017-05-05T17:10:16Z","snapshot_observed_at":"2026-07-06T05:41:28.253263Z","submitted_at":"2017-05-05T17:10:16Z","title":"Deep Speaker: an End-to-End Neural Speaker Embedding System","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.02304","snapshot_observed_at":"2026-08-06T22:57:12.715540Z","title":"https://doi.org/ 10.48550/arXiv.1705.02304","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.20190","last_updated":"2025-06-25T07:31:32Z","snapshot_observed_at":"2026-08-09T10:25:36.125587Z","submitted_at":"2025-06-25T07:31:32Z","title":"An Exploration of ECAPA-TDNN and x-vector Speaker Representations in Zero-shot Multi-speaker TTS","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T22:57:12.715540Z"},"links":{"cited_paper":"/paper/1705.02304","citing_paper":"/paper/2506.20190"},"observation_digest":"sha256:f998530506e89743e575b67c3bc132a9cdc41940d6f0cd2c324d5b67b6c3b776","observation_id":"1a009d48-b309-4e81-b064-6ad3f7227ec4","resolution":{"observed_at":"2026-08-06T22:57:12.715540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:57:12.777270Z","title":"In: ICASSP 2024 - 2024 IEEE International Confer- ence on Acoustics, Speech and Signal Processing (ICASSP)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20190","last_updated":"2025-06-25T07:31:32Z","snapshot_observed_at":"2026-08-09T10:25:36.125587Z","submitted_at":"2025-06-25T07:31:32Z","title":"An Exploration of ECAPA-TDNN and x-vector Speaker Representations in Zero-shot Multi-speaker TTS","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T22:57:12.777270Z"},"links":{"citing_paper":"/paper/2506.20190"},"observation_digest":"sha256:79312014e57a8d94a72cf183c0bea5453db79cf2b5834389ffff29c877a4fdaa","observation_id":"bf09d33a-df7c-40e6-a9a8-ca3d6f15b5fe","resolution":{"observed_at":"2026-08-06T22:57:12.777270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:57:15.414188Z","title":"In: Interspeech 2024","venue":null,"work_id":"c1fa4e65-df4d-4bb5-8e6b-f816438afa09","year":2024},"citing_paper":{"arxiv_id":"2506.20190","last_updated":"2025-06-25T07:31:32Z","snapshot_observed_at":"2026-08-09T10:25:36.125587Z","submitted_at":"2025-06-25T07:31:32Z","title":"An Exploration of ECAPA-TDNN and x-vector Speaker Representations in Zero-shot Multi-speaker TTS","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T22:57:12.843093Z"},"links":{"citing_paper":"/paper/2506.20190"},"observation_digest":"sha256:b8761a908ba17a2978fa3598f15927b1aa2103369fa4186449e82df9c0965bf5","observation_id":"0d3dbc89-4e8b-4ae4-8391-44f933e04eb0","resolution":{"observed_at":"2026-08-06T22:57:15.418329Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:57:15.400328Z","title":"In: Interspeech 2017","venue":null,"work_id":"59dbda37-b1c6-4e1b-a226-a7af13660358","year":2017},"citing_paper":{"arxiv_id":"2506.20190","last_updated":"2025-06-25T07:31:32Z","snapshot_observed_at":"2026-08-09T10:25:36.125587Z","submitted_at":"2025-06-25T07:31:32Z","title":"An Exploration of ECAPA-TDNN and x-vector Speaker Representations in Zero-shot Multi-speaker TTS","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T22:57:12.946817Z"},"links":{"citing_paper":"/paper/2506.20190"},"observation_digest":"sha256:b877df1246a97506485c44a6e368c82cd518b0712e8eb5b3940d874e758f93c2","observation_id":"95753752-5b24-41bb-8139-394b80530c4b","resolution":{"observed_at":"2026-08-06T22:57:15.404751Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04624","last_updated":"2021-06-08T18:22:56Z","snapshot_observed_at":"2026-08-04T07:20:14.379561Z","submitted_at":"2021-06-08T18:22:56Z","title":"SpeechBrain: A General-Purpose Speech Toolkit","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.04624","snapshot_observed_at":"2026-08-06T22:57:13.017759Z","title":"arXiv preprint arXiv:2106.04624 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.20190","last_updated":"2025-06-25T07:31:32Z","snapshot_observed_at":"2026-08-09T10:25:36.125587Z","submitted_at":"2025-06-25T07:31:32Z","title":"An Exploration of ECAPA-TDNN and x-vector Speaker Representations in Zero-shot Multi-speaker TTS","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T22:57:13.017759Z"},"links":{"cited_paper":"/paper/2106.04624","citing_paper":"/paper/2506.20190"},"observation_digest":"sha256:fe69fcd5f1d286d85ca53c33de7e000307700c97fae4691b982912ae57fd58d4","observation_id":"664becc3-b620-4857-b49e-de7a41e80e45","resolution":{"observed_at":"2026-08-06T22:57:13.017759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:57:13.102600Z","title":"In: 2018 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.20190","last_updated":"2025-06-25T07:31:32Z","snapshot_observed_at":"2026-08-09T10:25:36.125587Z","submitted_at":"2025-06-25T07:31:32Z","title":"An Exploration of ECAPA-TDNN and x-vector Speaker Representations in Zero-shot Multi-speaker TTS","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T22:57:13.102600Z"},"links":{"citing_paper":"/paper/2506.20190"},"observation_digest":"sha256:2ea2e207c30f986fe42f3b06d56e3444e296ea7d2c20d520ee52ff196f84b086","observation_id":"912b634f-1e15-439e-86fb-eda30e5f0d37","resolution":{"observed_at":"2026-08-06T22:57:13.102600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2014.68543","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:57:14.566439Z","title":"In: 2014 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)","venue":null,"work_id":"767b6421-1d6c-4b6a-bfd4-b7d8b1c49a0f","year":2014},"citing_paper":{"arxiv_id":"2506.20190","last_updated":"2025-06-25T07:31:32Z","snapshot_observed_at":"2026-08-09T10:25:36.125587Z","submitted_at":"2025-06-25T07:31:32Z","title":"An Exploration of ECAPA-TDNN and x-vector Speaker Representations in Zero-shot Multi-speaker TTS","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T22:57:13.190272Z"},"links":{"citing_paper":"/paper/2506.20190"},"observation_digest":"sha256:eeaa7c11cfce568e81d4bb5367a6f50ee745a4bbc4e3d0d49bae5086c240c5d8","observation_id":"06653492-a6f1-4307-83c1-941a41d0d7d0","resolution":{"observed_at":"2026-08-06T22:57:14.668585Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:57:13.251550Z","title":"In: 2018 IEEE International Conference on Acoustics, Speech and Signal Pro- cessing (ICASSP)","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.20190","last_updated":"2025-06-25T07:31:32Z","snapshot_observed_at":"2026-08-09T10:25:36.125587Z","submitted_at":"2025-06-25T07:31:32Z","title":"An Exploration of ECAPA-TDNN and x-vector Speaker Representations in Zero-shot Multi-speaker TTS","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T22:57:13.251550Z"},"links":{"citing_paper":"/paper/2506.20190"},"observation_digest":"sha256:c2174314e75fc856a00d5078833573fc916a349500453ecd9891b892d2f4e0d4","observation_id":"abf5c6df-77a8-4447-8edb-be6bc1be2a17","resolution":{"observed_at":"2026-08-06T22:57:13.251550Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:57:15.386251Z","title":"In: Interspeech 2021","venue":null,"work_id":"fee66e6c-062a-4a4c-a064-93b32e9ab4ee","year":2021},"citing_paper":{"arxiv_id":"2506.20190","last_updated":"2025-06-25T07:31:32Z","snapshot_observed_at":"2026-08-09T10:25:36.125587Z","submitted_at":"2025-06-25T07:31:32Z","title":"An Exploration of ECAPA-TDNN and x-vector Speaker Representations in Zero-shot Multi-speaker TTS","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T22:57:13.317727Z"},"links":{"citing_paper":"/paper/2506.20190"},"observation_digest":"sha256:6d0529a845a55a4155259fc2518eda6fdf751dc1808f0f3a418493b5de03c37d","observation_id":"97b8ca7f-d98b-4656-af98-64037983aceb","resolution":{"observed_at":"2026-08-06T22:57:15.390418Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"7327.2022","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:57:14.250808Z","title":"In: 2022 13th International Symposium on Chinese Spoken Language Processing (ISCSLP)","venue":null,"work_id":"b716fa52-8261-4e59-b992-6ae51c339819","year":2022},"citing_paper":{"arxiv_id":"2506.20190","last_updated":"2025-06-25T07:31:32Z","snapshot_observed_at":"2026-08-09T10:25:36.125587Z","submitted_at":"2025-06-25T07:31:32Z","title":"An Exploration of ECAPA-TDNN and x-vector Speaker Representations in Zero-shot Multi-speaker TTS","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T22:57:13.395104Z"},"links":{"citing_paper":"/paper/2506.20190"},"observation_digest":"sha256:84bf9dba2505a74a31b9c202d8d5216302c35e8f4c9dfa5ba7c8d6d9374dd7a9","observation_id":"8107fb4c-19a4-4de8-84a7-e0d77c65c8fb","resolution":{"observed_at":"2026-08-06T22:57:14.325418Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:57:15.372422Z","title":"In: Interspeech 2021","venue":null,"work_id":"ad06601b-f35f-44ac-b1e8-d3d41bd1ae1f","year":2021},"citing_paper":{"arxiv_id":"2506.20190","last_updated":"2025-06-25T07:31:32Z","snapshot_observed_at":"2026-08-09T10:25:36.125587Z","submitted_at":"2025-06-25T07:31:32Z","title":"An Exploration of ECAPA-TDNN and x-vector Speaker Representations in Zero-shot Multi-speaker TTS","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T22:57:13.478117Z"},"links":{"citing_paper":"/paper/2506.20190"},"observation_digest":"sha256:f8095a960d11c20e9b5b36dc8121dd9638edd3763fc84babd4b9d69a2e563851","observation_id":"34107a15-b569-45c9-a99d-1ca332f19f68","resolution":{"observed_at":"2026-08-06T22:57:15.376531Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.20190","last_updated":"2025-06-25T07:31:32Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-09T10:25:36.125587Z","submitted_at":"2025-06-25T07:31:32Z","title":"An Exploration of ECAPA-TDNN and x-vector Speaker Representations in Zero-shot Multi-speaker TTS"},"reference_resolution":{"displayed":27,"state_counts":{"malformed_identifier":9,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":10,"verified_exact":3,"verified_fuzzy":2},"total_outbound_references":27},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 27 of 27 outbound references and 0 inbound Pith citation observations for arXiv:2506.20190."}