{"as_of":"2026-08-17T00:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7fac511562f49d654b728fec38a9f3c139aeed7713cd86aac3aa2b1dcc4383b6","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T13:38:44.464676Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T13:38:43.983210Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-14T13:38:44.647594Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"1908.04737","last_updated":"2019-08-13T16:56:41Z","snapshot_observed_at":"2026-08-16T11:43:27.035596Z","submitted_at":"2019-08-13T16:56:41Z","title":"End-to-End Multi-Speaker Speech Recognition using Speaker Embeddings and Transfer Learning","version":1},"cited_work":{"arxiv_id":"1908.04737","doi":null,"metadata_source":"pith","pith_arxiv_id":"1908.04737","snapshot_observed_at":"2026-08-14T13:38:44.647594Z","title":"End-to-End Multi-Speaker Speech Recognition using Speaker Embeddings and Transfer Learning","venue":"eess.AS","work_id":"35b9cf5f-2ca9-4e02-b746-2e66248a4b2b","year":2019},"citing_paper":{"arxiv_id":"1908.04737","last_updated":"2019-08-13T16:56:41Z","snapshot_observed_at":"2026-08-16T11:43:27.035596Z","submitted_at":"2019-08-13T16:56:41Z","title":"End-to-End Multi-Speaker Speech Recognition using Speaker Embeddings and Transfer Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-14T13:38:43.983210Z"},"links":{"cited_paper":"/paper/1908.04737","citing_paper":"/paper/1908.04737"},"observation_digest":"sha256:de6029cbbf2208c48f75d76f09159750cadacad25b931f4048d6756611b5fce5","observation_id":"1679087c-a2fe-45f6-899e-da05fe52473a","resolution":{"observed_at":"2026-08-14T13:38:44.652679Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/1908.04737/citation-record","integrity":"/paper/1908.04737/integrity","json":"/paper/1908.04737/citation-record.json","paper":"/paper/1908.04737"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:38:46.252139Z","title":"Overlapped speech – well known in a more general context as the cocktail party problem – remains, however, to be a largely unsolved problem","venue":null,"work_id":"6286d9d1-0db9-4397-8514-9d989df680c8","year":null},"citing_paper":{"arxiv_id":"1908.04737","last_updated":"2019-08-13T16:56:41Z","snapshot_observed_at":"2026-08-16T11:43:27.035596Z","submitted_at":"2019-08-13T16:56:41Z","title":"End-to-End Multi-Speaker Speech Recognition using Speaker Embeddings and Transfer Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-14T13:38:43.969214Z"},"links":{"citing_paper":"/paper/1908.04737"},"observation_digest":"sha256:05d5a9a95758d4c24ab58e5f80b1e92ed729d1d68c5ff29ed72bb0a8f7f7d591","observation_id":"651a7a66-fbd6-481f-9e72-b12532fa685c","resolution":{"observed_at":"2026-08-14T13:38:46.256787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.04737","last_updated":"2019-08-13T16:56:41Z","snapshot_observed_at":"2026-08-16T11:43:27.035596Z","submitted_at":"2019-08-13T16:56:41Z","title":"End-to-End Multi-Speaker Speech Recognition using Speaker Embeddings and Transfer Learning","version":1},"cited_work":{"arxiv_id":"1908.04737","doi":null,"metadata_source":"pith","pith_arxiv_id":"1908.04737","snapshot_observed_at":"2026-08-14T13:38:44.647594Z","title":"End-to-End Multi-Speaker Speech Recognition using Speaker Embeddings and Transfer Learning","venue":"eess.AS","work_id":"35b9cf5f-2ca9-4e02-b746-2e66248a4b2b","year":2019},"citing_paper":{"arxiv_id":"1908.04737","last_updated":"2019-08-13T16:56:41Z","snapshot_observed_at":"2026-08-16T11:43:27.035596Z","submitted_at":"2019-08-13T16:56:41Z","title":"End-to-End Multi-Speaker Speech Recognition using Speaker Embeddings and Transfer Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-14T13:38:43.983210Z"},"links":{"cited_paper":"/paper/1908.04737","citing_paper":"/paper/1908.04737"},"observation_digest":"sha256:de6029cbbf2208c48f75d76f09159750cadacad25b931f4048d6756611b5fce5","observation_id":"1679087c-a2fe-45f6-899e-da05fe52473a","resolution":{"observed_at":"2026-08-14T13:38:44.652679Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:38:46.155465Z","title":"Datasets We evaluate our models on the widely used mixed speech datasets wsj0-2mix and wsj0-3mix [9, 10]","venue":null,"work_id":"1f492649-540d-4196-ad75-5e1627a2ab64","year":null},"citing_paper":{"arxiv_id":"1908.04737","last_updated":"2019-08-13T16:56:41Z","snapshot_observed_at":"2026-08-16T11:43:27.035596Z","submitted_at":"2019-08-13T16:56:41Z","title":"End-to-End Multi-Speaker Speech Recognition using Speaker Embeddings and Transfer Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-14T13:38:43.987681Z"},"links":{"citing_paper":"/paper/1908.04737"},"observation_digest":"sha256:6fd373021ebb4783047327fa0f924d887fca7845e09490a4a7502a8d1d357f53","observation_id":"eb5e50e7-9421-40c9-ae83-1019dba0aa1b","resolution":{"observed_at":"2026-08-14T13:38:46.162959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:38:46.060349Z","title":"Speaker embeddings inclusion strategies The ﬁrst set of experiments aims to determine the best strat- egy for inclusion of speaker embeddings in the model’s in- put","venue":null,"work_id":"f61c8e53-4604-43d1-ac15-8b03701ac1be","year":null},"citing_paper":{"arxiv_id":"1908.04737","last_updated":"2019-08-13T16:56:41Z","snapshot_observed_at":"2026-08-16T11:43:27.035596Z","submitted_at":"2019-08-13T16:56:41Z","title":"End-to-End Multi-Speaker Speech Recognition using Speaker Embeddings and Transfer Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-14T13:38:44.021457Z"},"links":{"citing_paper":"/paper/1908.04737"},"observation_digest":"sha256:a5bc58bafadf24496ee3cb91476e74d62a43df9a07f60deecc1c5d2e7740ced2","observation_id":"c3b48b80-dcf2-4563-bc6d-ed4d7d4e1351","resolution":{"observed_at":"2026-08-14T13:38:46.098133Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:38:45.966036Z","title":null,"venue":null,"work_id":"efb2e360-a761-4b9c-b917-51ce654d7143","year":null},"citing_paper":{"arxiv_id":"1908.04737","last_updated":"2019-08-13T16:56:41Z","snapshot_observed_at":"2026-08-16T11:43:27.035596Z","submitted_at":"2019-08-13T16:56:41Z","title":"End-to-End Multi-Speaker Speech Recognition using Speaker Embeddings and Transfer Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-14T13:38:44.065655Z"},"links":{"citing_paper":"/paper/1908.04737"},"observation_digest":"sha256:cd8e309c9128994859203109e899f182c3b497792b7a18b857f213ca413ce18d","observation_id":"ce66aa74-d728-418d-80f4-049bc957192a","resolution":{"observed_at":"2026-08-14T13:38:46.008014Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:38:45.751049Z","title":"Single-channel speech sepa- ration using sparse non-negative matrix factorization,","venue":null,"work_id":"06056d01-a0f3-44d1-b1fa-086282952021","year":2006},"citing_paper":{"arxiv_id":"1908.04737","last_updated":"2019-08-13T16:56:41Z","snapshot_observed_at":"2026-08-16T11:43:27.035596Z","submitted_at":"2019-08-13T16:56:41Z","title":"End-to-End Multi-Speaker Speech Recognition using Speaker Embeddings and Transfer Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-14T13:38:44.135876Z"},"links":{"citing_paper":"/paper/1908.04737"},"observation_digest":"sha256:a6af5e9f017c325d14433c8dbbf33db2809f4961e0a13ccc6804cfd771f68b25","observation_id":"3fa5607e-9c79-466f-acb3-474e4d332e38","resolution":{"observed_at":"2026-08-14T13:38:45.757461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:38:46.187783Z","title":"Similarly to speech recognition, speech separation methods have also made major progress with the help of deep learning","venue":null,"work_id":"269b010a-a0b9-4327-a56c-d22f927e53f0","year":null},"citing_paper":{"arxiv_id":"1908.04737","last_updated":"2019-08-13T16:56:41Z","snapshot_observed_at":"2026-08-16T11:43:27.035596Z","submitted_at":"2019-08-13T16:56:41Z","title":"End-to-End Multi-Speaker Speech Recognition using Speaker Embeddings and Transfer Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-14T13:38:43.973977Z"},"links":{"citing_paper":"/paper/1908.04737"},"observation_digest":"sha256:a2d6201f00a75ddd5b3a2cedaa12a38e401ad582763a74ed3cd58c372a8c9648","observation_id":"1d7798b8-b707-41d0-b106-b4bb392411ff","resolution":{"observed_at":"2026-08-14T13:38:46.243718Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:38:44.144009Z","title":"Learning spectral clustering, with application to speech separation,","venue":null,"work_id":null,"year":1963},"citing_paper":{"arxiv_id":"1908.04737","last_updated":"2019-08-13T16:56:41Z","snapshot_observed_at":"2026-08-16T11:43:27.035596Z","submitted_at":"2019-08-13T16:56:41Z","title":"End-to-End Multi-Speaker Speech Recognition using Speaker Embeddings and Transfer Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-14T13:38:44.144009Z"},"links":{"citing_paper":"/paper/1908.04737"},"observation_digest":"sha256:0d1b325f70dae1174d06e8050145363891f686f3f43a9b8fe69d5f9f790baa64","observation_id":"80b02dcd-5bfe-4388-800c-ba63f749f3ff","resolution":{"observed_at":"2026-08-14T13:38:44.144009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:38:45.951625Z","title":"Deep Neural Networks for Acoustic Modeling in Speech Recognition,","venue":null,"work_id":"774641ed-4cbd-47b0-ad62-cbdff9162315","year":2012},"citing_paper":{"arxiv_id":"1908.04737","last_updated":"2019-08-13T16:56:41Z","snapshot_observed_at":"2026-08-16T11:43:27.035596Z","submitted_at":"2019-08-13T16:56:41Z","title":"End-to-End Multi-Speaker Speech Recognition using Speaker Embeddings and Transfer Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-14T13:38:44.102873Z"},"links":{"citing_paper":"/paper/1908.04737"},"observation_digest":"sha256:23f8ef7a8e833f2839c3073f25194b04d70d05da6c6e844003038e75e39442fb","observation_id":"90517952-21c9-4dda-89e1-2432d8ff8d9b","resolution":{"observed_at":"2026-08-14T13:38:45.956377Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:38:45.937473Z","title":"Context-Dependent Pre-trained Deep Neural Networks for Large V ocabulary Speech Recognition,","venue":null,"work_id":"c26ce96a-a71d-47fc-9467-331c652ed536","year":2012},"citing_paper":{"arxiv_id":"1908.04737","last_updated":"2019-08-13T16:56:41Z","snapshot_observed_at":"2026-08-16T11:43:27.035596Z","submitted_at":"2019-08-13T16:56:41Z","title":"End-to-End Multi-Speaker Speech Recognition using Speaker Embeddings and Transfer Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-14T13:38:44.117866Z"},"links":{"citing_paper":"/paper/1908.04737"},"observation_digest":"sha256:d6457bbd08656ad897086ea81787b26cf38dab3c79b9bb5691ad8eec95afe08e","observation_id":"50045803-b5ae-4dfc-b450-03dd4ea5bcd4","resolution":{"observed_at":"2026-08-14T13:38:45.942351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:38:45.867391Z","title":"The Microsoft 2016 Conversational Speech Recognition System,","venue":null,"work_id":"181e984b-a247-4b81-890c-f51129a71e42","year":2016},"citing_paper":{"arxiv_id":"1908.04737","last_updated":"2019-08-13T16:56:41Z","snapshot_observed_at":"2026-08-16T11:43:27.035596Z","submitted_at":"2019-08-13T16:56:41Z","title":"End-to-End Multi-Speaker Speech Recognition using Speaker Embeddings and Transfer Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-14T13:38:44.122624Z"},"links":{"citing_paper":"/paper/1908.04737"},"observation_digest":"sha256:74b24b5d6731c1fb3699d1c2d6b0eee50e99ef815e704ef85a946352b3762254","observation_id":"32128274-1284-4060-bd96-ba02c6d14182","resolution":{"observed_at":"2026-08-14T13:38:45.926674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:38:46.173294Z","title":"We evaluate our proposed framework on overlapped speech datasets with two and three overlapped speakers, within and across set- tings","venue":null,"work_id":"4d1a7c46-e3e8-46c8-b137-7dd68478f08e","year":null},"citing_paper":{"arxiv_id":"1908.04737","last_updated":"2019-08-13T16:56:41Z","snapshot_observed_at":"2026-08-16T11:43:27.035596Z","submitted_at":"2019-08-13T16:56:41Z","title":"End-to-End Multi-Speaker Speech Recognition using Speaker Embeddings and Transfer Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-14T13:38:43.979371Z"},"links":{"citing_paper":"/paper/1908.04737"},"observation_digest":"sha256:c11305adc454d47d6470fc0ea36e015714a8ffb6c6c3782e4c1f5afc44fdf16c","observation_id":"14693f19-1e94-4cbf-ac15-eb8d6047ba35","resolution":{"observed_at":"2026-08-14T13:38:46.178694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:38:45.777788Z","title":"Purely Sequence-Trained Neural Networks for ASR Based on Lattice-Free MMI,","venue":null,"work_id":"d330ef3d-50f3-4e68-90a9-e09b38dc0fe1","year":2016},"citing_paper":{"arxiv_id":"1908.04737","last_updated":"2019-08-13T16:56:41Z","snapshot_observed_at":"2026-08-16T11:43:27.035596Z","submitted_at":"2019-08-13T16:56:41Z","title":"End-to-End Multi-Speaker Speech Recognition using Speaker Embeddings and Transfer Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-14T13:38:44.127021Z"},"links":{"citing_paper":"/paper/1908.04737"},"observation_digest":"sha256:cb836ef21e312b91a9cc92435e59452d21a5fd1677265567f9b5b93271beee5e","observation_id":"2cfcf485-9698-4ef0-bb1a-83ddd39297de","resolution":{"observed_at":"2026-08-14T13:38:45.822765Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:38:44.131178Z","title":"Wang and G","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"1908.04737","last_updated":"2019-08-13T16:56:41Z","snapshot_observed_at":"2026-08-16T11:43:27.035596Z","submitted_at":"2019-08-13T16:56:41Z","title":"End-to-End Multi-Speaker Speech Recognition using Speaker Embeddings and Transfer Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-14T13:38:44.131178Z"},"links":{"citing_paper":"/paper/1908.04737"},"observation_digest":"sha256:2b89f8fcaf422ce413ce88f4d5384f2f8535fe8f38e622265aa7bcbf753f22c1","observation_id":"02cf7ebe-f578-4965-bddf-7b003df9831d","resolution":{"observed_at":"2026-08-14T13:38:44.131178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:38:45.649340Z","title":"Super-human multi-talker speech recognition: A graphical mod- eling approach,","venue":null,"work_id":"bf50ce57-7c07-4f62-bc9b-550d37d88289","year":2010},"citing_paper":{"arxiv_id":"1908.04737","last_updated":"2019-08-13T16:56:41Z","snapshot_observed_at":"2026-08-16T11:43:27.035596Z","submitted_at":"2019-08-13T16:56:41Z","title":"End-to-End Multi-Speaker Speech Recognition using Speaker Embeddings and Transfer Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-14T13:38:44.140284Z"},"links":{"citing_paper":"/paper/1908.04737"},"observation_digest":"sha256:87616d98efbdabb309ae9c8d1b3eb7cc9bdb04e141da986134f91cb008e6b974","observation_id":"343adcf4-5d1d-4057-bde8-52943c1d8180","resolution":{"observed_at":"2026-08-14T13:38:45.723549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:38:44.243730Z","title":"Listen, attend and spell: A neural network for large vocabulary conversational speech recognition,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"1908.04737","last_updated":"2019-08-13T16:56:41Z","snapshot_observed_at":"2026-08-16T11:43:27.035596Z","submitted_at":"2019-08-13T16:56:41Z","title":"End-to-End Multi-Speaker Speech Recognition using Speaker Embeddings and Transfer Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-14T13:38:44.243730Z"},"links":{"citing_paper":"/paper/1908.04737"},"observation_digest":"sha256:a02b765b79ccbbcaa4334a7a2679605711ec43604b9ae410f7b3abce8bd8cedc","observation_id":"76f58950-e03b-4a51-93e3-d9256fa023d7","resolution":{"observed_at":"2026-08-14T13:38:44.243730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:38:45.624837Z","title":"Deep clus- tering: Discriminative embeddings for segmentation and separa- tion,","venue":null,"work_id":"2fe39761-77d8-4c62-9f78-4db9bc3b9195","year":2016},"citing_paper":{"arxiv_id":"1908.04737","last_updated":"2019-08-13T16:56:41Z","snapshot_observed_at":"2026-08-16T11:43:27.035596Z","submitted_at":"2019-08-13T16:56:41Z","title":"End-to-End Multi-Speaker Speech Recognition using Speaker Embeddings and Transfer Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-14T13:38:44.147759Z"},"links":{"citing_paper":"/paper/1908.04737"},"observation_digest":"sha256:e191cb0332e888fdc1dc13778cf49fc6db95eaee61c17a94f79acdf2c7fad675","observation_id":"9291abe4-8011-4a7f-90f0-7bb8606d21b2","resolution":{"observed_at":"2026-08-14T13:38:45.630215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:38:45.556210Z","title":"Single-Channel Multi-Speaker Separation Using Deep Cluster- ing,","venue":null,"work_id":"8728e4bd-ac0e-427d-adbf-07e373cdd753","year":2016},"citing_paper":{"arxiv_id":"1908.04737","last_updated":"2019-08-13T16:56:41Z","snapshot_observed_at":"2026-08-16T11:43:27.035596Z","submitted_at":"2019-08-13T16:56:41Z","title":"End-to-End Multi-Speaker Speech Recognition using Speaker Embeddings and Transfer Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-14T13:38:44.151655Z"},"links":{"citing_paper":"/paper/1908.04737"},"observation_digest":"sha256:d60ba315a434c34928304c75a1fe856eba3de5553d8a186a4ff68f98e6ab7247","observation_id":"48258b02-6caa-4026-8f76-1cd99ad347d6","resolution":{"observed_at":"2026-08-14T13:38:45.613430Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:38:45.543108Z","title":"Alternative Objective Functions for Deep Clustering,","venue":null,"work_id":"79508bf5-2169-405c-b40a-cbbc943a33fd","year":2018},"citing_paper":{"arxiv_id":"1908.04737","last_updated":"2019-08-13T16:56:41Z","snapshot_observed_at":"2026-08-16T11:43:27.035596Z","submitted_at":"2019-08-13T16:56:41Z","title":"End-to-End Multi-Speaker Speech Recognition using Speaker Embeddings and Transfer Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-14T13:38:44.155502Z"},"links":{"citing_paper":"/paper/1908.04737"},"observation_digest":"sha256:b9100c598baf132a6cecc5411cdf6afc4d55d2d20cec1232df442776b4c4de3c","observation_id":"3e709503-00f4-4fb0-9cae-dad1cbb09baf","resolution":{"observed_at":"2026-08-14T13:38:45.547771Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04826","last_updated":"2019-06-19T17:10:51Z","snapshot_observed_at":"2026-08-14T18:16:27.334746Z","submitted_at":"2018-10-11T02:57:14Z","title":"VoiceFilter: Targeted Voice Separation by Speaker-Conditioned Spectrogram Masking","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04826","snapshot_observed_at":"2026-08-14T13:38:44.171139Z","title":"V oice- Filter: Targeted Voice Separation by Speaker-Conditioned Spec- trogram Masking,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"1908.04737","last_updated":"2019-08-13T16:56:41Z","snapshot_observed_at":"2026-08-16T11:43:27.035596Z","submitted_at":"2019-08-13T16:56:41Z","title":"End-to-End Multi-Speaker Speech Recognition using Speaker Embeddings and Transfer Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-14T13:38:44.171139Z"},"links":{"cited_paper":"/paper/1810.04826","citing_paper":"/paper/1908.04737"},"observation_digest":"sha256:57f62821f875e7c82fd40647bfe6696178e29c675074768b74fd70364fc3b0c9","observation_id":"45f9cf6b-e8a3-4aa0-9f84-112abc83ea01","resolution":{"observed_at":"2026-08-14T13:38:44.171139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.5567","last_updated":"2014-12-19T21:36:13Z","snapshot_observed_at":"2026-08-14T23:07:07.038301Z","submitted_at":"2014-12-17T20:39:45Z","title":"Deep Speech: Scaling up end-to-end speech recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.5567","snapshot_observed_at":"2026-08-14T13:38:44.200937Z","title":"Deep speech: Scaling up end-to-end speech recognition,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"1908.04737","last_updated":"2019-08-13T16:56:41Z","snapshot_observed_at":"2026-08-16T11:43:27.035596Z","submitted_at":"2019-08-13T16:56:41Z","title":"End-to-End Multi-Speaker Speech Recognition using Speaker Embeddings and Transfer Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-14T13:38:44.200937Z"},"links":{"cited_paper":"/paper/1412.5567","citing_paper":"/paper/1908.04737"},"observation_digest":"sha256:5dde4409e734965135c0c19b188dd0374c854e5f669b2cdee466c7cf8d204b01","observation_id":"ddd76945-b2a4-4759-84cb-d106895b4453","resolution":{"observed_at":"2026-08-14T13:38:44.200937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:38:45.473752Z","title":"EESEN: End-to-end speech recognition using deep RNN models and WFST-based decoding,","venue":null,"work_id":"4c847db1-2c69-4e93-92db-6080d7788b42","year":2015},"citing_paper":{"arxiv_id":"1908.04737","last_updated":"2019-08-13T16:56:41Z","snapshot_observed_at":"2026-08-16T11:43:27.035596Z","submitted_at":"2019-08-13T16:56:41Z","title":"End-to-End Multi-Speaker Speech Recognition using Speaker Embeddings and Transfer Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-14T13:38:44.234231Z"},"links":{"citing_paper":"/paper/1908.04737"},"observation_digest":"sha256:281187e62fc5f4d9f5ff5085f15f6d4f12402b569fa4ea1b0201fdea3708d05c","observation_id":"b5289f2c-c191-4c08-90fd-3884db4a0288","resolution":{"observed_at":"2026-08-14T13:38:45.531701Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:38:44.239254Z","title":"End-to-end attention-based large vocabulary speech recog- nition,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"1908.04737","last_updated":"2019-08-13T16:56:41Z","snapshot_observed_at":"2026-08-16T11:43:27.035596Z","submitted_at":"2019-08-13T16:56:41Z","title":"End-to-End Multi-Speaker Speech Recognition using Speaker Embeddings and Transfer Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-14T13:38:44.239254Z"},"links":{"citing_paper":"/paper/1908.04737"},"observation_digest":"sha256:addecd94ecbc37677347807224ca6cff289586cb5a89387f57094b38bb062c0c","observation_id":"f2eb5c52-38b1-4e8f-a77d-244942965096","resolution":{"observed_at":"2026-08-14T13:38:44.239254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:38:44.278173Z","title":"Transfer learning from speaker veriﬁcation to multispeaker text-to-speech synthesis,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1908.04737","last_updated":"2019-08-13T16:56:41Z","snapshot_observed_at":"2026-08-16T11:43:27.035596Z","submitted_at":"2019-08-13T16:56:41Z","title":"End-to-End Multi-Speaker Speech Recognition using Speaker Embeddings and Transfer Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-14T13:38:44.278173Z"},"links":{"citing_paper":"/paper/1908.04737"},"observation_digest":"sha256:0fdaba27a7577c520e4079b5a061737e0a1bc0cddf52e6ac29b1c5466341bb9c","observation_id":"3d55b2c1-1420-40b0-b4cd-1aec4d8a367f","resolution":{"observed_at":"2026-08-14T13:38:44.278173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:38:44.247685Z","title":"Hybrid CTC/attention architecture for end-to-end speech recog- nition,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"1908.04737","last_updated":"2019-08-13T16:56:41Z","snapshot_observed_at":"2026-08-16T11:43:27.035596Z","submitted_at":"2019-08-13T16:56:41Z","title":"End-to-End Multi-Speaker Speech Recognition using Speaker Embeddings and Transfer Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-14T13:38:44.247685Z"},"links":{"citing_paper":"/paper/1908.04737"},"observation_digest":"sha256:18e51be56e0f4c196b4b656d7edc060c93804e14d5d1d0d3f3d2b916ce0bd3ff","observation_id":"f08052f1-9b32-4763-90af-b65645c2e978","resolution":{"observed_at":"2026-08-14T13:38:44.247685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:38:45.428167Z","title":"End-to-end multi-speaker speech recognition,","venue":null,"work_id":"3b184b6c-0482-41ba-a8b9-9993cac10e3d","year":2018},"citing_paper":{"arxiv_id":"1908.04737","last_updated":"2019-08-13T16:56:41Z","snapshot_observed_at":"2026-08-16T11:43:27.035596Z","submitted_at":"2019-08-13T16:56:41Z","title":"End-to-End Multi-Speaker Speech Recognition using Speaker Embeddings and Transfer Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-14T13:38:44.252011Z"},"links":{"citing_paper":"/paper/1908.04737"},"observation_digest":"sha256:8fa5e9f1d13d1c96fa27882f8723b12a2023de48b24857b1fe51bab648aafbc3","observation_id":"aff3f211-a2ca-4d01-b38e-4a522225d479","resolution":{"observed_at":"2026-08-14T13:38:45.433805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:38:45.298230Z","title":"A Purely End-to-End System for Multi-speaker Speech Recog- nition,","venue":null,"work_id":"c2e66706-89a2-43f0-93ba-e2b33fd8f085","year":2018},"citing_paper":{"arxiv_id":"1908.04737","last_updated":"2019-08-13T16:56:41Z","snapshot_observed_at":"2026-08-16T11:43:27.035596Z","submitted_at":"2019-08-13T16:56:41Z","title":"End-to-End Multi-Speaker Speech Recognition using Speaker Embeddings and Transfer Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-14T13:38:44.257226Z"},"links":{"citing_paper":"/paper/1908.04737"},"observation_digest":"sha256:b8a6821fb6e86d35ecb5f268382ff2cfe99079468c8e46a55f29d4e5c71f6b79","observation_id":"51ee53ba-e313-4c8a-8171-0bd8a61dfbbf","resolution":{"observed_at":"2026-08-14T13:38:45.374155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:38:45.278990Z","title":"Progressive joint mod- eling in unsupervised single-channel overlapped speech recogni- tion,","venue":null,"work_id":"e68332cd-4e00-4612-b81d-539a5c3a5da4","year":2018},"citing_paper":{"arxiv_id":"1908.04737","last_updated":"2019-08-13T16:56:41Z","snapshot_observed_at":"2026-08-16T11:43:27.035596Z","submitted_at":"2019-08-13T16:56:41Z","title":"End-to-End Multi-Speaker Speech Recognition using Speaker Embeddings and Transfer Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-14T13:38:44.261153Z"},"links":{"citing_paper":"/paper/1908.04737"},"observation_digest":"sha256:b8fc87c98ee48afb08f99eb3c0b392253eab426f8c6e8ee590a1c66676ae25cf","observation_id":"32da70e1-b1b3-47f0-ba1d-4a034ef7e7c4","resolution":{"observed_at":"2026-08-14T13:38:45.285680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:38:45.181879Z","title":"Speaker-Aware Neural Network Based Beam- former for Speaker Extraction in Speech Mixtures,","venue":null,"work_id":"8104b328-cd7d-448b-b72e-8c5888f6c998","year":2017},"citing_paper":{"arxiv_id":"1908.04737","last_updated":"2019-08-13T16:56:41Z","snapshot_observed_at":"2026-08-16T11:43:27.035596Z","submitted_at":"2019-08-13T16:56:41Z","title":"End-to-End Multi-Speaker Speech Recognition using Speaker Embeddings and Transfer Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-14T13:38:44.265107Z"},"links":{"citing_paper":"/paper/1908.04737"},"observation_digest":"sha256:c861ab9a1989051521bedf2bf6e552ad04f20fa0866e0854327c7576fe09dbad","observation_id":"85ad0927-995c-4d25-bc29-cdba43df20e1","resolution":{"observed_at":"2026-08-14T13:38:45.227035Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:38:45.167199Z","title":"Deep Extractor Network for Target Speaker Recovery from Sin- gle Channel Speech Mixtures,","venue":null,"work_id":"ef81e8f2-743f-4ced-af84-8f52c53809c8","year":2018},"citing_paper":{"arxiv_id":"1908.04737","last_updated":"2019-08-13T16:56:41Z","snapshot_observed_at":"2026-08-16T11:43:27.035596Z","submitted_at":"2019-08-13T16:56:41Z","title":"End-to-End Multi-Speaker Speech Recognition using Speaker Embeddings and Transfer Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-14T13:38:44.269202Z"},"links":{"citing_paper":"/paper/1908.04737"},"observation_digest":"sha256:815a9a250f85e293fc151de11c9d140c1d14621be257716799c2dfde9356c39b","observation_id":"4a422157-4728-4c9a-b4cc-3d7ecd6c267c","resolution":{"observed_at":"2026-08-14T13:38:45.172901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:38:45.056982Z","title":"Speaker diarization with LSTM,","venue":null,"work_id":"c151cf00-ed6b-4c1f-ba64-e188825ba12d","year":2018},"citing_paper":{"arxiv_id":"1908.04737","last_updated":"2019-08-13T16:56:41Z","snapshot_observed_at":"2026-08-16T11:43:27.035596Z","submitted_at":"2019-08-13T16:56:41Z","title":"End-to-End Multi-Speaker Speech Recognition using Speaker Embeddings and Transfer Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-14T13:38:44.273591Z"},"links":{"citing_paper":"/paper/1908.04737"},"observation_digest":"sha256:82d1f5d42132ab7bd067edea6a23184dff5c6a3b628c668ed388461d515c48d2","observation_id":"ef0aa0f8-d6d3-458d-b841-7b7f035c8ad7","resolution":{"observed_at":"2026-08-14T13:38:45.110169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:38:44.740185Z","title":"VoxCeleb: A Large- Scale Speaker Identiﬁcation Dataset,","venue":null,"work_id":"4ad61d63-89aa-4922-90cc-03237e658d16","year":2017},"citing_paper":{"arxiv_id":"1908.04737","last_updated":"2019-08-13T16:56:41Z","snapshot_observed_at":"2026-08-16T11:43:27.035596Z","submitted_at":"2019-08-13T16:56:41Z","title":"End-to-End Multi-Speaker Speech Recognition using Speaker Embeddings and Transfer Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-14T13:38:44.440189Z"},"links":{"citing_paper":"/paper/1908.04737"},"observation_digest":"sha256:fc83142f0564c40811cd3faf6aabccf877fe680be2c5525bad153847c76e0e24","observation_id":"17d809fd-63a3-4a3d-81a1-231379a0e2e3","resolution":{"observed_at":"2026-08-14T13:38:44.818701Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:38:45.035161Z","title":"Multilingual acoustic models using dis- tributed deep neural networks,","venue":null,"work_id":"ae74d53e-ff01-49ad-8afd-1b32e044242b","year":2013},"citing_paper":{"arxiv_id":"1908.04737","last_updated":"2019-08-13T16:56:41Z","snapshot_observed_at":"2026-08-16T11:43:27.035596Z","submitted_at":"2019-08-13T16:56:41Z","title":"End-to-End Multi-Speaker Speech Recognition using Speaker Embeddings and Transfer Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-14T13:38:44.333123Z"},"links":{"citing_paper":"/paper/1908.04737"},"observation_digest":"sha256:dca910689ad4fe92dca7420ac8123b3158aa8f3a972250b836930a109fa1dcbc","observation_id":"d59d8051-2bae-443b-bdba-b7a353cdfe5a","resolution":{"observed_at":"2026-08-14T13:38:45.040173Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:38:46.139123Z","title":"The input features of x-vector extractor are 30-dimensional MFCCs without cepstral truncation with a frame length of 25 ms and shift of 10 ms","venue":null,"work_id":"9d491edf-b447-4a95-8181-d590177e398a","year":null},"citing_paper":{"arxiv_id":"1908.04737","last_updated":"2019-08-13T16:56:41Z","snapshot_observed_at":"2026-08-16T11:43:27.035596Z","submitted_at":"2019-08-13T16:56:41Z","title":"End-to-End Multi-Speaker Speech Recognition using Speaker Embeddings and Transfer Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-14T13:38:43.992657Z"},"links":{"citing_paper":"/paper/1908.04737"},"observation_digest":"sha256:e8d27abbac2b2273f898cf908e18180c5c83fb385c78d99998172439852015ca","observation_id":"667993ef-e747-441b-a793-78a5a8f6be98","resolution":{"observed_at":"2026-08-14T13:38:46.144120Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:38:44.981778Z","title":"Investigation of transfer learning for ASR using LF-MMI trained neural networks,","venue":null,"work_id":"620c83ef-a027-49a8-8b32-c46aafc9eb22","year":2017},"citing_paper":{"arxiv_id":"1908.04737","last_updated":"2019-08-13T16:56:41Z","snapshot_observed_at":"2026-08-16T11:43:27.035596Z","submitted_at":"2019-08-13T16:56:41Z","title":"End-to-End Multi-Speaker Speech Recognition using Speaker Embeddings and Transfer Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-14T13:38:44.371895Z"},"links":{"citing_paper":"/paper/1908.04737"},"observation_digest":"sha256:7746d1cb183adfd9a693da8acbc66abb0f785941b882e741dff86a5d94fb45b5","observation_id":"43a8af3a-23de-49a6-972e-5ef8595165f3","resolution":{"observed_at":"2026-08-14T13:38:45.026396Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:38:44.882025Z","title":"Lib- rispeech: an ASR corpus based on public domain audio books,","venue":null,"work_id":"c1d84f0f-dddf-4bdf-b652-3cf5ea1c70a3","year":2015},"citing_paper":{"arxiv_id":"1908.04737","last_updated":"2019-08-13T16:56:41Z","snapshot_observed_at":"2026-08-16T11:43:27.035596Z","submitted_at":"2019-08-13T16:56:41Z","title":"End-to-End Multi-Speaker Speech Recognition using Speaker Embeddings and Transfer Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-14T13:38:44.388157Z"},"links":{"citing_paper":"/paper/1908.04737"},"observation_digest":"sha256:de2f3b5667234120a3b5932e3f0222f632a2a50c4bd49d236b6b1fe0dd5d79fc","observation_id":"89d25c21-6373-4c68-bf68-cc5bee4a5c46","resolution":{"observed_at":"2026-08-14T13:38:44.926033Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:38:44.871253Z","title":"ESP- net: End-to-End Speech Processing Toolkit,","venue":null,"work_id":"eb79f345-a7dc-4a25-acde-700d20c68b35","year":2018},"citing_paper":{"arxiv_id":"1908.04737","last_updated":"2019-08-13T16:56:41Z","snapshot_observed_at":"2026-08-16T11:43:27.035596Z","submitted_at":"2019-08-13T16:56:41Z","title":"End-to-End Multi-Speaker Speech Recognition using Speaker Embeddings and Transfer Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-14T13:38:44.393052Z"},"links":{"citing_paper":"/paper/1908.04737"},"observation_digest":"sha256:c392a667fcedbf6ead9681308e48dd2c91b69a1bb0e604a90397ecad80ac96a1","observation_id":"589ec6d4-28d2-47a6-a474-f06a72dd5d66","resolution":{"observed_at":"2026-08-14T13:38:44.874794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:38:44.859086Z","title":"The Kaldi speech recognition toolkit,","venue":null,"work_id":"380a23f8-7b75-4d40-98b0-89e177526b12","year":2011},"citing_paper":{"arxiv_id":"1908.04737","last_updated":"2019-08-13T16:56:41Z","snapshot_observed_at":"2026-08-16T11:43:27.035596Z","submitted_at":"2019-08-13T16:56:41Z","title":"End-to-End Multi-Speaker Speech Recognition using Speaker Embeddings and Transfer Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-14T13:38:44.398596Z"},"links":{"citing_paper":"/paper/1908.04737"},"observation_digest":"sha256:5b03b1cbd0ce422db00f553996cdd173271132a90ddec3dd30bcc87a48e01075","observation_id":"dda78843-61c7-4ccc-912f-d631e6d2a375","resolution":{"observed_at":"2026-08-14T13:38:44.864517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1212.5701","last_updated":"2012-12-22T15:46:49Z","snapshot_observed_at":"2026-08-15T00:34:41.793608Z","submitted_at":"2012-12-22T15:46:49Z","title":"ADADELTA: An Adaptive Learning Rate Method","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1212.5701","snapshot_observed_at":"2026-08-14T13:38:44.402934Z","title":"Adadelta: an adaptive learning rate method,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"1908.04737","last_updated":"2019-08-13T16:56:41Z","snapshot_observed_at":"2026-08-16T11:43:27.035596Z","submitted_at":"2019-08-13T16:56:41Z","title":"End-to-End Multi-Speaker Speech Recognition using Speaker Embeddings and Transfer Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-14T13:38:44.402934Z"},"links":{"cited_paper":"/paper/1212.5701","citing_paper":"/paper/1908.04737"},"observation_digest":"sha256:e8fd0619f79e7bf4636f488a9c2d1961f57228ee0b4e1f94f974e01bb0cbac78","observation_id":"866d7ca0-0a36-4bb8-b333-808f1f91cec1","resolution":{"observed_at":"2026-08-14T13:38:44.402934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1808.02608","last_updated":"2018-08-08T03:05:11Z","snapshot_observed_at":"2026-08-14T18:43:32.152192Z","submitted_at":"2018-08-08T03:05:11Z","title":"End-to-end Speech Recognition with Word-based RNN Language Models","version":1},"cited_work":{"arxiv_id":"1808.02608","doi":null,"metadata_source":"pith","pith_arxiv_id":"1808.02608","snapshot_observed_at":"2026-08-14T13:38:44.578873Z","title":"End-to-end Speech Recognition with Word-based RNN Language Models","venue":"cs.CL","work_id":"3a6376e1-348a-43ca-a275-021bba00874e","year":2018},"citing_paper":{"arxiv_id":"1908.04737","last_updated":"2019-08-13T16:56:41Z","snapshot_observed_at":"2026-08-16T11:43:27.035596Z","submitted_at":"2019-08-13T16:56:41Z","title":"End-to-End Multi-Speaker Speech Recognition using Speaker Embeddings and Transfer Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-14T13:38:44.408490Z"},"links":{"cited_paper":"/paper/1808.02608","citing_paper":"/paper/1908.04737"},"observation_digest":"sha256:fcd48e0f6b3a36a11281daf13d2333a272e0287ca6fb336af0dd80a554b4cc16","observation_id":"7eebc545-9de0-4bcf-ad0f-c7f33c2f7108","resolution":{"observed_at":"2026-08-14T13:38:44.584400Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:38:44.727054Z","title":"VoxCeleb2: Deep Speaker Recognition,","venue":null,"work_id":"6e17cae6-1709-483b-8ab3-4b17f2e492ab","year":2018},"citing_paper":{"arxiv_id":"1908.04737","last_updated":"2019-08-13T16:56:41Z","snapshot_observed_at":"2026-08-16T11:43:27.035596Z","submitted_at":"2019-08-13T16:56:41Z","title":"End-to-End Multi-Speaker Speech Recognition using Speaker Embeddings and Transfer Learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-14T13:38:44.446192Z"},"links":{"citing_paper":"/paper/1908.04737"},"observation_digest":"sha256:064d7d416647a47d84f5e55a1810dd1ab472bb37aa26bfa69e4706341d3af1f5","observation_id":"55fecded-c0c2-407f-a1b9-08a4ebf75a24","resolution":{"observed_at":"2026-08-14T13:38:44.731660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:38:44.684958Z","title":"X-vectors: Robust DNN embeddings for speaker recogni- tion,","venue":null,"work_id":"add8a2dd-6763-4562-88f6-5332065ca074","year":2018},"citing_paper":{"arxiv_id":"1908.04737","last_updated":"2019-08-13T16:56:41Z","snapshot_observed_at":"2026-08-16T11:43:27.035596Z","submitted_at":"2019-08-13T16:56:41Z","title":"End-to-End Multi-Speaker Speech Recognition using Speaker Embeddings and Transfer Learning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-14T13:38:44.450882Z"},"links":{"citing_paper":"/paper/1908.04737"},"observation_digest":"sha256:ccd39a34fc52db7740df81762e7322f88208be7e8de0e8c63a5699ef11b28302","observation_id":"17b0b9ba-0761-475d-a354-e0d94cd488ab","resolution":{"observed_at":"2026-08-14T13:38:44.718804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:38:44.672801Z","title":"The Speak- ers in the Wild (SITW) Speaker Recognition Database,","venue":null,"work_id":"91f68d8e-2248-4d8f-8458-0d8a67fa0a57","year":2016},"citing_paper":{"arxiv_id":"1908.04737","last_updated":"2019-08-13T16:56:41Z","snapshot_observed_at":"2026-08-16T11:43:27.035596Z","submitted_at":"2019-08-13T16:56:41Z","title":"End-to-End Multi-Speaker Speech Recognition using Speaker Embeddings and Transfer Learning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-14T13:38:44.455556Z"},"links":{"citing_paper":"/paper/1908.04737"},"observation_digest":"sha256:9f3a6ce2d9ebacb4595cb0b2886a56e4027dbd60fea86afef38b50d0a57adbe0","observation_id":"29c5e611-c86a-4eae-be53-ae1808fa4eb0","resolution":{"observed_at":"2026-08-14T13:38:44.676529Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:38:44.661352Z","title":"Single-channel multi-talker speech recognition with permutation invariant training,","venue":null,"work_id":"67b4f593-02d7-4881-9a7b-3153eea2f143","year":2018},"citing_paper":{"arxiv_id":"1908.04737","last_updated":"2019-08-13T16:56:41Z","snapshot_observed_at":"2026-08-16T11:43:27.035596Z","submitted_at":"2019-08-13T16:56:41Z","title":"End-to-End Multi-Speaker Speech Recognition using Speaker Embeddings and Transfer Learning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-14T13:38:44.459737Z"},"links":{"citing_paper":"/paper/1908.04737"},"observation_digest":"sha256:6bf17a1f113ea8d8365cb5b7f0c2ed0613f31957d35f8ac45b3198aef39d6192","observation_id":"78a550f5-856e-40f6-9652-85e183c6b9e8","resolution":{"observed_at":"2026-08-14T13:38:44.665588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.02062","last_updated":"2018-11-05T22:21:51Z","snapshot_observed_at":"2026-08-14T18:03:49.195068Z","submitted_at":"2018-11-05T22:21:51Z","title":"End-to-End Monaural Multi-speaker ASR System without Pretraining","version":1},"cited_work":{"arxiv_id":"1811.02062","doi":null,"metadata_source":"pith","pith_arxiv_id":"1811.02062","snapshot_observed_at":"2026-08-14T13:38:44.525245Z","title":"End-to-End Monaural Multi-speaker ASR System without Pretraining","venue":"cs.CL","work_id":"6d474d70-524b-4c69-9a1a-0f1351ada934","year":2018},"citing_paper":{"arxiv_id":"1908.04737","last_updated":"2019-08-13T16:56:41Z","snapshot_observed_at":"2026-08-16T11:43:27.035596Z","submitted_at":"2019-08-13T16:56:41Z","title":"End-to-End Multi-Speaker Speech Recognition using Speaker Embeddings and Transfer Learning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-14T13:38:44.464676Z"},"links":{"cited_paper":"/paper/1811.02062","citing_paper":"/paper/1908.04737"},"observation_digest":"sha256:c033f6f6f5137c485550f0428d0a3c3de0915f22410d1723e3972abac2c9a698","observation_id":"76f8073d-ad2f-45ae-aac8-28317a70026e","resolution":{"observed_at":"2026-08-14T13:38:44.564274Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"1908.04737","last_updated":"2019-08-13T16:56:41Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-16T11:43:27.035596Z","submitted_at":"2019-08-13T16:56:41Z","title":"End-to-End Multi-Speaker Speech Recognition using Speaker Embeddings and Transfer Learning"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":10,"verified_exact":2,"verified_fuzzy":31},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 1 inbound Pith citation observation for arXiv:1908.04737."}