{"as_of":"2026-08-16T12:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:da7174b402f1d10c0ee05f924acfe4530f474ab084e55e5ce596f47b95430794","coverage":[{"denominator":69,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":69,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T14:45:11.547597Z","state":"measured"},{"denominator":69,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":69,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/1908.02590/citation-record","integrity":"/paper/1908.02590/integrity","json":"/paper/1908.02590/citation-record.json","paper":"/paper/1908.02590"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:45:12.610267Z","title":null,"venue":null,"work_id":"47e42b1e-4e93-4be9-923e-d1cf96175e0d","year":1983},"citing_paper":{"arxiv_id":"1908.02590","last_updated":"2020-05-26T09:38:39Z","snapshot_observed_at":"2026-08-16T03:24:55.458527Z","submitted_at":"2019-08-07T12:38:32Z","title":"Audio-visual Speech Enhancement Using Conditional Variational Auto-Encoders","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-14T14:45:11.299764Z"},"links":{"citing_paper":"/paper/1908.02590"},"observation_digest":"sha256:2aed8936491c39af8040c5d5a8d243ccc8e676891c9e9d730687cbd64cad6a27","observation_id":"c7008f4f-997c-4145-b2f1-d3e673d7c897","resolution":{"observed_at":"2026-08-14T14:45:12.613849Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:45:11.304021Z","title":null,"venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"1908.02590","last_updated":"2020-05-26T09:38:39Z","snapshot_observed_at":"2026-08-16T03:24:55.458527Z","submitted_at":"2019-08-07T12:38:32Z","title":"Audio-visual Speech Enhancement Using Conditional Variational Auto-Encoders","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-14T14:45:11.304021Z"},"links":{"citing_paper":"/paper/1908.02590"},"observation_digest":"sha256:e50193efdca9c5300488817b07652afa5a73d71832c9cccdb28be07e661e3d93","observation_id":"629671b6-6fbc-4dad-bddc-bbfb05a4d477","resolution":{"observed_at":"2026-08-14T14:45:11.304021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:45:12.588490Z","title":"Loizou, Speech enhancement: theory and practice , CRC press, 2007","venue":null,"work_id":"0506d82d-19d9-4a89-97d8-fda63919dbaf","year":2007},"citing_paper":{"arxiv_id":"1908.02590","last_updated":"2020-05-26T09:38:39Z","snapshot_observed_at":"2026-08-16T03:24:55.458527Z","submitted_at":"2019-08-07T12:38:32Z","title":"Audio-visual Speech Enhancement Using Conditional Variational Auto-Encoders","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-14T14:45:11.307693Z"},"links":{"citing_paper":"/paper/1908.02590"},"observation_digest":"sha256:bbb34f8d87a2dfec30d85331b4e0c00c5cf01c78c37f002e82f271022f46a6dd","observation_id":"12ee26f0-e97c-4e33-8518-fc3bc2b54f9e","resolution":{"observed_at":"2026-08-14T14:45:12.592826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:45:12.575228Z","title":"Visual contribution to speech intelligibility in noise,","venue":null,"work_id":"34fc0941-1b5a-4a51-b6e2-d8f66e46a2c8","year":1954},"citing_paper":{"arxiv_id":"1908.02590","last_updated":"2020-05-26T09:38:39Z","snapshot_observed_at":"2026-08-16T03:24:55.458527Z","submitted_at":"2019-08-07T12:38:32Z","title":"Audio-visual Speech Enhancement Using Conditional Variational Auto-Encoders","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-14T14:45:11.311625Z"},"links":{"citing_paper":"/paper/1908.02590"},"observation_digest":"sha256:51444e565b1c7510be33c1ab4db6a24e7ce7479705449acd290924de1da72fd3","observation_id":"ded4c603-1211-45c5-a08e-45b8b1bdbbfd","resolution":{"observed_at":"2026-08-14T14:45:12.579698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:45:12.561275Z","title":"Auditory-visual perception of speech,","venue":null,"work_id":"72599cbe-c16e-4ff7-9d3b-6666f3e18ecd","year":1975},"citing_paper":{"arxiv_id":"1908.02590","last_updated":"2020-05-26T09:38:39Z","snapshot_observed_at":"2026-08-16T03:24:55.458527Z","submitted_at":"2019-08-07T12:38:32Z","title":"Audio-visual Speech Enhancement Using Conditional Variational Auto-Encoders","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-14T14:45:11.316235Z"},"links":{"citing_paper":"/paper/1908.02590"},"observation_digest":"sha256:63ea6b57d5b43b58c5d5c13bde1440612da78067f610a764a8856812cd38a389","observation_id":"491a4d91-470a-4649-98f2-25ea05571870","resolution":{"observed_at":"2026-08-14T14:45:12.565651Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:45:12.546511Z","title":"Quantifying the contri- bution of vision to speech perception in noise,","venue":null,"work_id":"a7fa362b-1ca5-4566-8dea-2acfa42d62bb","year":1987},"citing_paper":{"arxiv_id":"1908.02590","last_updated":"2020-05-26T09:38:39Z","snapshot_observed_at":"2026-08-16T03:24:55.458527Z","submitted_at":"2019-08-07T12:38:32Z","title":"Audio-visual Speech Enhancement Using Conditional Variational Auto-Encoders","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-14T14:45:11.320043Z"},"links":{"citing_paper":"/paper/1908.02590"},"observation_digest":"sha256:ee86b4788fe86981141c7704e651e32745c5b81819c91c4164fb7c08acaab629","observation_id":"acbba519-13f3-49b9-b1f2-9efe11a991f6","resolution":{"observed_at":"2026-08-14T14:45:12.552004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:45:12.521998Z","title":"Noisy speech enhancement with ﬁlters estimated from the speaker’s lips,","venue":null,"work_id":"eaa3b254-6f31-4fd4-a1ff-b5aa998c2671","year":1995},"citing_paper":{"arxiv_id":"1908.02590","last_updated":"2020-05-26T09:38:39Z","snapshot_observed_at":"2026-08-16T03:24:55.458527Z","submitted_at":"2019-08-07T12:38:32Z","title":"Audio-visual Speech Enhancement Using Conditional Variational Auto-Encoders","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-14T14:45:11.323807Z"},"links":{"citing_paper":"/paper/1908.02590"},"observation_digest":"sha256:403db80337037fc1eaa467af04fa139ea8c6e6eaecdaf778768120ad8894243a","observation_id":"fb3a5cab-00eb-4a3c-9482-6a210c01785c","resolution":{"observed_at":"2026-08-14T14:45:12.527213Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:45:12.503783Z","title":"Audio-visual enhancement of speech in noise,","venue":null,"work_id":"31c18482-1f8e-48f1-9e50-f31f8a3d696f","year":2001},"citing_paper":{"arxiv_id":"1908.02590","last_updated":"2020-05-26T09:38:39Z","snapshot_observed_at":"2026-08-16T03:24:55.458527Z","submitted_at":"2019-08-07T12:38:32Z","title":"Audio-visual Speech Enhancement Using Conditional Variational Auto-Encoders","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-14T14:45:11.327323Z"},"links":{"citing_paper":"/paper/1908.02590"},"observation_digest":"sha256:f2401cd4a6357947960bfd96857db672d168f771f3afc004785a2c4b203901dd","observation_id":"6acd9a29-b0c5-4e1c-a12e-84a5478ff9a8","resolution":{"observed_at":"2026-08-14T14:45:12.509227Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:45:12.485426Z","title":"Learning joint statistical models for audio-visual fusion and segregation,","venue":null,"work_id":"47a2f1cf-51a0-426f-aa3d-22489f14aa29","year":2001},"citing_paper":{"arxiv_id":"1908.02590","last_updated":"2020-05-26T09:38:39Z","snapshot_observed_at":"2026-08-16T03:24:55.458527Z","submitted_at":"2019-08-07T12:38:32Z","title":"Audio-visual Speech Enhancement Using Conditional Variational Auto-Encoders","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-14T14:45:11.330894Z"},"links":{"citing_paper":"/paper/1908.02590"},"observation_digest":"sha256:6c5f2f0c4ddf476ec8c2ed980ec41b0a0a54d029f05dc4ca8bf098066e642256","observation_id":"834cae07-deb6-4b51-b294-50e49b5b177a","resolution":{"observed_at":"2026-08-14T14:45:12.490400Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:45:12.469199Z","title":"Audio- visual speech enhancement with A VCDCN (audio-visual codebook de- pendent cepstral normalization),","venue":null,"work_id":"c344292b-5928-4537-b734-2cc15fbe8bbf","year":2002},"citing_paper":{"arxiv_id":"1908.02590","last_updated":"2020-05-26T09:38:39Z","snapshot_observed_at":"2026-08-16T03:24:55.458527Z","submitted_at":"2019-08-07T12:38:32Z","title":"Audio-visual Speech Enhancement Using Conditional Variational Auto-Encoders","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-14T14:45:11.335264Z"},"links":{"citing_paper":"/paper/1908.02590"},"observation_digest":"sha256:1dc19d04aaaf67ab19fc954b177762c73af87cb3a3c89da8101d2d7f47fbe29d","observation_id":"f5dde511-01c0-4a3a-b082-b5b867631ca5","resolution":{"observed_at":"2026-08-14T14:45:12.474893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:45:12.448530Z","title":"Noisy audio feature enhancement using audio-visual speech data,","venue":null,"work_id":"c8c5c1df-fb9d-495c-bc7f-7a9fe0ddaf48","year":2002},"citing_paper":{"arxiv_id":"1908.02590","last_updated":"2020-05-26T09:38:39Z","snapshot_observed_at":"2026-08-16T03:24:55.458527Z","submitted_at":"2019-08-07T12:38:32Z","title":"Audio-visual Speech Enhancement Using Conditional Variational Auto-Encoders","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-14T14:45:11.338538Z"},"links":{"citing_paper":"/paper/1908.02590"},"observation_digest":"sha256:4f0d0f3744660a35bbd60adb9c8fc018e82c92aeb9427926c1d3927fc2127ed2","observation_id":"8fd76765-ce9d-4153-a954-bdad0ae8b680","resolution":{"observed_at":"2026-08-14T14:45:12.454113Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:45:12.432396Z","title":"Audio-visual sound separation via hidden Markov models,","venue":null,"work_id":"d1ebcc1a-32d2-4117-b992-1bf43c1bbf61","year":2002},"citing_paper":{"arxiv_id":"1908.02590","last_updated":"2020-05-26T09:38:39Z","snapshot_observed_at":"2026-08-16T03:24:55.458527Z","submitted_at":"2019-08-07T12:38:32Z","title":"Audio-visual Speech Enhancement Using Conditional Variational Auto-Encoders","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-14T14:45:11.341628Z"},"links":{"citing_paper":"/paper/1908.02590"},"observation_digest":"sha256:c25d65a51a992822fffb1605a6a0191e9e5de3511afa44768ac17c2d45e74e2c","observation_id":"3b9a4c61-560f-429a-a642-9612eb68e3c9","resolution":{"observed_at":"2026-08-14T14:45:12.438181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:45:12.417439Z","title":"Twin- HMM-based audio-visual speech enhancement,","venue":null,"work_id":"33edce8f-cef9-446e-8968-77280f63f188","year":2013},"citing_paper":{"arxiv_id":"1908.02590","last_updated":"2020-05-26T09:38:39Z","snapshot_observed_at":"2026-08-16T03:24:55.458527Z","submitted_at":"2019-08-07T12:38:32Z","title":"Audio-visual Speech Enhancement Using Conditional Variational Auto-Encoders","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-14T14:45:11.344764Z"},"links":{"citing_paper":"/paper/1908.02590"},"observation_digest":"sha256:38866466680473474590bd7607b7241a224dddfddf3c2304fc5c3b359a47660c","observation_id":"a1f2e7e0-8174-48ab-9f31-940d2a99dd93","resolution":{"observed_at":"2026-08-14T14:45:12.422202Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:45:12.403298Z","title":"The conversation: Deep audio-visual speech enhancement,","venue":null,"work_id":"45f57e4c-60e4-45fa-9011-abe71ff9cf28","year":2018},"citing_paper":{"arxiv_id":"1908.02590","last_updated":"2020-05-26T09:38:39Z","snapshot_observed_at":"2026-08-16T03:24:55.458527Z","submitted_at":"2019-08-07T12:38:32Z","title":"Audio-visual Speech Enhancement Using Conditional Variational Auto-Encoders","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-14T14:45:11.348686Z"},"links":{"citing_paper":"/paper/1908.02590"},"observation_digest":"sha256:34da915501616fb7bcb6be384b193c32d458d8fe44d7c5b4ed9c184d50b80b57","observation_id":"6e26edb4-9a61-49d9-8f5e-14f8f59bc004","resolution":{"observed_at":"2026-08-14T14:45:12.407787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:45:12.390021Z","title":"Visual speech enhancement,","venue":null,"work_id":"db907a0a-a139-409e-bdec-a5f0822caacd","year":2018},"citing_paper":{"arxiv_id":"1908.02590","last_updated":"2020-05-26T09:38:39Z","snapshot_observed_at":"2026-08-16T03:24:55.458527Z","submitted_at":"2019-08-07T12:38:32Z","title":"Audio-visual Speech Enhancement Using Conditional Variational Auto-Encoders","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-14T14:45:11.352071Z"},"links":{"citing_paper":"/paper/1908.02590"},"observation_digest":"sha256:2d09449ce20b442f38f67b12f764326659e15b61f988bd9d34443d10d6ef1bd6","observation_id":"ccd475d6-62de-4105-9072-3cf96a316481","resolution":{"observed_at":"2026-08-14T14:45:12.394588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:45:12.375492Z","title":"Seeing through noise: Speaker separation and enhancement using visually- derived speech,","venue":null,"work_id":"a0334dcc-8dd9-41d0-bbdd-cb535853fa51","year":2018},"citing_paper":{"arxiv_id":"1908.02590","last_updated":"2020-05-26T09:38:39Z","snapshot_observed_at":"2026-08-16T03:24:55.458527Z","submitted_at":"2019-08-07T12:38:32Z","title":"Audio-visual Speech Enhancement Using Conditional Variational Auto-Encoders","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-14T14:45:11.355252Z"},"links":{"citing_paper":"/paper/1908.02590"},"observation_digest":"sha256:64b40b1801f4d0f2b0b6e9df083aba53d52401aaa18e3fe8e8d0f5331c9b4f97","observation_id":"fba37467-cac2-41bb-8da9-3d89eb791317","resolution":{"observed_at":"2026-08-14T14:45:12.381198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:45:12.358626Z","title":"Audio-visual speech enhancement using multimodal deep convolutional neural networks,","venue":null,"work_id":"1757414a-5ca9-4fde-a0eb-acb496a0e862","year":2018},"citing_paper":{"arxiv_id":"1908.02590","last_updated":"2020-05-26T09:38:39Z","snapshot_observed_at":"2026-08-16T03:24:55.458527Z","submitted_at":"2019-08-07T12:38:32Z","title":"Audio-visual Speech Enhancement Using Conditional Variational Auto-Encoders","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-14T14:45:11.358799Z"},"links":{"citing_paper":"/paper/1908.02590"},"observation_digest":"sha256:ad2e65dbbdb286890b6e45c5b79455c2e736b0ce1c4fec1bc6842a77d77bd1f1","observation_id":"97b7723f-3dc7-4606-9598-a25c89da4769","resolution":{"observed_at":"2026-08-14T14:45:12.364137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:45:12.346023Z","title":"DNN driven speaker independent audio-visual mask estima- tion for speech separation,","venue":null,"work_id":"cd2a7053-e318-424d-9380-86c162c40bf4","year":2018},"citing_paper":{"arxiv_id":"1908.02590","last_updated":"2020-05-26T09:38:39Z","snapshot_observed_at":"2026-08-16T03:24:55.458527Z","submitted_at":"2019-08-07T12:38:32Z","title":"Audio-visual Speech Enhancement Using Conditional Variational Auto-Encoders","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-14T14:45:11.362271Z"},"links":{"citing_paper":"/paper/1908.02590"},"observation_digest":"sha256:71da31cd71a7fa040a445b0d673e6de7785b0e2f6b13a0076507acd940151b71","observation_id":"8f558229-66e8-4afe-ad7b-629ee8decf66","resolution":{"observed_at":"2026-08-14T14:45:12.349902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:45:12.333938Z","title":"Statistical speech enhancement based on probabilistic integration of variational autoencoder and non-negative matrix factorization,","venue":null,"work_id":"2e17f3f0-7e71-4c72-9699-b58805155226","year":2018},"citing_paper":{"arxiv_id":"1908.02590","last_updated":"2020-05-26T09:38:39Z","snapshot_observed_at":"2026-08-16T03:24:55.458527Z","submitted_at":"2019-08-07T12:38:32Z","title":"Audio-visual Speech Enhancement Using Conditional Variational Auto-Encoders","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-14T14:45:11.366763Z"},"links":{"citing_paper":"/paper/1908.02590"},"observation_digest":"sha256:600ec0ed42962e416e7ff0f49cfe9460561ae45a0d02fd6bd68bd3a3d2192760","observation_id":"44679b8d-1000-46f5-b63e-519828c83661","resolution":{"observed_at":"2026-08-14T14:45:12.338473Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:45:12.318236Z","title":"A variance modeling framework based on variational autoencoders for speech enhancement,","venue":null,"work_id":"fe410d88-df2d-41dd-8e08-37442f68d1fb","year":2018},"citing_paper":{"arxiv_id":"1908.02590","last_updated":"2020-05-26T09:38:39Z","snapshot_observed_at":"2026-08-16T03:24:55.458527Z","submitted_at":"2019-08-07T12:38:32Z","title":"Audio-visual Speech Enhancement Using Conditional Variational Auto-Encoders","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-14T14:45:11.371079Z"},"links":{"citing_paper":"/paper/1908.02590"},"observation_digest":"sha256:24909e41851699974ae3e76563857b33c924f81fc6feb6d13b2d682cc11f9c83","observation_id":"0652c899-8792-4d9f-a735-1b50cc70d099","resolution":{"observed_at":"2026-08-14T14:45:12.322861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:45:12.301078Z","title":"Bayesian multichannel speech enhancement with a deep speech prior,","venue":null,"work_id":"03db95ee-fb6f-4867-a700-33799e9d2ecb","year":2018},"citing_paper":{"arxiv_id":"1908.02590","last_updated":"2020-05-26T09:38:39Z","snapshot_observed_at":"2026-08-16T03:24:55.458527Z","submitted_at":"2019-08-07T12:38:32Z","title":"Audio-visual Speech Enhancement Using Conditional Variational Auto-Encoders","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-14T14:45:11.374823Z"},"links":{"citing_paper":"/paper/1908.02590"},"observation_digest":"sha256:8e177b1956f3e1d14cc7083e9f62427c678f2d8ce23a87329a52601e86774252","observation_id":"d6a4a9a3-0203-4d27-ab28-70d5b638660b","resolution":{"observed_at":"2026-08-14T14:45:12.305754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:45:12.283394Z","title":"Semi-supervised multichannel speech enhancement with variational autoencoders and non-negative matrix factorization,","venue":null,"work_id":"c808e311-fc65-46b4-a434-f0625aa92841","year":2019},"citing_paper":{"arxiv_id":"1908.02590","last_updated":"2020-05-26T09:38:39Z","snapshot_observed_at":"2026-08-16T03:24:55.458527Z","submitted_at":"2019-08-07T12:38:32Z","title":"Audio-visual Speech Enhancement Using Conditional Variational Auto-Encoders","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-14T14:45:11.378843Z"},"links":{"citing_paper":"/paper/1908.02590"},"observation_digest":"sha256:a56e6b5cf39f8208f8db4661f6461272c43b02dab2863cd816986efcedbb8740","observation_id":"ce0dabf6-857c-4e75-a97c-e613403e893c","resolution":{"observed_at":"2026-08-14T14:45:12.290703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:45:12.264473Z","title":"Speech enhancement with variational autoencoders and alpha-stable distributions,","venue":null,"work_id":"7ddda503-fc2a-4ea0-8ed6-36c3555bdc8a","year":2019},"citing_paper":{"arxiv_id":"1908.02590","last_updated":"2020-05-26T09:38:39Z","snapshot_observed_at":"2026-08-16T03:24:55.458527Z","submitted_at":"2019-08-07T12:38:32Z","title":"Audio-visual Speech Enhancement Using Conditional Variational Auto-Encoders","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-14T14:45:11.382707Z"},"links":{"citing_paper":"/paper/1908.02590"},"observation_digest":"sha256:577bc42c0b072711ba77ae1255037fb48afb511714eb76368ac114cdc86feae5","observation_id":"671ded5a-b614-4db0-b8c1-03312395cacd","resolution":{"observed_at":"2026-08-14T14:45:12.269494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:45:12.248869Z","title":"A statistically principled and computationally efﬁcient approach to speech enhancement using variational autoencoders,","venue":null,"work_id":"b312a819-8910-4d42-83ef-a4f5805940d4","year":2019},"citing_paper":{"arxiv_id":"1908.02590","last_updated":"2020-05-26T09:38:39Z","snapshot_observed_at":"2026-08-16T03:24:55.458527Z","submitted_at":"2019-08-07T12:38:32Z","title":"Audio-visual Speech Enhancement Using Conditional Variational Auto-Encoders","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-14T14:45:11.386342Z"},"links":{"citing_paper":"/paper/1908.02590"},"observation_digest":"sha256:f398eb556e38a6b177efb5d3cba40617b0c198fabd2d2bb40228d28dcf17cb78","observation_id":"9d3e1ed5-2328-4ade-bf25-b1cd0b9c7dc8","resolution":{"observed_at":"2026-08-14T14:45:12.253768Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:45:12.234928Z","title":"Learning structured output representation using deep conditional generative models,","venue":null,"work_id":"d2552a51-668e-4d6a-a691-6e448dddf4bf","year":2015},"citing_paper":{"arxiv_id":"1908.02590","last_updated":"2020-05-26T09:38:39Z","snapshot_observed_at":"2026-08-16T03:24:55.458527Z","submitted_at":"2019-08-07T12:38:32Z","title":"Audio-visual Speech Enhancement Using Conditional Variational Auto-Encoders","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-14T14:45:11.389845Z"},"links":{"citing_paper":"/paper/1908.02590"},"observation_digest":"sha256:88febbd3d8a137ad2680e11b3833b73c836ccd0db115228e2ed691fb47e94461","observation_id":"30ac502a-3321-4b0d-aeef-feb246810d22","resolution":{"observed_at":"2026-08-14T14:45:12.240238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:45:12.206619Z","title":"Multichannel speech enhancement based on time-frequency masking using subband long short-term memory,","venue":null,"work_id":"1dc45443-327d-458f-ab28-b328d3bc25dd","year":2019},"citing_paper":{"arxiv_id":"1908.02590","last_updated":"2020-05-26T09:38:39Z","snapshot_observed_at":"2026-08-16T03:24:55.458527Z","submitted_at":"2019-08-07T12:38:32Z","title":"Audio-visual Speech Enhancement Using Conditional Variational Auto-Encoders","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-14T14:45:11.393501Z"},"links":{"citing_paper":"/paper/1908.02590"},"observation_digest":"sha256:75ffbd7905c551e3eaa6a37d3de20de14c95027701f19fef4abca7806adaf459","observation_id":"013bee5a-ff9e-4557-9271-fcc015ad0ab4","resolution":{"observed_at":"2026-08-14T14:45:12.212220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:45:12.188222Z","title":"NTCD-TIMIT: A new database and baseline for noise-robust audio-visual speech recognition,","venue":null,"work_id":"c3a3ea79-9f41-45b8-ab28-fec4c8752b7c","year":2017},"citing_paper":{"arxiv_id":"1908.02590","last_updated":"2020-05-26T09:38:39Z","snapshot_observed_at":"2026-08-16T03:24:55.458527Z","submitted_at":"2019-08-07T12:38:32Z","title":"Audio-visual Speech Enhancement Using Conditional Variational Auto-Encoders","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-14T14:45:11.397156Z"},"links":{"citing_paper":"/paper/1908.02590"},"observation_digest":"sha256:4efd7eb090fa64c5ab3da7c02800fadb0b895a4233bf7a44b1bfc42ece24a4a1","observation_id":"23f3eebf-5b09-4fdf-bfce-8bd9f137320e","resolution":{"observed_at":"2026-08-14T14:45:12.193989Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:45:12.174516Z","title":"An audio- visual corpus for speech perception and automatic speech recognition,","venue":null,"work_id":"371ebfa4-c1dd-4872-9d60-daeb4e48520a","year":2006},"citing_paper":{"arxiv_id":"1908.02590","last_updated":"2020-05-26T09:38:39Z","snapshot_observed_at":"2026-08-16T03:24:55.458527Z","submitted_at":"2019-08-07T12:38:32Z","title":"Audio-visual Speech Enhancement Using Conditional Variational Auto-Encoders","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-14T14:45:11.400393Z"},"links":{"citing_paper":"/paper/1908.02590"},"observation_digest":"sha256:159ece193a501d04764ab8dba7c4820aa7d2d0699bbc1f43dce8c1c1e108eafb","observation_id":"311c7e73-d81c-4a8a-b55f-32b144b83f31","resolution":{"observed_at":"2026-08-14T14:45:12.179713Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:45:12.160100Z","title":"Suppression of acoustic noise in speech using spectral subtraction,","venue":null,"work_id":"8242de1e-1a9c-46a2-a3cc-0536f8e15b9b","year":1979},"citing_paper":{"arxiv_id":"1908.02590","last_updated":"2020-05-26T09:38:39Z","snapshot_observed_at":"2026-08-16T03:24:55.458527Z","submitted_at":"2019-08-07T12:38:32Z","title":"Audio-visual Speech Enhancement Using Conditional Variational Auto-Encoders","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-14T14:45:11.403852Z"},"links":{"citing_paper":"/paper/1908.02590"},"observation_digest":"sha256:f8557370188337d8cf99fd9af02c10b0a7d5d7749529fc82224d659d7623c9ab","observation_id":"361a854a-b010-4843-86b0-c0e3513155ed","resolution":{"observed_at":"2026-08-14T14:45:12.165189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:45:12.146362Z","title":"Enhancement and bandwidth compression of noisy speech,","venue":null,"work_id":"1f89a49b-72b2-4488-b625-2536a45a8d36","year":1979},"citing_paper":{"arxiv_id":"1908.02590","last_updated":"2020-05-26T09:38:39Z","snapshot_observed_at":"2026-08-16T03:24:55.458527Z","submitted_at":"2019-08-07T12:38:32Z","title":"Audio-visual Speech Enhancement Using Conditional Variational Auto-Encoders","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-14T14:45:11.407218Z"},"links":{"citing_paper":"/paper/1908.02590"},"observation_digest":"sha256:f4f43b5a26c5dcdc087a366bf8c2b77a30c3019a3ac46744b2467c76b855aee4","observation_id":"82b9668d-09a9-4f5d-93b0-310c121c8edb","resolution":{"observed_at":"2026-08-14T14:45:12.150932Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:45:12.132796Z","title":"Speech enhancement using a minimum-mean square error short-time spectral amplitude estimator,","venue":null,"work_id":"61e15c07-b9d5-4956-ae9c-33aeda24f819","year":1984},"citing_paper":{"arxiv_id":"1908.02590","last_updated":"2020-05-26T09:38:39Z","snapshot_observed_at":"2026-08-16T03:24:55.458527Z","submitted_at":"2019-08-07T12:38:32Z","title":"Audio-visual Speech Enhancement Using Conditional Variational Auto-Encoders","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-14T14:45:11.411241Z"},"links":{"citing_paper":"/paper/1908.02590"},"observation_digest":"sha256:e0fda30fdeba5e62d93971a4c9cc995365c410e022984a5ff9777ec8cb32f515","observation_id":"93bdc309-0ee6-4844-9962-d6a648952efc","resolution":{"observed_at":"2026-08-14T14:45:12.138192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:45:12.120018Z","title":"Speech enhancement based on minimum mean-square error estimation and supergaussian priors,","venue":null,"work_id":"7a7f659e-3809-4e52-b1bf-244b40a52788","year":2005},"citing_paper":{"arxiv_id":"1908.02590","last_updated":"2020-05-26T09:38:39Z","snapshot_observed_at":"2026-08-16T03:24:55.458527Z","submitted_at":"2019-08-07T12:38:32Z","title":"Audio-visual Speech Enhancement Using Conditional Variational Auto-Encoders","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-14T14:45:11.414688Z"},"links":{"citing_paper":"/paper/1908.02590"},"observation_digest":"sha256:c27735b173c108b771f7de50712669e6803470c9ad49aced038abb853de9ceee","observation_id":"86cc46ed-34bf-4d93-91cb-c15e8db7b82c","resolution":{"observed_at":"2026-08-14T14:45:12.124693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:45:12.106434Z","title":"Minimum mean-square error estimation of discrete Fourier coefﬁcients with generalized Gamma priors,","venue":null,"work_id":"ceb4af6f-c8ca-42b5-a483-7923dfe0a6c7","year":2007},"citing_paper":{"arxiv_id":"1908.02590","last_updated":"2020-05-26T09:38:39Z","snapshot_observed_at":"2026-08-16T03:24:55.458527Z","submitted_at":"2019-08-07T12:38:32Z","title":"Audio-visual Speech Enhancement Using Conditional Variational Auto-Encoders","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-14T14:45:11.418357Z"},"links":{"citing_paper":"/paper/1908.02590"},"observation_digest":"sha256:0cb6a7e4e099914c7c88660381ec6701ac9a6037b7650f65d4b4b1d5c3e7243b","observation_id":"02e2f5d5-0a48-4cd9-b570-9408af27b962","resolution":{"observed_at":"2026-08-14T14:45:12.111029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:45:12.088063Z","title":"Speech enhancement using a minimum mean-square error log-spectral amplitude estimator,","venue":null,"work_id":"19ecdc36-3b9d-4fb6-ad42-84281945bb22","year":1985},"citing_paper":{"arxiv_id":"1908.02590","last_updated":"2020-05-26T09:38:39Z","snapshot_observed_at":"2026-08-16T03:24:55.458527Z","submitted_at":"2019-08-07T12:38:32Z","title":"Audio-visual Speech Enhancement Using Conditional Variational Auto-Encoders","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-14T14:45:11.422007Z"},"links":{"citing_paper":"/paper/1908.02590"},"observation_digest":"sha256:9c41697f1ff49f41144f9ef4cb7d6da0b9e7858862c4f81d91574aa2497a6763","observation_id":"4436711c-b019-43cb-92b5-33fe510dae90","resolution":{"observed_at":"2026-08-14T14:45:12.093254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:45:12.054543Z","title":"Speech enhancement for non- stationary noise environments,","venue":null,"work_id":"791d0ee2-92a0-48ad-89f2-01ae7476d73c","year":2001},"citing_paper":{"arxiv_id":"1908.02590","last_updated":"2020-05-26T09:38:39Z","snapshot_observed_at":"2026-08-16T03:24:55.458527Z","submitted_at":"2019-08-07T12:38:32Z","title":"Audio-visual Speech Enhancement Using Conditional Variational Auto-Encoders","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-14T14:45:11.425467Z"},"links":{"citing_paper":"/paper/1908.02590"},"observation_digest":"sha256:b74ef805b11cfe329e5384766cdea33bc3d8ee37e2ee248afe6a39434db3534d","observation_id":"d6d5fbf9-dfc9-4d3f-841e-cc48b98a095b","resolution":{"observed_at":"2026-08-14T14:45:12.059835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:45:12.039086Z","title":"Nonnegative matrix factorization with the Itakura-Saito divergence: With application to music analysis,","venue":null,"work_id":"3e16f5f1-2485-4b36-91a5-9bfc69b444fe","year":2009},"citing_paper":{"arxiv_id":"1908.02590","last_updated":"2020-05-26T09:38:39Z","snapshot_observed_at":"2026-08-16T03:24:55.458527Z","submitted_at":"2019-08-07T12:38:32Z","title":"Audio-visual Speech Enhancement Using Conditional Variational Auto-Encoders","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-14T14:45:11.428911Z"},"links":{"citing_paper":"/paper/1908.02590"},"observation_digest":"sha256:b416c1f8d005d8a4a16f803ddf4fa5374d774134054104e2fb77e871729eebd7","observation_id":"5de5e200-2ee5-40a8-b05f-00822304d6a7","resolution":{"observed_at":"2026-08-14T14:45:12.043394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:45:12.025561Z","title":"Speech denoising using nonnegative matrix factorization with priors,","venue":null,"work_id":"49fbbd0e-73a8-4e57-ba5a-08778c268b18","year":2008},"citing_paper":{"arxiv_id":"1908.02590","last_updated":"2020-05-26T09:38:39Z","snapshot_observed_at":"2026-08-16T03:24:55.458527Z","submitted_at":"2019-08-07T12:38:32Z","title":"Audio-visual Speech Enhancement Using Conditional Variational Auto-Encoders","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-14T14:45:11.432436Z"},"links":{"citing_paper":"/paper/1908.02590"},"observation_digest":"sha256:f589e70fbbc50e7bb6999f2ac974f2060d39d47f0ed225ceaeb4331be0cd26f2","observation_id":"4ce2a021-955c-4cc7-8356-89eafb5b7719","resolution":{"observed_at":"2026-08-14T14:45:12.029863Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:45:12.010691Z","title":"Phoneme-dependent NMF for speech enhancement in monaural mixtures,","venue":null,"work_id":"097bb834-9231-4d14-b0b0-c78c5515cb90","year":2011},"citing_paper":{"arxiv_id":"1908.02590","last_updated":"2020-05-26T09:38:39Z","snapshot_observed_at":"2026-08-16T03:24:55.458527Z","submitted_at":"2019-08-07T12:38:32Z","title":"Audio-visual Speech Enhancement Using Conditional Variational Auto-Encoders","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-14T14:45:11.436497Z"},"links":{"citing_paper":"/paper/1908.02590"},"observation_digest":"sha256:1e6e7496aa940f8a063ff71ee8e32a2119d8ec33890d71ebd6897013b5d1adfb","observation_id":"d71e7f63-306c-4e64-bfcd-67d96314d1dd","resolution":{"observed_at":"2026-08-14T14:45:12.016541Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:45:11.996668Z","title":"Super- vised and unsupervised speech enhancement using nonnegative matrix factorization,","venue":null,"work_id":"e48a46f0-804b-4627-8a79-9c83f30cecdf","year":2013},"citing_paper":{"arxiv_id":"1908.02590","last_updated":"2020-05-26T09:38:39Z","snapshot_observed_at":"2026-08-16T03:24:55.458527Z","submitted_at":"2019-08-07T12:38:32Z","title":"Audio-visual Speech Enhancement Using Conditional Variational Auto-Encoders","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-14T14:45:11.440341Z"},"links":{"citing_paper":"/paper/1908.02590"},"observation_digest":"sha256:517de603e4feaf97eeda3b6cd719763a058c97e89912f87044320291bfcd5243","observation_id":"c1ab7e40-0eee-4981-8423-e8309e09022e","resolution":{"observed_at":"2026-08-14T14:45:12.001774Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:45:11.980703Z","title":"Supervised speech separation based on deep learning: An overview,","venue":null,"work_id":"7b20ee35-2f94-4d78-8a41-b570c36d996e","year":2018},"citing_paper":{"arxiv_id":"1908.02590","last_updated":"2020-05-26T09:38:39Z","snapshot_observed_at":"2026-08-16T03:24:55.458527Z","submitted_at":"2019-08-07T12:38:32Z","title":"Audio-visual Speech Enhancement Using Conditional Variational Auto-Encoders","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-14T14:45:11.443742Z"},"links":{"citing_paper":"/paper/1908.02590"},"observation_digest":"sha256:5e0af1a9395105b575022fd0f1d501ae8ed69ac70cb21c30df12b88171ebf47f","observation_id":"10ec9db3-2644-4e71-bff5-3b7aec19d7d5","resolution":{"observed_at":"2026-08-14T14:45:11.986561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:45:11.966130Z","title":"Speech enhancement based on deep denoising autoencoder.,","venue":null,"work_id":"c5684b24-4a24-42f4-8a28-cb6046b55b81","year":2013},"citing_paper":{"arxiv_id":"1908.02590","last_updated":"2020-05-26T09:38:39Z","snapshot_observed_at":"2026-08-16T03:24:55.458527Z","submitted_at":"2019-08-07T12:38:32Z","title":"Audio-visual Speech Enhancement Using Conditional Variational Auto-Encoders","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-14T14:45:11.447684Z"},"links":{"citing_paper":"/paper/1908.02590"},"observation_digest":"sha256:8acfaee590849ce55186561db930fc9246b91f1bb29486ee792f980b299114d4","observation_id":"d7c9c7cb-c426-4723-9792-8ea1545d0e5d","resolution":{"observed_at":"2026-08-14T14:45:11.970454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:45:11.951252Z","title":"A regression approach to speech enhancement based on deep neural networks,","venue":null,"work_id":"ecdf5e53-6b94-45b4-aac9-e019065d7eec","year":2015},"citing_paper":{"arxiv_id":"1908.02590","last_updated":"2020-05-26T09:38:39Z","snapshot_observed_at":"2026-08-16T03:24:55.458527Z","submitted_at":"2019-08-07T12:38:32Z","title":"Audio-visual Speech Enhancement Using Conditional Variational Auto-Encoders","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-14T14:45:11.450971Z"},"links":{"citing_paper":"/paper/1908.02590"},"observation_digest":"sha256:b1eedf1776fcc800072adcb2fecf152a34bf1fb9809364955d9dda0f6818c265","observation_id":"f8c12b5e-ce13-4d27-b11c-606b5e57375e","resolution":{"observed_at":"2026-08-14T14:45:11.956590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:45:11.934463Z","title":"SNR-aware convolutional neural network modeling for speech enhancement.,","venue":null,"work_id":"ef0b9e42-a5a8-453f-982c-6ed649d05801","year":2016},"citing_paper":{"arxiv_id":"1908.02590","last_updated":"2020-05-26T09:38:39Z","snapshot_observed_at":"2026-08-16T03:24:55.458527Z","submitted_at":"2019-08-07T12:38:32Z","title":"Audio-visual Speech Enhancement Using Conditional Variational Auto-Encoders","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-14T14:45:11.454030Z"},"links":{"citing_paper":"/paper/1908.02590"},"observation_digest":"sha256:1eb02fd85674f18bb8aad954d71df57885c98b793baa1a398f697237e39dd0b9","observation_id":"69a872fb-5fd6-4d3d-a66b-24b4097667ae","resolution":{"observed_at":"2026-08-14T14:45:11.940955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:45:11.917678Z","title":"Towards scaling up classiﬁcation- based speech separation,","venue":null,"work_id":"cdc13bd1-81a0-453d-b21b-affe6a142d56","year":2013},"citing_paper":{"arxiv_id":"1908.02590","last_updated":"2020-05-26T09:38:39Z","snapshot_observed_at":"2026-08-16T03:24:55.458527Z","submitted_at":"2019-08-07T12:38:32Z","title":"Audio-visual Speech Enhancement Using Conditional Variational Auto-Encoders","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-14T14:45:11.457148Z"},"links":{"citing_paper":"/paper/1908.02590"},"observation_digest":"sha256:b9f87751668669cce4859818737443fd8a8644548d86da69943a47479c48a015","observation_id":"25de5c91-3bc6-4408-a605-c21aa6a3627e","resolution":{"observed_at":"2026-08-14T14:45:11.923163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:45:11.900962Z","title":"On training targets for supervised speech separation,","venue":null,"work_id":"1021c9a2-142d-460c-8495-ae68ad5b12e9","year":2014},"citing_paper":{"arxiv_id":"1908.02590","last_updated":"2020-05-26T09:38:39Z","snapshot_observed_at":"2026-08-16T03:24:55.458527Z","submitted_at":"2019-08-07T12:38:32Z","title":"Audio-visual Speech Enhancement Using Conditional Variational Auto-Encoders","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-14T14:45:11.461205Z"},"links":{"citing_paper":"/paper/1908.02590"},"observation_digest":"sha256:1a6537b0e0c5a82063f486ff1b50e4a0dda78fccdc8f6ee54684fbfb4716a086","observation_id":"2373fc53-7ce2-4a5d-8cf2-18c70d7f572f","resolution":{"observed_at":"2026-08-14T14:45:11.907938Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:45:11.874110Z","title":"Speech enhancement with LSTM recurrent neural networks and its application to noise-robust ASR,","venue":null,"work_id":"7f36df56-8ef7-444c-aa23-38c66314ed77","year":2015},"citing_paper":{"arxiv_id":"1908.02590","last_updated":"2020-05-26T09:38:39Z","snapshot_observed_at":"2026-08-16T03:24:55.458527Z","submitted_at":"2019-08-07T12:38:32Z","title":"Audio-visual Speech Enhancement Using Conditional Variational Auto-Encoders","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-14T14:45:11.465099Z"},"links":{"citing_paper":"/paper/1908.02590"},"observation_digest":"sha256:d735f10746affb93b2dd727c43186def99cd6a832b8c95a34dd05861ada22627","observation_id":"f95c2c60-5fec-44b5-9a6a-fabd252721bc","resolution":{"observed_at":"2026-08-14T14:45:11.879414Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:45:11.858278Z","title":"Semi-supervised learning with deep generative models,","venue":null,"work_id":"59cb7f9e-37e4-4a3b-a997-07e898b3d482","year":2014},"citing_paper":{"arxiv_id":"1908.02590","last_updated":"2020-05-26T09:38:39Z","snapshot_observed_at":"2026-08-16T03:24:55.458527Z","submitted_at":"2019-08-07T12:38:32Z","title":"Audio-visual Speech Enhancement Using Conditional Variational Auto-Encoders","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-14T14:45:11.468806Z"},"links":{"citing_paper":"/paper/1908.02590"},"observation_digest":"sha256:93ba2982958583c7f935be81f5b6e8cf35f9109f1c04841c5588f27ec6243f44","observation_id":"3a4dc6aa-234f-4fe1-9026-7c173b351fab","resolution":{"observed_at":"2026-08-14T14:45:11.862491Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:45:11.844868Z","title":"Su- pervised determined source separation with multichannel variational autoencoder,","venue":null,"work_id":"8b31202c-f8bf-479a-908d-a5065c8fa731","year":2019},"citing_paper":{"arxiv_id":"1908.02590","last_updated":"2020-05-26T09:38:39Z","snapshot_observed_at":"2026-08-16T03:24:55.458527Z","submitted_at":"2019-08-07T12:38:32Z","title":"Audio-visual Speech Enhancement Using Conditional Variational Auto-Encoders","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-14T14:45:11.472527Z"},"links":{"citing_paper":"/paper/1908.02590"},"observation_digest":"sha256:33ede0fc837fbb8427a975b3c911baf2f8369ce08fb60dd772931990a89d64aa","observation_id":"835c16c2-2342-41ae-b37c-cb274b290841","resolution":{"observed_at":"2026-08-14T14:45:11.849629Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:45:11.832352Z","title":"Fast MV AE: Joint separation and classiﬁcation of mixed sources based on multichannel variational autoencoder with auxiliary classiﬁer,","venue":null,"work_id":"1db41e6f-76c3-422b-a878-d254cdb33919","year":2019},"citing_paper":{"arxiv_id":"1908.02590","last_updated":"2020-05-26T09:38:39Z","snapshot_observed_at":"2026-08-16T03:24:55.458527Z","submitted_at":"2019-08-07T12:38:32Z","title":"Audio-visual Speech Enhancement Using Conditional Variational Auto-Encoders","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-14T14:45:11.475815Z"},"links":{"citing_paper":"/paper/1908.02590"},"observation_digest":"sha256:7bd959822bf41b4df51ae51a2140e19014bc5a1f4d0e804c6ee0f5f3767c7784","observation_id":"d2847e9e-472d-409f-adb5-e17b6dc9b350","resolution":{"observed_at":"2026-08-14T14:45:11.836579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:45:11.820234Z","title":"Joint separation and dereverberation of reverberant mixtures with multichannel variational autoencoder,","venue":null,"work_id":"bf9674ca-04ad-4f63-8359-f60cfd71988c","year":2019},"citing_paper":{"arxiv_id":"1908.02590","last_updated":"2020-05-26T09:38:39Z","snapshot_observed_at":"2026-08-16T03:24:55.458527Z","submitted_at":"2019-08-07T12:38:32Z","title":"Audio-visual Speech Enhancement Using Conditional Variational Auto-Encoders","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-14T14:45:11.479601Z"},"links":{"citing_paper":"/paper/1908.02590"},"observation_digest":"sha256:a0a7bf7584055965d29bead22269d3e79a501de13b215e693ff0c68e01976c8b","observation_id":"864caa5d-108a-4017-b295-aaa90e3daa9e","resolution":{"observed_at":"2026-08-14T14:45:11.825026Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:45:11.803618Z","title":"Visually derived wiener ﬁlters for speech enhancement,","venue":null,"work_id":"f1164af1-187e-4a68-9450-96f2115dce63","year":2010},"citing_paper":{"arxiv_id":"1908.02590","last_updated":"2020-05-26T09:38:39Z","snapshot_observed_at":"2026-08-16T03:24:55.458527Z","submitted_at":"2019-08-07T12:38:32Z","title":"Audio-visual Speech Enhancement Using Conditional Variational Auto-Encoders","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-14T14:45:11.483107Z"},"links":{"citing_paper":"/paper/1908.02590"},"observation_digest":"sha256:f6b2500eb24b8d809cca98a00d1dbfcff8e93408bfec4e6db1c9138dcd58465a","observation_id":"03f09753-fa55-4748-93f4-2c91c2264228","resolution":{"observed_at":"2026-08-14T14:45:11.808923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:45:11.792011Z","title":"A Monte Carlo implementation of the EM algorithm and the poor man’s data augmentation algorithms,","venue":null,"work_id":"3e5bd4f6-c3e3-456b-af68-d393d2e16108","year":1990},"citing_paper":{"arxiv_id":"1908.02590","last_updated":"2020-05-26T09:38:39Z","snapshot_observed_at":"2026-08-16T03:24:55.458527Z","submitted_at":"2019-08-07T12:38:32Z","title":"Audio-visual Speech Enhancement Using Conditional Variational Auto-Encoders","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-14T14:45:11.487136Z"},"links":{"citing_paper":"/paper/1908.02590"},"observation_digest":"sha256:00edc52c5433f24bbe305aeb36e064563629a233b77e5da5b61f1fa9d1525011","observation_id":"43fd8a9e-f3e9-4cc2-badd-0c441fcbaebf","resolution":{"observed_at":"2026-08-14T14:45:11.795862Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:45:11.778092Z","title":"An introduction to variational methods for graphical models,","venue":null,"work_id":"3e4605bb-4ba0-4b1c-a78e-2ecf1e07571b","year":1999},"citing_paper":{"arxiv_id":"1908.02590","last_updated":"2020-05-26T09:38:39Z","snapshot_observed_at":"2026-08-16T03:24:55.458527Z","submitted_at":"2019-08-07T12:38:32Z","title":"Audio-visual Speech Enhancement Using Conditional Variational Auto-Encoders","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-14T14:45:11.491411Z"},"links":{"citing_paper":"/paper/1908.02590"},"observation_digest":"sha256:21686ec2a38c9afd93a98cafaa5f8aa6f5baf0331286d66fcd3f57d53898978f","observation_id":"f4850585-2ccd-41f0-b6f6-580dac31bb02","resolution":{"observed_at":"2026-08-14T14:45:11.782106Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:45:11.764785Z","title":"Variational inference: A review for statisticians,","venue":null,"work_id":"dd31a8a3-9adb-4402-8dff-52e926fd6f9b","year":2017},"citing_paper":{"arxiv_id":"1908.02590","last_updated":"2020-05-26T09:38:39Z","snapshot_observed_at":"2026-08-16T03:24:55.458527Z","submitted_at":"2019-08-07T12:38:32Z","title":"Audio-visual Speech Enhancement Using Conditional Variational Auto-Encoders","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-14T14:45:11.495280Z"},"links":{"citing_paper":"/paper/1908.02590"},"observation_digest":"sha256:eb34e117857a964cfdc06524ffb4e2dd3153577f1b60901c8a01b4facad184b9","observation_id":"4c6704d0-a9c3-403a-9839-d10803fb7c9f","resolution":{"observed_at":"2026-08-14T14:45:11.769023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:45:11.752397Z","title":"End-to-end audiovisual speech recognition,","venue":null,"work_id":"cf629a2e-78fe-4529-9f1e-592ac633563d","year":2018},"citing_paper":{"arxiv_id":"1908.02590","last_updated":"2020-05-26T09:38:39Z","snapshot_observed_at":"2026-08-16T03:24:55.458527Z","submitted_at":"2019-08-07T12:38:32Z","title":"Audio-visual Speech Enhancement Using Conditional Variational Auto-Encoders","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-14T14:45:11.498472Z"},"links":{"citing_paper":"/paper/1908.02590"},"observation_digest":"sha256:50b812ea68a739b151c97618e559f032a67ab5f0f05e21b9ab92a7cd71c4965f","observation_id":"6d68849c-2e1e-4765-a36b-0e28a6d487a1","resolution":{"observed_at":"2026-08-14T14:45:11.756461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:45:11.740733Z","title":"β-vae: Learning basic visual concepts with a constrained variational framework,","venue":null,"work_id":"7843d842-035c-4493-8044-8c1aec125189","year":2017},"citing_paper":{"arxiv_id":"1908.02590","last_updated":"2020-05-26T09:38:39Z","snapshot_observed_at":"2026-08-16T03:24:55.458527Z","submitted_at":"2019-08-07T12:38:32Z","title":"Audio-visual Speech Enhancement Using Conditional Variational Auto-Encoders","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-14T14:45:11.502011Z"},"links":{"citing_paper":"/paper/1908.02590"},"observation_digest":"sha256:58b70d145a1c333e30673dc834d9ad9cb5ed190fd46e3989b14b535579a0dad5","observation_id":"53c8559c-a78d-4ca8-a995-cde49a9629aa","resolution":{"observed_at":"2026-08-14T14:45:11.744665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:45:11.728471Z","title":"Maximum likelihood from incomplete data via the EM algorithm,","venue":null,"work_id":"a93bd8d1-ca0f-467b-9f47-c384d1d1a81a","year":1977},"citing_paper":{"arxiv_id":"1908.02590","last_updated":"2020-05-26T09:38:39Z","snapshot_observed_at":"2026-08-16T03:24:55.458527Z","submitted_at":"2019-08-07T12:38:32Z","title":"Audio-visual Speech Enhancement Using Conditional Variational Auto-Encoders","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-14T14:45:11.505540Z"},"links":{"citing_paper":"/paper/1908.02590"},"observation_digest":"sha256:67aa3619adbf91060c3363f1e6aa861d70ca133859710e846b83459be234f3af","observation_id":"2e542ef6-3800-4e35-a644-0d918e3df91b","resolution":{"observed_at":"2026-08-14T14:45:11.732634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:45:11.715285Z","title":"Robert and George Casella, Monte Carlo Statistical Methods, Springer-Verlag New York, Inc., Secaucus, NJ, USA, 2005","venue":null,"work_id":"e1c2eeb5-4525-436d-9bfa-72ffb641fcb6","year":2005},"citing_paper":{"arxiv_id":"1908.02590","last_updated":"2020-05-26T09:38:39Z","snapshot_observed_at":"2026-08-16T03:24:55.458527Z","submitted_at":"2019-08-07T12:38:32Z","title":"Audio-visual Speech Enhancement Using Conditional Variational Auto-Encoders","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-14T14:45:11.509263Z"},"links":{"citing_paper":"/paper/1908.02590"},"observation_digest":"sha256:1e8055c053494a4ec7459a3b40cd848544cec9f39348a7a0c2c9497f6d5432c5","observation_id":"33a4f9f6-7fc6-4ce2-9718-f6779e63a09c","resolution":{"observed_at":"2026-08-14T14:45:11.720347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:45:11.702236Z","title":"Algorithms for nonnegative matrix factorization with the β-divergence,","venue":null,"work_id":"c784b173-df98-41cd-b32c-82c8fa74091e","year":2011},"citing_paper":{"arxiv_id":"1908.02590","last_updated":"2020-05-26T09:38:39Z","snapshot_observed_at":"2026-08-16T03:24:55.458527Z","submitted_at":"2019-08-07T12:38:32Z","title":"Audio-visual Speech Enhancement Using Conditional Variational Auto-Encoders","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-14T14:45:11.512706Z"},"links":{"citing_paper":"/paper/1908.02590"},"observation_digest":"sha256:5ba67f40bba9f73157079f58e019f115c85d6b5528e1bc73f6812068a456a4ca","observation_id":"0efd91c3-876a-408a-ad91-08c29b454069","resolution":{"observed_at":"2026-08-14T14:45:11.706880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:45:11.690366Z","title":"TIMIT acoustic phonetic continuous speech corpus,","venue":null,"work_id":"6ec33c9a-a7a7-4dab-b970-88eab6079edf","year":1993},"citing_paper":{"arxiv_id":"1908.02590","last_updated":"2020-05-26T09:38:39Z","snapshot_observed_at":"2026-08-16T03:24:55.458527Z","submitted_at":"2019-08-07T12:38:32Z","title":"Audio-visual Speech Enhancement Using Conditional Variational Auto-Encoders","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-14T14:45:11.516051Z"},"links":{"citing_paper":"/paper/1908.02590"},"observation_digest":"sha256:28d11713f9f6a937a5810864cceccf27bc58c5426dc60a804c87d5af72905bc1","observation_id":"a3f14744-a74c-4a87-8109-23d3b6178e52","resolution":{"observed_at":"2026-08-14T14:45:11.694380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:45:11.677960Z","title":"FaNT– ﬁltering and noise adding tool,","venue":null,"work_id":"cbe6edef-489a-42c5-ac50-6bc65c2b8751","year":2005},"citing_paper":{"arxiv_id":"1908.02590","last_updated":"2020-05-26T09:38:39Z","snapshot_observed_at":"2026-08-16T03:24:55.458527Z","submitted_at":"2019-08-07T12:38:32Z","title":"Audio-visual Speech Enhancement Using Conditional Variational Auto-Encoders","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-14T14:45:11.519298Z"},"links":{"citing_paper":"/paper/1908.02590"},"observation_digest":"sha256:5c09812a6b5e3887c358f62a2dbc4dd25579a3f44ee407550cf6f4444a65c196","observation_id":"aecb510f-2812-4c76-8a6b-4242912e5f90","resolution":{"observed_at":"2026-08-14T14:45:11.682684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:45:11.666183Z","title":"The Diverse Environments Multi-channel Acoustic Noise Database (DEMAND): A database of multichannel environmental noise recordings,","venue":null,"work_id":"c4cbbc3c-05ff-41c4-a8ae-551a00ee7b6a","year":2013},"citing_paper":{"arxiv_id":"1908.02590","last_updated":"2020-05-26T09:38:39Z","snapshot_observed_at":"2026-08-16T03:24:55.458527Z","submitted_at":"2019-08-07T12:38:32Z","title":"Audio-visual Speech Enhancement Using Conditional Variational Auto-Encoders","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-14T14:45:11.523074Z"},"links":{"citing_paper":"/paper/1908.02590"},"observation_digest":"sha256:21b356ec1a4432d9b5cd2922138b304c93b5fb31fa3041b5acb95300660ad81d","observation_id":"659d9c5e-ffed-48eb-b23d-d8126a94ddb7","resolution":{"observed_at":"2026-08-14T14:45:11.669976Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:45:11.654273Z","title":"Super- vised and semi-supervised separation of sounds from single-channel mixtures,","venue":null,"work_id":"1cd835d8-6fd4-4127-bfad-f7d2003570e2","year":2007},"citing_paper":{"arxiv_id":"1908.02590","last_updated":"2020-05-26T09:38:39Z","snapshot_observed_at":"2026-08-16T03:24:55.458527Z","submitted_at":"2019-08-07T12:38:32Z","title":"Audio-visual Speech Enhancement Using Conditional Variational Auto-Encoders","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-14T14:45:11.526382Z"},"links":{"citing_paper":"/paper/1908.02590"},"observation_digest":"sha256:adceb0fe6c2dbf64f3b7d9287a495f692fdd8790b137f929053373c0f80f57c2","observation_id":"b51a9af4-ff1e-4d80-8fef-8dacbb0d6de2","resolution":{"observed_at":"2026-08-14T14:45:11.658562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:45:11.642586Z","title":"A non-negative approach to semi-supervised separation of speech from noise with the use of tem- poral dynamics,","venue":null,"work_id":"719ee197-f507-49f7-a6dd-0fdbdd58b7fa","year":2011},"citing_paper":{"arxiv_id":"1908.02590","last_updated":"2020-05-26T09:38:39Z","snapshot_observed_at":"2026-08-16T03:24:55.458527Z","submitted_at":"2019-08-07T12:38:32Z","title":"Audio-visual Speech Enhancement Using Conditional Variational Auto-Encoders","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-14T14:45:11.529718Z"},"links":{"citing_paper":"/paper/1908.02590"},"observation_digest":"sha256:3acb7d042db63f71a73234454b7ffdb2d3c8ea02342a72fdbb2a6d098f1f1586","observation_id":"2e99b071-5ab3-4749-aef5-4ec8c95a92e5","resolution":{"observed_at":"2026-08-14T14:45:11.646457Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:45:11.630742Z","title":"Adam: A method for stochastic optimization,","venue":null,"work_id":"6c5885ee-d088-4e9d-9264-c1ce9f54ccc7","year":2015},"citing_paper":{"arxiv_id":"1908.02590","last_updated":"2020-05-26T09:38:39Z","snapshot_observed_at":"2026-08-16T03:24:55.458527Z","submitted_at":"2019-08-07T12:38:32Z","title":"Audio-visual Speech Enhancement Using Conditional Variational Auto-Encoders","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-14T14:45:11.533435Z"},"links":{"citing_paper":"/paper/1908.02590"},"observation_digest":"sha256:f571e31f3e1477d5b96ef6dd89d9973d200fb3d7f1c542d77a0aba2a942848d1","observation_id":"27561b21-ff14-414a-8a99-06eaf7ccb815","resolution":{"observed_at":"2026-08-14T14:45:11.634266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:45:11.619865Z","title":"Performance measurement in blind audio source separation,","venue":null,"work_id":"577bc504-5dd7-4dca-8b66-48e5f11051da","year":2006},"citing_paper":{"arxiv_id":"1908.02590","last_updated":"2020-05-26T09:38:39Z","snapshot_observed_at":"2026-08-16T03:24:55.458527Z","submitted_at":"2019-08-07T12:38:32Z","title":"Audio-visual Speech Enhancement Using Conditional Variational Auto-Encoders","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-14T14:45:11.537058Z"},"links":{"citing_paper":"/paper/1908.02590"},"observation_digest":"sha256:f1937c405794110d36b160054b181dba4194143964295343bfc9070763ed7813","observation_id":"54ab7c16-5132-4466-a5b6-73a1e3f8c67d","resolution":{"observed_at":"2026-08-14T14:45:11.623405Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:45:11.608549Z","title":"Perceptual evaluation of speech quality (PESQ)-a new method for speech quality assessment of telephone networks and codecs,","venue":null,"work_id":"14cf9556-5aa7-4902-ba31-293cca30cb94","year":2001},"citing_paper":{"arxiv_id":"1908.02590","last_updated":"2020-05-26T09:38:39Z","snapshot_observed_at":"2026-08-16T03:24:55.458527Z","submitted_at":"2019-08-07T12:38:32Z","title":"Audio-visual Speech Enhancement Using Conditional Variational Auto-Encoders","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-14T14:45:11.540335Z"},"links":{"citing_paper":"/paper/1908.02590"},"observation_digest":"sha256:a84781cf9ddde24a1cb77085cab5b73eb2faacc4dd8867aa5ec6d92aa1131dfa","observation_id":"d84353a0-2f61-44ef-ace0-1c29e773900c","resolution":{"observed_at":"2026-08-14T14:45:11.612573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:45:11.595897Z","title":"An algorithm for intelligibility prediction of time–frequency weighted noisy speech,","venue":null,"work_id":"913c1a24-b855-4410-a48a-d2cefda31da1","year":2011},"citing_paper":{"arxiv_id":"1908.02590","last_updated":"2020-05-26T09:38:39Z","snapshot_observed_at":"2026-08-16T03:24:55.458527Z","submitted_at":"2019-08-07T12:38:32Z","title":"Audio-visual Speech Enhancement Using Conditional Variational Auto-Encoders","version":3},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-14T14:45:11.543971Z"},"links":{"citing_paper":"/paper/1908.02590"},"observation_digest":"sha256:40b1e4269b2381ebc40172e02d9108a710b67d7984ddcc5c0bd6a6c870da1cdf","observation_id":"6e8f2e81-f7aa-49fc-a504-af6179aceab3","resolution":{"observed_at":"2026-08-14T14:45:11.599983Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:45:11.580927Z","title":"A deep generative model of speech complex spectrograms,","venue":null,"work_id":"64d83126-10c9-438a-af1e-dda7a6528f74","year":2019},"citing_paper":{"arxiv_id":"1908.02590","last_updated":"2020-05-26T09:38:39Z","snapshot_observed_at":"2026-08-16T03:24:55.458527Z","submitted_at":"2019-08-07T12:38:32Z","title":"Audio-visual Speech Enhancement Using Conditional Variational Auto-Encoders","version":3},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-14T14:45:11.547597Z"},"links":{"citing_paper":"/paper/1908.02590"},"observation_digest":"sha256:cbe07299490ff3ff3d21e8e610cac5b58c486828a633bfbd542baee851faccfc","observation_id":"b85b6ef8-14b3-413a-af2c-c6f663a75414","resolution":{"observed_at":"2026-08-14T14:45:11.587305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"1908.02590","last_updated":"2020-05-26T09:38:39Z","latest_version":3,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-16T03:24:55.458527Z","submitted_at":"2019-08-07T12:38:32Z","title":"Audio-visual Speech Enhancement Using Conditional Variational Auto-Encoders"},"reference_resolution":{"displayed":69,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":2,"verified_exact":0,"verified_fuzzy":67},"total_outbound_references":69},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 69 of 69 outbound references and 0 inbound Pith citation observations for arXiv:1908.02590."}