{"as_of":"2026-08-11T19:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:674da672d8cc55e32181f2d434eee8ac7f1cb98eb289d1f9da780ef72a25f01e","coverage":[{"denominator":58,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":58,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T22:30:41.135038Z","state":"measured"},{"denominator":58,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":58,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.01518/citation-record","integrity":"/paper/2501.01518/integrity","json":"/paper/2501.01518/citation-record.json","paper":"/paper/2501.01518"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:30:41.819963Z","title":"The conversation: Deep audio-visual speech enhance- ment","venue":null,"work_id":"2c274f00-2136-4123-93bc-87f889f52cec","year":2018},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-11T12:42:35.559080Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:40.906332Z"},"links":{"citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:78a1419c3c1bb21eeb367232d19f75c93ea72cc59e3295281b4ead2e81bd7601","observation_id":"0ab3960e-a3fe-479b-b16c-aebb3609c7a2","resolution":{"observed_at":"2026-08-10T22:30:41.824149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1809.00496","last_updated":"2018-10-28T14:29:46Z","snapshot_observed_at":"2026-07-06T06:58:51.877372Z","submitted_at":"2018-09-03T08:38:34Z","title":"LRS3-TED: a large-scale dataset for visual speech recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.00496","snapshot_observed_at":"2026-08-10T22:30:40.911436Z","title":"LRS3-TED: a large-scale dataset for visual speech recognition","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-11T12:42:35.559080Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:40.911436Z"},"links":{"cited_paper":"/paper/1809.00496","citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:564d27616a96f409de545585702919a4dd1cc95466c0f6728dd9d95ea104467e","observation_id":"b5d5e497-055a-4040-86ad-48fa0db08193","resolution":{"observed_at":"2026-08-10T22:30:40.911436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:30:41.809252Z","title":"My lips are concealed: Audio-visual speech enhance- ment through obstructions","venue":null,"work_id":"94789baf-7810-4562-ad09-265f2d16c450","year":2019},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-11T12:42:35.559080Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:40.915374Z"},"links":{"citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:7200b550fbc881ce0fbec8b6ad755393485d4677e8acaead7b1c50e18d0f6b38","observation_id":"38034054-41b9-483e-9656-bf421910de83","resolution":{"observed_at":"2026-08-10T22:30:41.813131Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:30:41.798373Z","title":"Self-supervised learning of audio-visual objects from video","venue":null,"work_id":"1c3e5b9a-c3b5-42ba-b0bb-87d86486b187","year":2020},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-11T12:42:35.559080Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:40.919387Z"},"links":{"citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:14bb3e964eb72f51655f98e8c21aafbc8c7e38dd30f19b7df7f0be07d125b93b","observation_id":"d99466b3-8a37-406c-aa62-f2b7d2139348","resolution":{"observed_at":"2026-08-10T22:30:41.802130Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1611.01599","last_updated":"2016-12-16T16:09:34Z","snapshot_observed_at":"2026-07-06T05:17:29.499249Z","submitted_at":"2016-11-05T04:05:18Z","title":"LipNet: End-to-End Sentence-level Lipreading","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.01599","snapshot_observed_at":"2026-08-10T22:30:40.923188Z","title":"Assael, Brendan Shillingford, Shimon Whiteson, and Nando de Freitas","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-11T12:42:35.559080Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:40.923188Z"},"links":{"cited_paper":"/paper/1611.01599","citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:6a8aa7706b2e442423151ab341777425e04788f7df6d962b3e77b30f1b643641","observation_id":"db76f7ff-7fb8-4c11-b568-f39062179782","resolution":{"observed_at":"2026-08-10T22:30:40.923188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:30:41.787603Z","title":"Phonemizer: Text to phones transcription for multiple languages in python","venue":null,"work_id":"4637e1ef-c69b-4131-8e9e-88480aba1251","year":2021},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-11T12:42:35.559080Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:40.927322Z"},"links":{"citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:ba80790cf57fcb677bb3f3925ad7b3279b6acf6537b2dc99409131e67f3095a6","observation_id":"9b8835f8-a4dd-48dd-b9dc-840c56951f08","resolution":{"observed_at":"2026-08-10T22:30:41.791554Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:30:41.777194Z","title":"Audio-visual synchronisation in the wild","venue":null,"work_id":"72ae8058-4dd5-4a84-ad93-b6dc939142cd","year":2021},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-11T12:42:35.559080Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:40.931502Z"},"links":{"citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:ec1cf11c5b382fe1d4822d6c817200f4e1b1f373c79d1c0b627fd3e0b4f7c61d","observation_id":"fd460ee0-f4d2-429f-936d-921a0843a975","resolution":{"observed_at":"2026-08-10T22:30:41.780893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:30:41.766497Z","title":"Deep attrac- tor network for single-microphone speaker separation","venue":null,"work_id":"a63ff34a-53dc-4615-b4ec-b4359f151fd3","year":2017},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-11T12:42:35.559080Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:40.934940Z"},"links":{"citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:1d5f67b7008874ae4cd3b14b50fc2884ae4397655f0b5b999ea76f9e3d136fe5","observation_id":"afafdaec-dce2-499d-9b34-ac6934cf9b75","resolution":{"observed_at":"2026-08-10T22:30:41.770243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:30:41.755824Z","title":"Lip reading sentences in the wild","venue":null,"work_id":"8beab5bd-a74f-4b53-a6cd-498920e3b97b","year":2017},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-11T12:42:35.559080Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:40.938885Z"},"links":{"citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:6c77ab83c0eff65dbf37a68350fee7d4e5d711cefb6a00dea64058f15fbaed60","observation_id":"027513d9-d655-4d13-96b1-1b3ddbb520d1","resolution":{"observed_at":"2026-08-10T22:30:41.759334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:30:41.746041Z","title":"Lip reading in the wild","venue":null,"work_id":"5b4cec44-2b8e-4b50-a344-238f8e6000f5","year":2016},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-11T12:42:35.559080Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:40.942276Z"},"links":{"citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:c6c6b93718e9fe18c44a6a4666eef05ff04a5fde51b741f538c6282675494d72","observation_id":"dcd99952-8200-4af1-b432-b440c346d91a","resolution":{"observed_at":"2026-08-10T22:30:41.749567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.07074","last_updated":"2020-05-14T15:42:31Z","snapshot_observed_at":"2026-08-11T14:33:22.211936Z","submitted_at":"2020-05-14T15:42:31Z","title":"FaceFilter: Audio-visual speech separation using still images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.07074","snapshot_observed_at":"2026-08-10T22:30:40.946090Z","title":"Facefilter: Audio-visual speech separation using still images","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-11T12:42:35.559080Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:40.946090Z"},"links":{"cited_paper":"/paper/2005.07074","citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:2e4bb6584d1e0a626e548435838b5b6e430a299975719308ec49d5d7859c7689","observation_id":"1f66ee20-3968-4ac0-9620-6a4d2d0c9e1f","resolution":{"observed_at":"2026-08-10T22:30:40.946090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:30:41.734954Z","title":"Real time speech enhancement in the waveform domain","venue":null,"work_id":"28b85491-932b-4c32-b05e-dcfe6e3fbfa1","year":2020},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-11T12:42:35.559080Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:40.949963Z"},"links":{"citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:30d0ec63c599027b1a4d9e2d6d1e4f5e1a3546916da8cf59fbf290393f319875","observation_id":"57efc268-dfbc-4605-97cc-bc7a7ed3d7bf","resolution":{"observed_at":"2026-08-10T22:30:41.738937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.13254","last_updated":"2021-04-28T14:37:48Z","snapshot_observed_at":"2026-08-10T13:57:00.836098Z","submitted_at":"2019-11-27T13:50:45Z","title":"Music Source Separation in the Waveform Domain","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.13254","snapshot_observed_at":"2026-08-10T22:30:40.953728Z","title":null,"venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-11T12:42:35.559080Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:40.953728Z"},"links":{"cited_paper":"/paper/1911.13254","citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:69bf9516c40fb70b7e766d0ff03dcb57373d4e53b61c7744494960cd9a74f64e","observation_id":"7181ccb4-2d5e-4513-bc3d-2092414e194a","resolution":{"observed_at":"2026-08-10T22:30:40.953728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1804.03619","last_updated":"2018-08-09T21:22:37Z","snapshot_observed_at":"2026-08-06T20:20:05.725909Z","submitted_at":"2018-04-10T16:28:59Z","title":"Looking to Listen at the Cocktail Party: A Speaker-Independent Audio-Visual Model for Speech Separation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.03619","snapshot_observed_at":"2026-08-10T22:30:40.957623Z","title":"Looking to listen at the cocktail party: A speaker-independent audio-visual model for speech separa- tion","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-11T12:42:35.559080Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:40.957623Z"},"links":{"cited_paper":"/paper/1804.03619","citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:a0c4084c040925af4449a6aaffd4aab745f61bf92d6966672e42dfbbf868b8c6","observation_id":"b2f14a6a-a786-4146-88cb-40414f437063","resolution":{"observed_at":"2026-08-10T22:30:40.957623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:30:41.722423Z","title":"Learning joint statistical models for audio- visual fusion and segregation","venue":null,"work_id":"7a150bde-a786-4d49-8585-f403b45b0b03","year":2000},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-11T12:42:35.559080Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:40.961532Z"},"links":{"citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:3656d1a88d398757791f918a0d411c5bf608a89513b46c6c18f6299eaab967ae","observation_id":"4b307e38-25a9-40ea-bee5-f689fd46e2ba","resolution":{"observed_at":"2026-08-10T22:30:41.726885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:30:41.711295Z","title":"Seeing through noise: Visually driven speaker separa- tion and enhancement","venue":null,"work_id":"14f2b857-e53f-4280-b015-e0704141b7b6","year":2018},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-11T12:42:35.559080Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:40.965596Z"},"links":{"citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:8cb1ebedb7f0bfbecc86d4bf465ae32d06ce0406e3137f11e05176872c0e84a1","observation_id":"9a87c14a-fab0-42d1-b323-d0f98a8f47da","resolution":{"observed_at":"2026-08-10T22:30:41.715075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.08789","last_updated":"2018-06-13T07:25:47Z","snapshot_observed_at":"2026-07-06T06:10:56.764294Z","submitted_at":"2017-11-23T17:51:46Z","title":"Visual Speech Enhancement","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.08789","snapshot_observed_at":"2026-08-10T22:30:40.969620Z","title":"Visual Speech Enhancement using Noise-Invariant Training","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-11T12:42:35.559080Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:40.969620Z"},"links":{"cited_paper":"/paper/1711.08789","citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:ca2fa6064a33f7459920c2125351ede30aafd7b1a4e245f7eb99dd9857c3a899","observation_id":"14e843c0-fdcf-4304-bb15-488a77c03f41","resolution":{"observed_at":"2026-08-10T22:30:40.969620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:30:41.699513Z","title":"Tenen- baum, and Antonio Torralba","venue":null,"work_id":"8d73f8fc-526f-4e97-b095-941f37ee408c","year":2020},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-11T12:42:35.559080Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:40.973935Z"},"links":{"citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:4e0d1ef671a077e81c9ae09739b1bc712d14fc36a9a2e9371d19d91a811594f3","observation_id":"47642839-a43a-4d17-b1c7-4f6bd9bfce5d","resolution":{"observed_at":"2026-08-10T22:30:41.703401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1804.01665","last_updated":"2018-07-26T04:46:24Z","snapshot_observed_at":"2026-07-06T06:31:50.065290Z","submitted_at":"2018-04-05T04:06:46Z","title":"Learning to Separate Object Sounds by Watching Unlabeled Video","version":2},"cited_work":{"arxiv_id":"1804.01665","doi":null,"metadata_source":"pith","pith_arxiv_id":"1804.01665","snapshot_observed_at":"2026-08-10T22:30:41.239362Z","title":"Learning to Separate Object Sounds by Watching Unlabeled Video","venue":"cs.CV","work_id":"93ebad63-e93c-43d4-96f1-e232dc0a878b","year":2018},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-11T12:42:35.559080Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:40.977615Z"},"links":{"cited_paper":"/paper/1804.01665","citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:9caa8e371274f6db30af5ec62e564b9a2382e2e8cd3702c9f1c49756c0772756","observation_id":"af3765e5-7ee4-4e70-be0b-70631630a711","resolution":{"observed_at":"2026-08-10T22:30:41.243456Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.07750","last_updated":"2019-08-20T21:18:03Z","snapshot_observed_at":"2026-07-06T07:46:29.188511Z","submitted_at":"2019-04-16T15:07:50Z","title":"Co-Separating Sounds of Visual Objects","version":2},"cited_work":{"arxiv_id":"1904.07750","doi":null,"metadata_source":"pith","pith_arxiv_id":"1904.07750","snapshot_observed_at":"2026-08-10T22:30:41.223554Z","title":"Co-Separating Sounds of Visual Objects","venue":"cs.CV","work_id":"8cba3349-1526-4e6a-b0a1-bca46339fb98","year":2019},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-11T12:42:35.559080Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:40.981589Z"},"links":{"cited_paper":"/paper/1904.07750","citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:081e15e4e6ad2a47655c6e59e858f90c955b25609730d4c942ced4477dc91321","observation_id":"043b39e3-2d44-46ed-aec7-e68bb17ab545","resolution":{"observed_at":"2026-08-10T22:30:41.228155Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:30:41.688206Z","title":"VisualV oice: Audio- Visual Speech Separation with Cross-Modal Consistency","venue":null,"work_id":"f4599980-7ba5-416e-8f9c-22659b6b2a65","year":2021},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-11T12:42:35.559080Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:40.985549Z"},"links":{"citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:365a1cf1f16a0ef8aa1390a88dca6e44fca18de20e4b0e5b58712b047a7f0e5c","observation_id":"ea8cc40b-b7da-4e9e-a01d-f9f7e666a425","resolution":{"observed_at":"2026-08-10T22:30:41.692101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:30:41.678053Z","title":"Multi-modal multi-channel tar- get speech separation","venue":null,"work_id":"31b784b4-2423-4e16-9daa-30b0827d7e15","year":2020},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-11T12:42:35.559080Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:40.989309Z"},"links":{"citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:f28cd91b8df0a6ce217db1c89158a4e7262ad9244f24733124a0373b3f23ed42","observation_id":"95c0dff2-817e-4b81-a01c-9447e9188322","resolution":{"observed_at":"2026-08-10T22:30:41.681770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:30:41.666744Z","title":"Hershey, Zhuo Chen, Jonathan Le Roux, and Shinji Watanabe","venue":null,"work_id":"556b6dcf-20f6-4302-a2aa-06cd478fecdb","year":2016},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-11T12:42:35.559080Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:40.993004Z"},"links":{"citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:cab9fb03f49e0b20366fab84a110d86bf8261236de7ef40c7f9147ee670cf15c","observation_id":"895d562e-4cf0-488d-ac62-931e5016a1db","resolution":{"observed_at":"2026-08-10T22:30:41.670976Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03206","last_updated":"2021-06-23T00:25:31Z","snapshot_observed_at":"2026-08-10T00:41:01.806631Z","submitted_at":"2021-03-04T18:20:50Z","title":"Perceiver: General Perception with Iterative Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03206","snapshot_observed_at":"2026-08-10T22:30:40.996705Z","title":"Perceiver: Gen- eral perception with iterative attention","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-11T12:42:35.559080Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:40.996705Z"},"links":{"cited_paper":"/paper/2103.03206","citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:49cddd10edde7e4b076ecedb7eaa247108a7e5e2f00af77b3781acd90b6b3812","observation_id":"a6536841-966a-446e-9df7-b7a1a40b160d","resolution":{"observed_at":"2026-08-10T22:30:40.996705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:30:41.656200Z","title":"Looking into your speech: Learning cross-modal affinity for audio-visual speech sepa- ration","venue":null,"work_id":"c26f9669-4738-4b49-9f44-e3d7bf535bbf","year":2021},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-11T12:42:35.559080Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:41.000900Z"},"links":{"citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:57509a8150004182641e6c36f6cc4a9d9885236f7a597a4f605e0d5213ce8626","observation_id":"29573d01-f545-40e5-97fa-0338a57339cb","resolution":{"observed_at":"2026-08-10T22:30:41.659982Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:30:41.646060Z","title":"Parameter efficient multimodal trans- formers for video representation learning","venue":null,"work_id":"7a13cd64-7194-4fd6-9495-8a80a3ab826b","year":null},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-11T12:42:35.559080Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:41.005406Z"},"links":{"citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:b64dcb426e50f2096e44e44b9d1c5d9c09e577f3cb5e33e8dd035fc1a2034397","observation_id":"b5081915-2b49-492b-be21-8e7cefaff36f","resolution":{"observed_at":"2026-08-10T22:30:41.650080Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:30:41.634821Z","title":"Audiovisual trans- former with instance attention for audio-visual event local- ization","venue":null,"work_id":"540cae01-b8ef-4156-8593-b524b330a1e8","year":2020},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-11T12:42:35.559080Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:41.009871Z"},"links":{"citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:7421704afc1737a821b11a321119f1e0407b6d8aee4a35ee9894645ea9daddc3","observation_id":"16cd0da0-dcf0-4149-be3f-f141833517bd","resolution":{"observed_at":"2026-08-10T22:30:41.638710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:30:41.623569Z","title":"Speaker- independent speech separation with deep attractor network","venue":null,"work_id":"1aa38c80-6912-43b0-b3e9-420246bb4bda","year":2018},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-11T12:42:35.559080Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:41.013675Z"},"links":{"citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:6e106e17799ca9e0351b2f55363250c0ae9a3cbc24733ddac96c850fafc1e97d","observation_id":"daeb5589-62dd-47b6-97e2-52ef461facb0","resolution":{"observed_at":"2026-08-10T22:30:41.627331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:30:41.609980Z","title":"Attention in dichotic listening: Affective cues and the influence of instructions","venue":null,"work_id":"582dd57a-dc9d-4ec5-889e-2a2f61e4cf84","year":1959},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-11T12:42:35.559080Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:41.017791Z"},"links":{"citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:9d5fb47d1bd401ee8c3757427fe542ca021ad303bb280284c837a7b42f464abe","observation_id":"fa8a0789-3ef8-4ad0-b9fa-870f2b0d0139","resolution":{"observed_at":"2026-08-10T22:30:41.614029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:30:41.598703Z","title":"Attention bottlenecks for multimodal fusion","venue":null,"work_id":"c2b19c69-66cb-4d8e-8518-947973140b68","year":2021},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-11T12:42:35.559080Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:41.021525Z"},"links":{"citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:1bd8e417d340a14137db4d35bace2d6e8b6d45274ee64013872c1d6bd1b7fe4a","observation_id":"0027f422-4a53-40ae-83c9-28e7c7e097e5","resolution":{"observed_at":"2026-08-10T22:30:41.602676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:30:41.587937Z","title":null,"venue":null,"work_id":"f4ccfee0-b511-4201-bd98-24656249b592","year":2018},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-11T12:42:35.559080Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:41.026076Z"},"links":{"citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:f612404a509cb25862e13adceee6b33653045fd03ae54924baea8adef6ada1e8","observation_id":"96797977-ada7-4f82-9afd-12465ab51e46","resolution":{"observed_at":"2026-08-10T22:30:41.591631Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:30:41.576993Z","title":null,"venue":null,"work_id":"47ad7a54-6e0f-4f33-beeb-87038dd98f68","year":2017},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-11T12:42:35.559080Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:41.031979Z"},"links":{"citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:5054ef0354c0ea3c4cba8c47b5bfbc9be6c81fd371e89cbf5209d21a9d26eb96","observation_id":"5dbec9bf-5987-4585-93b1-1f46c80d6a0b","resolution":{"observed_at":"2026-08-10T22:30:41.580932Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:30:41.565657Z","title":"Audio-visual object localization and separation using low- rank and sparsity","venue":null,"work_id":"84f8955a-5304-4f5d-bf60-6e51cde8a756","year":2017},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-11T12:42:35.559080Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:41.035764Z"},"links":{"citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:18d3e3abaa532722fa1cd7455b91148be3c31766f8cc55a64b292a0bfb3474fa","observation_id":"1b99f204-5e96-45ae-be0d-f747a5de7cff","resolution":{"observed_at":"2026-08-10T22:30:41.569605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:30:41.554802Z","title":"mir eval: A transparent implementation of common mir metrics","venue":null,"work_id":"1596a027-d3d2-4d9c-90ea-870b3e45fe22","year":2014},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-11T12:42:35.559080Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:41.039549Z"},"links":{"citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:2004ce495f3c8cd7d2bf190e3eb0305644f738d3ed28ccbad718f5a69b6d59da","observation_id":"2ab1403e-7f12-4380-87af-c1df667eb2ee","resolution":{"observed_at":"2026-08-10T22:30:41.558567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:30:41.543523Z","title":"Interspeech 2021 deep noise suppression challenge","venue":null,"work_id":"fd140a98-fdd8-4407-9e5b-9fe0da299941","year":2021},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-11T12:42:35.559080Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:41.043823Z"},"links":{"citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:721eb4b51b91c592f94c122aa242019b763ffd1553b7b3f8f3c92a27c0929316","observation_id":"f89505bb-77e7-4f4f-913d-95f3628267a9","resolution":{"observed_at":"2026-08-10T22:30:41.547587Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:30:41.530911Z","title":"Visual keyword spotting with attention","venue":null,"work_id":"1d37b850-1e48-47a1-bee7-e59827d9f4ee","year":2021},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-11T12:42:35.559080Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:41.048654Z"},"links":{"citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:2b8c58096df9f3019d433c8b9c93fe0c51ae3ec91fb376fae98c7629c36a6351","observation_id":"1605df20-c4fb-4ef3-9265-94cc66d4dc32","resolution":{"observed_at":"2026-08-10T22:30:41.535480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:30:41.518605Z","title":"Perceptual evaluation of speech quality (pesq)-a new method for speech quality assessment of tele- phone networks and codecs","venue":null,"work_id":"181cc200-ecf1-4aaa-82fc-40f536ae44f1","year":2001},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-11T12:42:35.559080Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:41.052999Z"},"links":{"citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:e2599e0e00f83befa8890c29461f0979532755d6604312e92ae7c3ed85e56ba3","observation_id":"98ba1576-386b-4233-8484-dee668835509","resolution":{"observed_at":"2026-08-10T22:30:41.523260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:30:41.056750Z","title":"U- net: Convolutional networks for biomedical image segmen- tation","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-11T12:42:35.559080Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:41.056750Z"},"links":{"citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:dd4de3af6709b7eb1677b84959af6e1c6e3caeaca523249a61fef89b0cf6788a","observation_id":"7bf38965-c9ea-4739-9ec7-3dfa4869b105","resolution":{"observed_at":"2026-08-10T22:30:41.056750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:30:41.500674Z","title":"Self-supervised audio-visual co-segmentation","venue":null,"work_id":"eae2d165-e7c4-458a-a973-96fc032dd076","year":null},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-11T12:42:35.559080Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:41.060530Z"},"links":{"citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:6ca72cdd9727a28ca006cb841124f1fbf9f556e8a874a9b56279a48f8e9e6305","observation_id":"b46a5225-02d9-431c-8c60-1da3672a0ab8","resolution":{"observed_at":"2026-08-10T22:30:41.504725Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:30:41.489719Z","title":"Audio-visual speech enhancement using conditional variational auto-encoders","venue":null,"work_id":"dfae8b30-cebc-4888-9c57-0f470b6ecc4a","year":2020},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-11T12:42:35.559080Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:41.064735Z"},"links":{"citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:cc8b48d7a88855ea9bc2d7209c09f01583f59062143a52977dee3d3c4db2f9a9","observation_id":"8439aeb5-1892-4af5-93e5-8858be541a88","resolution":{"observed_at":"2026-08-10T22:30:41.493571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:30:41.478850Z","title":"Seeing to hear better: evidence for early audio- visual interactions in speech identification","venue":null,"work_id":"8e0adafe-f492-46fd-8e23-b7547862d48c","year":2004},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-11T12:42:35.559080Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:41.068465Z"},"links":{"citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:1e1afabc3afa1fc382566df8c64caa3202162fa3217a6a633b052532d1c88325","observation_id":"8958c87f-7317-48ca-8abc-2a206c2c2e68","resolution":{"observed_at":"2026-08-10T22:30:41.482804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:30:41.467318Z","title":"Combining residual networks with lstms for lipreading","venue":null,"work_id":"c61a1b07-b2c9-4619-9e4c-d9ecb70033b7","year":null},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-11T12:42:35.559080Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:41.072889Z"},"links":{"citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:09b8b97dd136d3f4f2cc5be18051f37cc5f26c9860a4bc00bc4ba1003a9c9a81","observation_id":"925342c2-ae96-4f7e-b01b-7464fd4eef87","resolution":{"observed_at":"2026-08-10T22:30:41.471859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:30:41.455437Z","title":"An algorithm for intelligibility prediction of time- frequency weighted noisy speech","venue":null,"work_id":"08bddd27-1509-4f47-88ab-8577b891e1a5","year":2011},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-11T12:42:35.559080Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:41.076646Z"},"links":{"citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:b9bba0f2c05f399b8cc43aa5c8065b489f1a482333aa0160d7966585c3d4bd3c","observation_id":"f5d63be5-f809-4ebc-8f76-4623a4669aa5","resolution":{"observed_at":"2026-08-10T22:30:41.459504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:30:41.444527Z","title":"Unified mul- tisensory perception: Weakly-supervised audio-visual video parsing","venue":null,"work_id":"4ce16529-eeec-4bdb-b9d4-7b2fc36eb2b4","year":2020},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-11T12:42:35.559080Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:41.080374Z"},"links":{"citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:b3241a74879e6a9258701f16722b8b97678f0bedd3852dc1cac337e6461280ef","observation_id":"bf6c4257-0306-4ed4-b4a4-53236c4e19cb","resolution":{"observed_at":"2026-08-10T22:30:41.448453Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.01143","last_updated":"2021-05-30T03:47:08Z","snapshot_observed_at":"2026-08-04T08:34:08.992124Z","submitted_at":"2020-11-02T17:36:13Z","title":"Into the Wild with AudioScope: Unsupervised Audio-Visual Separation of On-Screen Sounds","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.01143","snapshot_observed_at":"2026-08-10T22:30:41.084566Z","title":"Into the wild with audioscope: Unsupervised audio-visual separa- tion of on-screen sounds","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-11T12:42:35.559080Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:41.084566Z"},"links":{"cited_paper":"/paper/2011.01143","citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:6603dbb6d7fd8c340947e723a757568e2a7e6feea93f231447241d83dccfc5cf","observation_id":"01094ad2-422e-4d84-b36a-b305d6649124","resolution":{"observed_at":"2026-08-10T22:30:41.084566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09669","last_updated":"2021-10-14T04:05:54Z","snapshot_observed_at":"2026-08-09T17:27:01.881957Z","submitted_at":"2021-06-17T17:23:44Z","title":"Improving On-Screen Sound Separation for Open-Domain Videos with Audio-Visual Self-Attention","version":2},"cited_work":{"arxiv_id":"2106.09669","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.09669","snapshot_observed_at":"2026-08-10T22:30:41.182394Z","title":"Improving On-Screen Sound Separation for Open-Domain Videos with Audio-Visual Self-Attention","venue":"cs.SD","work_id":"4d7db375-5cd6-4692-9031-1c04275b34b7","year":2021},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-11T12:42:35.559080Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:41.088534Z"},"links":{"cited_paper":"/paper/2106.09669","citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:4ac0d8dce36fee623bc227d19fa8f5d979ec6775b5dd40cb7475808338de9d48","observation_id":"70ce8276-f361-4f3d-a88e-9a3837b1bd3c","resolution":{"observed_at":"2026-08-10T22:30:41.188958Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:30:41.433058Z","title":"BSS EV AL toolbox user guide","venue":null,"work_id":"90c59bc2-8ba9-47b2-913c-c5aca2c58b21","year":null},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-11T12:42:35.559080Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:41.092693Z"},"links":{"citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:0a42ad38f01221c817e10f481f63db92383b076a9a88a0808afb27e0317f8916","observation_id":"6c9a8694-407f-4356-aad8-6d1fba8e3278","resolution":{"observed_at":"2026-08-10T22:30:41.437238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:30:41.409213Z","title":"Supervised speech sep- aration based on deep learning: An overview","venue":null,"work_id":"9a97be13-9498-4eea-8548-5b5ee9bfd869","year":2018},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-11T12:42:35.559080Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:41.100737Z"},"links":{"citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:ffedf5ba5780b8033765b7f56f3a5e7a088c9e4c1149deda30d6db813a861130","observation_id":"c4a5be8b-1a04-4b42-8acf-601a24046850","resolution":{"observed_at":"2026-08-10T22:30:41.413067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:30:41.397200Z","title":"V oicefilter: Tar- geted voice separation by speaker-conditioned spectrogram masking","venue":null,"work_id":"a6d2f450-e994-4152-ab89-6165c2b282e4","year":2018},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-11T12:42:35.559080Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:41.104155Z"},"links":{"citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:0a5e0077accf815ec6e16e32c8ce31556d560f2ff9eab7ffa85f0ca09bac28fa","observation_id":"b40b4959-5bfd-4f45-bca7-24f196a58ba5","resolution":{"observed_at":"2026-08-10T22:30:41.401200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:30:41.385561Z","title":"Combining spectral and spatial features for deep learning based blind speaker separation","venue":null,"work_id":"c89ba66a-d6f2-4807-8143-1d75e071c364","year":2019},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-11T12:42:35.559080Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:41.108114Z"},"links":{"citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:5eba2c273fc136362d3db78e94e9352f054dd70f7ea034a63511f8114b51482d","observation_id":"48bcb8d7-55c5-4300-a1c9-f683f67eb681","resolution":{"observed_at":"2026-08-10T22:30:41.389835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:30:41.373340Z","title":"Time domain audio visual speech separation","venue":null,"work_id":"fb6dc912-ab52-4390-9f2f-dc1fccf05bf6","year":2019},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-11T12:42:35.559080Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:41.111482Z"},"links":{"citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:c5f0640404d3ba05f20811af1b688f6ca23b3396f955e1634676afcfc1421c38","observation_id":"aec89adc-0dbb-4aa4-80d4-390ae8562903","resolution":{"observed_at":"2026-08-10T22:30:41.377627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:30:41.361684Z","title":"Multilevel language and vision integration for text-to-clip retrieval","venue":null,"work_id":"fe92ecbb-0aa7-4f96-9401-0b200622dd51","year":2019},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-11T12:42:35.559080Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:41.115377Z"},"links":{"citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:1f4ca7bffd1e1eeaaf05092428a2e2a77f60dc4bee1a70b67169fb7e36a216aa","observation_id":"46297670-87a4-4164-844e-89649023ac2c","resolution":{"observed_at":"2026-08-10T22:30:41.365307Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:30:41.351545Z","title":"Recursive visual sound separation using minus-plus net","venue":null,"work_id":"0407f14c-9a17-403b-a958-e7b0f204007e","year":2019},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-11T12:42:35.559080Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:41.118996Z"},"links":{"citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:4e378452b01a62e17996e58dcdfe0459174b4a54774b6019fa551b10ecbbf1ec","observation_id":"7c021b59-cba2-4afd-b9c2-b8154d58eb59","resolution":{"observed_at":"2026-08-10T22:30:41.354847Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:30:41.340326Z","title":"Permutation invariant training of deep models for speaker-independent multi-talker speech separation","venue":null,"work_id":"a82ea4db-06b1-4c62-98f2-dfe56aae9eed","year":2017},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-11T12:42:35.559080Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:41.123101Z"},"links":{"citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:41357850786ecc01d3266e0b1cce810d4ac35a3898dcabe6eb2d71fa32b37afb","observation_id":"bd574924-a41b-45cd-87e1-d1041bfb2cfe","resolution":{"observed_at":"2026-08-10T22:30:41.344301Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:30:41.329141Z","title":"To find where you talk: Temporal sentence localization in video with attention based location regression","venue":null,"work_id":"a1e6f6f1-27f4-4dcb-b2be-dd406f4c3b32","year":2019},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-11T12:42:35.559080Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:41.127305Z"},"links":{"citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:9486555fcca8bc407db759e09528dd73707627ad62b5f4b09912ee42e57bd131","observation_id":"3a19ff94-23a7-4a91-b9ef-9504a7120d69","resolution":{"observed_at":"2026-08-10T22:30:41.332912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:30:41.317612Z","title":"The sound of motions","venue":null,"work_id":"0ebc98e8-1854-4a5f-923f-a6d9024d672c","year":2019},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-11T12:42:35.559080Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:41.131259Z"},"links":{"citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:64aa93051661847a8bbbf3aadb9b6a0d94c25b20ef9cf0ff7c7b00d63b3f7d5a","observation_id":"874a4fa0-1153-49f4-9d49-67239dd48ae4","resolution":{"observed_at":"2026-08-10T22:30:41.321307Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1804.03160","last_updated":"2018-10-14T01:09:15Z","snapshot_observed_at":"2026-08-02T00:42:00.055408Z","submitted_at":"2018-04-09T18:00:36Z","title":"The Sound of Pixels","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.03160","snapshot_observed_at":"2026-08-10T22:30:41.135038Z","title":"The sound of pixels","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-11T12:42:35.559080Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:41.135038Z"},"links":{"cited_paper":"/paper/1804.03160","citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:ccd9db175d3aa63b12dae8599b2e7af5e2feeee924aa0f64a13f55d3c461b6ef","observation_id":"de3c0aa3-f74f-45a9-9044-40555c7f02a1","resolution":{"observed_at":"2026-08-10T22:30:41.135038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:30:41.421110Z","title":null,"venue":null,"work_id":"10d12814-48f3-4452-8f21-517b91d89007","year":2005},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-11T12:42:35.559080Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":1706,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:41.097036Z"},"links":{"citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:f7bb02d2beb62f6efb19be13d5686a5e1cc4794946c4237a401f0d9298572742","observation_id":"6aec83be-3d62-49aa-9182-461b5a26161e","resolution":{"observed_at":"2026-08-10T22:30:41.425188Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-11T12:42:35.559080Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation"},"reference_resolution":{"displayed":58,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":3,"verified_fuzzy":42},"total_outbound_references":58},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 0 inbound Pith citation observations for arXiv:2501.01518."}