{"as_of":"2026-08-08T06:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:28dcad1e360645953eb5d9f0edf4d88736aff7c202513918bf0ffa2bc0b54ed2","coverage":[{"denominator":82,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":82,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T15:40:09.564250Z","state":"measured"},{"denominator":83,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":83,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T19:39:50.277622Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-06T15:33:05.211063Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.15294","snapshot_observed_at":"2026-08-02T19:39:50.277622Z","title":"Memo: Attentional momentum for real-time audio-visual speaker extraction under impaired visual conditions,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.01530","last_updated":"2026-06-29T12:25:41Z","snapshot_observed_at":"2026-08-08T04:36:38.509410Z","submitted_at":"2026-03-02T07:00:48Z","title":"CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T19:39:50.277622Z"},"links":{"cited_paper":"/paper/2507.15294","citing_paper":"/paper/2603.01530"},"observation_digest":"sha256:d9d1fe50f4dde4afc16d77ebfeb29a8c73b849a09083d54af8f747895e810b0a","observation_id":"a093622f-23ed-4eee-b9d4-df82da779cc2","resolution":{"observed_at":"2026-08-02T19:39:50.277622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.15294/citation-record","integrity":"/paper/2507.15294/integrity","json":"/paper/2507.15294/citation-record.json","paper":"/paper/2507.15294"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:09.175918Z","title":"Some experiments on the recognition of speech, with one and with two ears,","venue":null,"work_id":null,"year":1953},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-06T15:33:05.211063Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.175918Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:1d47d18ccd7fe95d469606fbec0c9983cbdee2dae4a9d205d33133fd62770ea2","observation_id":"83c6922e-33a6-4d1b-9c21-65841d11fc41","resolution":{"observed_at":"2026-08-06T15:40:09.175918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:09.181286Z","title":"The cocktail party phenomenon: A review of research on speech intelligibility in multiple-talker conditions,","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-06T15:33:05.211063Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.181286Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:6425496fe6635776db08ca49f9ce34a698ae52c197d7696ee44c385b19444793","observation_id":"744f2f48-ebd7-4a45-8006-d2f53eb17f8b","resolution":{"observed_at":"2026-08-06T15:40:09.181286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.944318Z","title":"Seeing to hear better: evidence for early audio-visual interactions in speech identification,","venue":null,"work_id":"b01507e1-8851-41e9-a5c6-3f623b704429","year":2004},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-06T15:33:05.211063Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.186675Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:e7d6f01a87b5369d33ce9e5583d429e3a5f53e2280e0010303df7300702d9d09","observation_id":"8b3c2740-4d0c-4fe9-9692-f331dc2aa051","resolution":{"observed_at":"2026-08-06T15:40:10.949415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.927895Z","title":"Visual contribution to speech intelligibility in noise,","venue":null,"work_id":"a2afff33-9a7f-49cf-bcfd-2a8d38332ac8","year":1954},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-06T15:33:05.211063Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.191605Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:e8ba72290157b3f97cf1a6afad89d77931931430d33a4b0a97db783f6d47ebe8","observation_id":"95ec1176-f5ff-4daf-aed3-5b0f40666070","resolution":{"observed_at":"2026-08-06T15:40:10.932674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.909988Z","title":"Muse: Multi-modal target speaker extraction with visual cues,","venue":null,"work_id":"468ebd1a-82aa-4e16-b9d4-3c5de9b4dc70","year":2021},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-06T15:33:05.211063Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.196835Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:160016c9aa019eb674431ddf2974a818bb687f804c7b49bdaa8af4973bba084f","observation_id":"4ff5073d-3358-4e53-8caa-ed50b21744a5","resolution":{"observed_at":"2026-08-06T15:40:10.915156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.878758Z","title":"Usev: Universal speaker extraction with visual cue,","venue":null,"work_id":"0241c5c0-f2ec-44b6-9462-311f20b1c2c7","year":2022},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-06T15:33:05.211063Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.201540Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:a11667ed6a6906ce307d112bbd7ea802c1a617438c924dbc8eea8e6a5085a5a7","observation_id":"2763e41b-075b-4632-925b-f5e4921a5a8c","resolution":{"observed_at":"2026-08-06T15:40:10.885618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.862375Z","title":"Time domain audio visual speech separation,","venue":null,"work_id":"83f33b65-a0b7-4383-b007-49fed8676503","year":2019},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-06T15:33:05.211063Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.207358Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:dbdb7321f50ae01f64934d79bcd04d2902fdfcf0dea41c41df23fac28eddacbb","observation_id":"d1c517a4-72d4-4dbd-b3a0-a2c100695cab","resolution":{"observed_at":"2026-08-06T15:40:10.866995Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:09.212164Z","title":"Neural target speech extraction: An overview,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-06T15:33:05.211063Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.212164Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:0dce6467ef7b5a86c1ed52a6ba1ec27da2afc2aaa23e5007ee04a29cd125806b","observation_id":"094b854b-5973-4c6b-a35e-cf83b49c2596","resolution":{"observed_at":"2026-08-06T15:40:09.212164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.837387Z","title":"An overview of deep-learning-based audio-visual speech en- hancement and separation,","venue":null,"work_id":"09137df7-b0b5-4b2a-bf5e-f383e9a851b9","year":2021},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-06T15:33:05.211063Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.217781Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:47ce261bbe630a11d60c0ed1545fa93732fa1ecb06efcc8749c831453aa9cdd6","observation_id":"a76edd7b-75fe-4c81-b09d-a2a30fc5197c","resolution":{"observed_at":"2026-08-06T15:40:10.841856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.821601Z","title":"PIA VE: A Pose-Invariant Audio- Visual Speaker Extraction Network,","venue":null,"work_id":"7cac7411-f91b-4eb6-951a-ee67fde4e854","year":2023},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-06T15:33:05.211063Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.222557Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:5d3395ef9b5185064b61d5c81cfc9e5057c968b0bc92fbe65a69ae7960c9ab50","observation_id":"1a4b2d8f-8080-4e8e-a875-1c91d982f1bd","resolution":{"observed_at":"2026-08-06T15:40:10.826667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.804506Z","title":"Speaker extraction with co-speech gestures cue,","venue":null,"work_id":"d17ed1ac-85f9-457c-b0cb-602f7563ab94","year":2022},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-06T15:33:05.211063Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.227254Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:2d96e0f2778b84dc7ef4475139b65772da4f77384a38e1d281b06e6ce0d83ebc","observation_id":"7d13eadd-9117-4305-83c8-634b94bccd40","resolution":{"observed_at":"2026-08-06T15:40:10.809836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.787534Z","title":"Rethinking the Visual Cues in Audio-Visual Speaker Extraction,","venue":null,"work_id":"20dc8f8b-f8c1-4527-89ad-90d7e07f623f","year":2023},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-06T15:33:05.211063Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.231505Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:1f2b946cc39d1c758393e0f677112caac552157a85bcf886e9c78c08bc5a1762","observation_id":"0f02fc49-23af-4400-a7a3-c539854bd177","resolution":{"observed_at":"2026-08-06T15:40:10.792840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.762362Z","title":"FaceFilter: Audio- Visual Speech Separation Using Still Images,","venue":null,"work_id":"ef41a563-44bb-4dea-9c0e-cdd27c13f59b","year":2020},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-06T15:33:05.211063Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.235980Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:679ea9b283decf7e0c169dafaf1c2d2ec9f59c23a481a4880187ed05eac47879","observation_id":"302839d1-bece-43a4-8150-2868d3c52695","resolution":{"observed_at":"2026-08-06T15:40:10.767074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.746819Z","title":"c 2av-tse: Context and confidence-aware audio visual target speaker extraction,","venue":null,"work_id":"62c54e5b-b043-498d-a3d0-5396c1812ae6","year":2025},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-06T15:33:05.211063Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.239987Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:c9dc4cdf91e083b75dcf94784889536db6f7a247a365b838ae997eafc25d55b9","observation_id":"91365b9e-2036-43e3-b47e-3086683cfa8c","resolution":{"observed_at":"2026-08-06T15:40:10.751607Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.731807Z","title":"Incorporating linguistic constraints from external knowledge source for audio-visual target speech extraction,","venue":null,"work_id":"c092e8a7-092b-4fc9-a1aa-6c3373182568","year":2025},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-06T15:33:05.211063Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.244151Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:0fd5a5c46167dc0d650aefa8886a5385c3dc3fbac7e967794a7023f2565079de","observation_id":"0a5ad71e-687a-4064-b397-262808e4d4ae","resolution":{"observed_at":"2026-08-06T15:40:10.736790Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.716856Z","title":"Iianet: An intra- and inter-modality attention network for audio-visual speech separation,","venue":null,"work_id":"27e5f2cb-812c-4e95-9d76-ff961e329946","year":2024},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-06T15:33:05.211063Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.248745Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:a83cc5dd1b9b78c572ac9a66ad8449c9e6da673c54e72b3906cef22422dccccc","observation_id":"982b878b-e97d-4872-a5db-3910f7170acb","resolution":{"observed_at":"2026-08-06T15:40:10.721532Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.700027Z","title":"Hearing lips in noise: Universal viseme-phoneme mapping and transfer for robust audio-visual speech recognition,","venue":null,"work_id":"4a5b7ba3-e628-4573-875a-8ab3f2b7a01d","year":2023},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-06T15:33:05.211063Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.253262Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:5f2d735fa18775ceae718f4251ff21455d13b15bdce4d973ed65fd3739011000","observation_id":"68eefdee-0a10-4910-844e-7f8f666b21d1","resolution":{"observed_at":"2026-08-06T15:40:10.704696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.683030Z","title":"Diarization is hard: Some experiences and lessons learned for the jhu team in the inaugural dihard challenge","venue":null,"work_id":"fc4aea89-7cc7-48b6-8e5b-bc934367db7f","year":2018},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-06T15:33:05.211063Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.257996Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:3b0c345238a0a5f0285d53d9a7a87d6e507841557bce9dc88f023b1d0783443b","observation_id":"5516288b-28fe-4e07-9780-6485d57fdb4e","resolution":{"observed_at":"2026-08-06T15:40:10.688983Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.667533Z","title":"Noise- disentanglement metric learning for robust speaker verification,","venue":null,"work_id":"6b06fdb2-900f-4e7e-9374-eefc1fe50b59","year":2023},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-06T15:33:05.211063Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.263291Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:6f71ec1337a09c7a60f0d2b1e2b3b7873ce270ee382cc4e4ea147cc1b3b0cd62","observation_id":"251799e1-7c01-4669-abea-64bcb8f411b9","resolution":{"observed_at":"2026-08-06T15:40:10.672219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.651551Z","title":"Momuse: Momentum multi-modal target speaker extraction for real-time scenarios with impaired visual cues,","venue":null,"work_id":"e69c06b1-da1c-4890-9b23-8682848f1762","year":2025},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-06T15:33:05.211063Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.267901Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:a48e81f321fa4728865aa1d0a7043656c7c2de6f20a32111f892514411d2e73d","observation_id":"9b109bc0-8f1d-4e45-9b0c-b6a4cc57e48f","resolution":{"observed_at":"2026-08-06T15:40:10.656814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.635786Z","title":"Ravss: Robust audio- visual speech separation in multi-speaker scenarios with missing visual cues,","venue":null,"work_id":"7121078f-75ce-4f7a-b274-6f84b327a785","year":2024},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-06T15:33:05.211063Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.273119Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:b9029eef746edad05d4d3c179d0f3491a97bb59f006e5e2bd64ebb0efd74b1cb","observation_id":"0cb45b8b-12b0-4d2d-bc15-9b7e1d9cb579","resolution":{"observed_at":"2026-08-06T15:40:10.641107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.616778Z","title":"Switching variational auto- encoders for noise-agnostic audio-visual speech enhancement,","venue":null,"work_id":"22823589-a1cc-4315-a422-4b4a32bb05ec","year":2021},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-06T15:33:05.211063Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.277199Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:0a42d9e298c6687b75cf9f040dfaec9c0ecd42af320101c7aef6d58855a26a16","observation_id":"ca417b6c-9d8f-497e-817a-1d9c3321d122","resolution":{"observed_at":"2026-08-06T15:40:10.621867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.600910Z","title":"Robust unsupervised audio-visual speech enhance- ment using a mixture of variational autoencoders,","venue":null,"work_id":"2d1c631f-1a1e-4ad5-8da5-f987e5eb3c8f","year":2020},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-06T15:33:05.211063Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.281465Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:b7a7c53811396ba919b6b9e4a446c3ddd7a53fe6c4d77947fc9613036bceb393","observation_id":"d4283792-3a6a-4479-af6c-1321dd6c1cc4","resolution":{"observed_at":"2026-08-06T15:40:10.606055Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.585979Z","title":"Time-domain audio-visual speech separation on low quality videos,","venue":null,"work_id":"a22b2d82-edc6-41f1-9267-54955f7222e1","year":2022},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-06T15:33:05.211063Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.286027Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:acf1ad7306bb908334a4be4420e7e71a2715e4c5666a1051c22eaf0fa4612ae6","observation_id":"5f16851f-04db-428a-988a-61d4a7da1a78","resolution":{"observed_at":"2026-08-06T15:40:10.590626Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.569880Z","title":"Imaginenet: Target speaker extraction with intermittent visual cue through embedding inpainting,","venue":null,"work_id":"fb34618f-c334-43ad-8e36-318e0cf972cd","year":2023},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-06T15:33:05.211063Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.291033Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:6c892901924b216f06550368e6f368fd0a884aba2aad25dedac9b0a955e4f5e7","observation_id":"952af7c7-1dfe-4740-b23e-d0bd0ab8c3a9","resolution":{"observed_at":"2026-08-06T15:40:10.574988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.555205Z","title":"My lips are concealed: Audio-visual speech enhancement through obstructions,","venue":null,"work_id":"1eb8b5df-06f3-4a7e-9e96-2b0e6f1fe665","year":2019},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-06T15:33:05.211063Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.296351Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:a7593f005ffdf37df5517d7136eae4bfb22da9f280dca7ec398fcd7f180f8cfa","observation_id":"e7dcd13f-e53e-4227-a762-1dd98aa07395","resolution":{"observed_at":"2026-08-06T15:40:10.559734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.540468Z","title":"Multi-cue guided semi-supervised learning toward target speaker separation in real environments,","venue":null,"work_id":"9f86a741-e573-4070-b9b3-4a3032bcbcdc","year":2023},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-06T15:33:05.211063Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.300822Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:4295c9239bd2a183f27bb35fc873668fbfa229f81b5384dcbdf0c2daddc24a6a","observation_id":"6619f601-ea29-4e01-9e11-6d48e8324806","resolution":{"observed_at":"2026-08-06T15:40:10.545050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.524496Z","title":"A two-stage audio-visual speech separation method without visual signals for testing and tuples loss with dynamic margin,","venue":null,"work_id":"2c4d89a0-58d9-42b5-b671-baaebdcb2947","year":2024},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-06T15:33:05.211063Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.305414Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:29c6c8130e16a2d2504fa7fd723a6f3a527fda53a9225e1b731851726f7e001c","observation_id":"f4f9bccf-176a-4260-a95b-6ca2b83a4649","resolution":{"observed_at":"2026-08-06T15:40:10.528996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.508783Z","title":"Cross-modal speech separation without visual information during testing,","venue":null,"work_id":"3dedebdc-765c-4d19-aad6-33ee4893b2eb","year":2023},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-06T15:33:05.211063Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.311071Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:ec0d8d928fa838bd0d2dcc1f808c66752596516ffa5fe836e03c60e66bc9337c","observation_id":"84bce1f1-23d6-4331-9ed0-991756082d7f","resolution":{"observed_at":"2026-08-06T15:40:10.513641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.493402Z","title":"Robust audio-visual speech enhancement: Correcting misassignments in complex environments with advanced post-processing,","venue":null,"work_id":"85186f03-1a35-43b3-94d0-6b16db882143","year":2024},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-06T15:33:05.211063Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.317501Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:67f4eda0ec376c1c2798f759e5c0edc12897cc5e1747b26d64488acf04fd6408","observation_id":"d62436f8-6c39-4acd-acbb-d67d25f39ccc","resolution":{"observed_at":"2026-08-06T15:40:10.498357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.478044Z","title":"Cocktail party listening in a dynamic multitalker environment,","venue":null,"work_id":"4c13fef3-1ade-4faf-8ffd-61f9f16fa107","year":2007},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-06T15:33:05.211063Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.323438Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:4ca9fbbe7d5f1df84c025040f20706672e39c239dad7e9107d6063af040d538e","observation_id":"c459807a-0a79-4ed6-8058-0cea66615d59","resolution":{"observed_at":"2026-08-06T15:40:10.482734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.462265Z","title":"The advantage of knowing where to listen,","venue":null,"work_id":"9efcf818-193b-4e22-8282-1f04aeadcff9","year":2005},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-06T15:33:05.211063Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.329382Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:a19e71667aa8304e8ed97c50f04339e9c589529b635fa94d803733c9affb551e","observation_id":"e408aa7c-a002-478f-a24e-080c71069d95","resolution":{"observed_at":"2026-08-06T15:40:10.467314Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.444434Z","title":"Object continuity enhances selective auditory attention,","venue":null,"work_id":"6a42bbff-ac7a-441e-9208-3b8303653bd1","year":2008},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-06T15:33:05.211063Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.334812Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:36e399f964bb22167bd81c9ad9551d093ea4de19deb9d705f8c9f44a68a67d46","observation_id":"c7f82ef1-b792-452b-a6db-e60f3923d14c","resolution":{"observed_at":"2026-08-06T15:40:10.450245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.427031Z","title":"Enhanced learning through multimodal training: evidence from a comprehensive cognitive, physical fitness, and neuroscience intervention,","venue":null,"work_id":"0ce359dd-e4a8-4667-9ddf-0f27ed87db0a","year":2017},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-06T15:33:05.211063Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.339775Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:68b674fa458e5f657cb29270f95e53f0bb4137964835eaed721c8187adbf8c4b","observation_id":"67e2d8c8-66db-4084-b3cc-1a7574113c4e","resolution":{"observed_at":"2026-08-06T15:40:10.432061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.409111Z","title":"The important role of contex- tual information in speech perception in cochlear implant users and its consequences in speech tests,","venue":null,"work_id":"2be9d682-ae40-40ab-b0ab-41e857ef1b97","year":null},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-06T15:33:05.211063Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.344866Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:ee7966b68930b9e9faf7ef71133cb88ea4d994efcdb45a82050d7747c9dab0bb","observation_id":"c202bef3-25b1-4d8c-a92a-f2e3d8b3cbbe","resolution":{"observed_at":"2026-08-06T15:40:10.414053Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.389405Z","title":"Attention and working memory in human auditory cortex,","venue":null,"work_id":"e07ae768-8fab-4e96-b0cf-e92f90ffea09","year":2019},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-06T15:33:05.211063Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.350053Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:d1fd3e97314ef99846e19c8de6dd971ecf3b418c66868c7756b080da8d2fa1fd","observation_id":"92d5150e-1fa1-4fa2-8fe1-bc72d4bc2acf","resolution":{"observed_at":"2026-08-06T15:40:10.395278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.372461Z","title":"Interactions between attention and working memory,","venue":null,"work_id":"49badd16-8a84-4741-bd81-04ce370f95cc","year":2006},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-06T15:33:05.211063Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.354448Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:fc36a778f18743b58426b43c3737dc7339ed0d74cd181447110b2da82a574ec8","observation_id":"877109a9-6ee5-418f-aefb-59121d7b42b2","resolution":{"observed_at":"2026-08-06T15:40:10.377778Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.356439Z","title":"Look once to hear: Target speech hearing with noisy examples,","venue":null,"work_id":"62d13a52-c164-4ac5-a29a-7b9521f78d09","year":2024},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-06T15:33:05.211063Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.358543Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:ff6fcb6547935e0951eb35bc57eb9d7e8f710009dd04142ed2825d4d4d8e3886","observation_id":"f1508676-d493-4fde-b68c-adfcae7d7c55","resolution":{"observed_at":"2026-08-06T15:40:10.361411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:09.362651Z","title":"Multimodal attention fusion for target speaker extraction,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-06T15:33:05.211063Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.362651Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:7d3d01b55049b6bfef152bbf35215828e251cc821cca531ed2d9bd64be527126","observation_id":"e077f5c0-d99c-48aa-9f92-fb7421d248c6","resolution":{"observed_at":"2026-08-06T15:40:09.362651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.327584Z","title":"Multimodal speakerbeam: Single channel target speech extraction with audio-visual speaker clues","venue":null,"work_id":"c001a608-3f77-493f-a47b-a25e6aaf90ac","year":2019},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-06T15:33:05.211063Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.366891Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:09fedddbf189bab870e5613e3b08c0569564facef654347c3f875dafa3cb262f","observation_id":"d6d0b610-dd7f-440e-bebd-a6e46823b311","resolution":{"observed_at":"2026-08-06T15:40:10.332485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.305034Z","title":"Memory networks,","venue":null,"work_id":"1634c8fb-f933-451e-b6f7-b67f327126c3","year":2015},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-06T15:33:05.211063Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.371554Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:d4c3ad1361c1f26571d80b36f284159efea116431e78d557a6e5792ec8bfa672","observation_id":"5987cf6c-44af-40fa-a653-65ff48ffcdec","resolution":{"observed_at":"2026-08-06T15:40:10.311379Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.282279Z","title":"End-to-end memory net- works,","venue":null,"work_id":"e726c16f-573c-424c-bc84-7ff16786685d","year":2015},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-06T15:33:05.211063Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.377652Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:5b080666e3b211a4ec13ca644df03fc8da2c8d22cc820cdc5aa84724a632b86c","observation_id":"3b1f9cce-ca92-414a-97b1-3694b4dd8106","resolution":{"observed_at":"2026-08-06T15:40:10.289641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.262391Z","title":"Unsupervised feature learning via non-parametric instance discrimination,","venue":null,"work_id":"1f89d4d2-f915-4574-bcf9-643521bb251d","year":2018},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-06T15:33:05.211063Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.382343Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:6217aae19e98695e6320b786aac761ca48e07523f21d26df33c900acc6831b02","observation_id":"c9af338d-836f-4736-ac78-904d87b15541","resolution":{"observed_at":"2026-08-06T15:40:10.268598Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.245141Z","title":"Cromm-vsr: Cross-modal memory augmented visual speech recognition,","venue":null,"work_id":"c1fcd196-a4ee-4172-a2a1-30972cf597ea","year":2022},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-06T15:33:05.211063Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.386674Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:7529f228d39873b024ca158a5af2e848373022580984163ca0e3d415002cc9bc","observation_id":"91992967-d5e3-4a92-b2e2-d45a6a180914","resolution":{"observed_at":"2026-08-06T15:40:10.250036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.230411Z","title":"Multi-temporal lip-audio memory for visual speech recognition,","venue":null,"work_id":"fe6a32e5-fa74-477b-85fa-2c8fb166f207","year":2023},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-06T15:33:05.211063Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.391493Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:d7a02287984980f87c1f995e6ca794657817612fa729ab09be5c696f0446b5c6","observation_id":"f400ee2c-ab6b-4fc8-8a4a-bb3348d44d10","resolution":{"observed_at":"2026-08-06T15:40:10.235219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.214896Z","title":"Multi-modality associative bridging through memory: Speech sound recollected from face video,","venue":null,"work_id":"8d272187-94d6-4dd8-ac3f-65ed595f2db9","year":2021},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-06T15:33:05.211063Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.395575Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:908f7a662d6d155c5c42447185c18e7a591f1fe58b34261a58524ddfbb825767","observation_id":"3d307f7b-3734-4902-b509-f0f6e5b525b0","resolution":{"observed_at":"2026-08-06T15:40:10.220095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.196743Z","title":"Akvsr: Audio knowledge empowered visual speech recognition by compressing audio knowledge of a pretrained model,","venue":null,"work_id":"bd26d194-f0c0-47e8-bee6-c0d63f490baf","year":2024},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-06T15:33:05.211063Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.400260Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:22a8c3d48a8ddb9f80f13c9fa2fbb9a5c63a741b1622fabdd3574d5e37fa46b7","observation_id":"b7540409-2519-41ea-b221-7034dc95db8b","resolution":{"observed_at":"2026-08-06T15:40:10.202608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.179633Z","title":"Distinguishing homophenes using multi-head visual-audio memory for lip reading,","venue":null,"work_id":"954682dc-b035-4b35-81b8-e1d360b04028","year":2022},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-06T15:33:05.211063Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.405373Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:1506b7a1bb343f02c1976bf91a239b9cc6902acb70fa0d42024282a457601457","observation_id":"62dbf9dc-1e99-402c-a311-d97e8e29a2b3","resolution":{"observed_at":"2026-08-06T15:40:10.184305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.161939Z","title":"Speech reconstruction with reminiscent sound via visual voice memory,","venue":null,"work_id":"0a4b3ba4-67ac-40f1-9483-3981107760c8","year":2021},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-06T15:33:05.211063Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.409884Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:3e04ca661f1d9c6d077bf5018219ff78ac0b27ee52dab844af46a84aecb39dd3","observation_id":"8b8a75df-6b28-4901-82c0-914c3a569f20","resolution":{"observed_at":"2026-08-06T15:40:10.166533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.146857Z","title":"Modeling attention and memory for auditory selection in a cocktail party environment,","venue":null,"work_id":"efdb184f-c7bb-48fb-85da-69f4c41e8bf4","year":2018},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-06T15:33:05.211063Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.414371Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:6f198cc34c3e78f02fb9f37048521bc8dde6c7385d0079c0984526e0793c8919","observation_id":"aec87788-c5ef-4974-a09f-11d8b2aa3a8e","resolution":{"observed_at":"2026-08-06T15:40:10.151632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.130123Z","title":"Explicit-memory multiresolution adaptive framework for speech and music separation,","venue":null,"work_id":"d66f6583-b375-4c6c-922b-984887f0c3ad","year":2023},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-06T15:33:05.211063Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.419236Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:fdce5c2cb197853233d0aa9c9f0d4db440e1ea9c2c9bc8dbbd09697a2e255274","observation_id":"4057b1ff-ab00-44c2-a304-2d26fb5eb04f","resolution":{"observed_at":"2026-08-06T15:40:10.135206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.114139Z","title":"On the effectiveness of enrollment speech augmentation for target speaker extraction,","venue":null,"work_id":"40aeab7f-f55b-4d90-b3d6-2cc44ed1720f","year":2024},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-06T15:33:05.211063Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.423757Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:a71a92ae87a8d7692bcd772f531ad10ae2682ec2b6e9130e7c4730f63d8debfd","observation_id":"f8dedcdf-0717-4d31-ace6-d546dc222950","resolution":{"observed_at":"2026-08-06T15:40:10.118919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.097808Z","title":"Selective listening by synchronizing speech with lips,","venue":null,"work_id":"f8ee122f-b3e8-4b94-a540-57516025ca73","year":2022},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-06T15:33:05.211063Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.428367Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:22f1f02a4429a858141e44ab86e02f78317f424bed3063a21b155729f1dba197","observation_id":"09f89054-bda5-48b8-8c9f-f5e021deb3c4","resolution":{"observed_at":"2026-08-06T15:40:10.102594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.081136Z","title":"Robust Speaker Extraction Network Based on Iterative Refined Adap- tation,","venue":null,"work_id":"26137920-c1e3-45c4-a636-f6ff5c9076d9","year":2021},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-06T15:33:05.211063Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.432582Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:2ea94c1b24bd90f3d8bee6209fa0b842771bbd81abe9dfd739a2a7aeb3d181aa","observation_id":"02d088bf-9e49-468c-b71e-80c73883c938","resolution":{"observed_at":"2026-08-06T15:40:10.086812Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.064557Z","title":"Listening and group- ing: an online autoregressive approach for monaural speech separation,","venue":null,"work_id":"b9ef645a-e152-4be2-8fc8-dc2aba587610","year":2019},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-06T15:33:05.211063Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.437077Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:cca5b710df93acee7509a4daf7c9f2cb55bbf42d5145a3016c2ee957d34e959b","observation_id":"7752d5ec-a8d0-4ad4-b71a-94b4668935d2","resolution":{"observed_at":"2026-08-06T15:40:10.070125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.049149Z","title":"Source-aware context network for single-channel multi-speaker speech separation,","venue":null,"work_id":"ad4bdee0-3c6c-4275-a758-094751916965","year":null},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-06T15:33:05.211063Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.441118Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:b93836befcd1fab326a04498f03a7d96a75aff1c91dbe907bdc956e53828d14e","observation_id":"ec8da356-41c7-4aa4-ad74-9509c544109d","resolution":{"observed_at":"2026-08-06T15:40:10.053802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.032595Z","title":"An online speaker-aware speech separation approach based on time-domain representation,","venue":null,"work_id":"10752c6e-285e-484e-87fa-258a04a5f9c1","year":2020},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-06T15:33:05.211063Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.445488Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:09685e9e182808b72d007bb98829a9f62acb9a291d2148a151a56792715ec944","observation_id":"7b63a849-45b7-4346-b50a-5dfc98bd0baa","resolution":{"observed_at":"2026-08-06T15:40:10.037326Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.015823Z","title":"Iterative autoregression: a novel trick to improve your low-latency speech enhancement model,","venue":null,"work_id":"f2e9a97e-0ce1-486e-acd8-f59bf41fa753","year":2023},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-06T15:33:05.211063Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.450282Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:04f82d464fec2900c45a58e062b92e716794ef5a0fa47565f3013fc739fe0f6c","observation_id":"c75e5f9b-344c-48e1-a81c-cbb23b9a1946","resolution":{"observed_at":"2026-08-06T15:40:10.020906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:09.998954Z","title":"Neuroheed: Neuro- steered speaker extraction using eeg signals,","venue":null,"work_id":"a9f6a258-3b80-4124-a4e2-a004dee1140b","year":2024},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-06T15:33:05.211063Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.454651Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:7cbbbe50eefb6318b696f00fb50e94539c15a6d59c908f19224dfb5c393e0d60","observation_id":"f3f3203c-8165-4df5-8d2f-c873e09cbeab","resolution":{"observed_at":"2026-08-06T15:40:10.004328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:09.980069Z","title":"Neuroheed+: Improving neuro-steered speaker extraction with joint auditory attention detection,","venue":null,"work_id":"9ee0d673-2cfc-434b-b993-e39e0af2324b","year":null},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-06T15:33:05.211063Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.458874Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:15def655697ebb2311fa9f148f30b992add2b26238fe5c384b198adc66019798","observation_id":"e6b96c13-e4cd-4786-a305-f25608f9ce1e","resolution":{"observed_at":"2026-08-06T15:40:09.985128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:09.964002Z","title":"Paris: Pseudo-autoregressive siamese training for online speech separation,","venue":null,"work_id":"e0b40232-6619-4233-b129-33d32be637eb","year":2024},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-06T15:33:05.211063Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.463998Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:c54d6fa8081f06bf1e94c45938c6073d0303e0050c65b687bca556d921668c0d","observation_id":"0f2bcac3-be4f-490a-ab12-cecd3933a5e9","resolution":{"observed_at":"2026-08-06T15:40:09.968849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:09.943578Z","title":"On- line Audio-Visual Autoregressive Speaker Extraction,","venue":null,"work_id":"6e335ca4-863d-45aa-8e86-00f72adc1b65","year":2025},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-06T15:33:05.211063Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.469257Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:253d938258c7b76b3982b648afe92f57c05b0aa6e12c3b7ce12da1a4dbb3f9ef","observation_id":"900d7c57-838a-4484-a067-9c545a703533","resolution":{"observed_at":"2026-08-06T15:40:09.949809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:09.473959Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-06T15:33:05.211063Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.473959Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:88c66ea7049671b176e90764e942de4cf6db93b68521f3492ae8bbed0a50d685","observation_id":"d6aa6f40-20ba-4b58-94f3-1292d36b9aab","resolution":{"observed_at":"2026-08-06T15:40:09.473959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:09.910551Z","title":"Ecapa-tdnn: Em- phasized channel attention, propagation and aggregation in tdnn based speaker verification,","venue":null,"work_id":"f9017207-e632-4fc8-8e03-c67b5d62c1bd","year":2020},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-06T15:33:05.211063Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.478541Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:369563fe1a71e21ccd7f5d1167b10df6b72880274df31a953abef015f7050716","observation_id":"81286334-2444-45bf-baeb-f40273a994ad","resolution":{"observed_at":"2026-08-06T15:40:09.916620Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:09.892508Z","title":"Wespeaker: A research and production oriented speaker embedding learning toolkit,","venue":null,"work_id":"2d89eaf4-9929-4060-a8d4-bec61f2651ad","year":2023},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-06T15:33:05.211063Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.483332Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:d083fd69a14e3c83e87ea48528e8c3abfbeb2e86411c71e562ff6f5fd542e523","observation_id":"f360c19f-93a5-4926-8a80-b8ebe629387f","resolution":{"observed_at":"2026-08-06T15:40:09.897397Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:09.488014Z","title":"Curriculum learning,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-06T15:33:05.211063Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.488014Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:b612a014456467703c5c228f74974311798862708678336c2449b71777e29c6c","observation_id":"a5e18d5e-3975-41f5-83d8-e7782d961065","resolution":{"observed_at":"2026-08-06T15:40:09.488014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:09.492392Z","title":"A learning algorithm for continually running fully recurrent neural networks,","venue":null,"work_id":null,"year":1989},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-06T15:33:05.211063Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.492392Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:f3be002460d4d1a67891de8a6e62bddf1624e2a5d391bdf35f24dd71233e8e17","observation_id":"c59cc09d-4efc-4930-8960-00e534280cab","resolution":{"observed_at":"2026-08-06T15:40:09.492392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:09.853328Z","title":"Scheduled sampling for sequence prediction with recurrent neural networks,","venue":null,"work_id":"62e3ac87-3768-4753-a16b-38e5d39710b7","year":2015},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-06T15:33:05.211063Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.497009Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:25e7ccc7f224696e451c73e98e71906cdb823ee7b3eb32cb28705c784dca0599","observation_id":"3b0191e3-e40d-42e9-88a2-1557279844d5","resolution":{"observed_at":"2026-08-06T15:40:09.858309Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:09.837219Z","title":"Delving into high-quality syn- thetic face occlusion segmentation datasets,","venue":null,"work_id":"3801c3e4-9f2e-4d06-98ad-70b451766a56","year":2022},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-06T15:33:05.211063Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.502291Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:7f34ce1c41fc4df8a9607472f4c4d7558944b0cc2f6274df4c930e6fea63b915","observation_id":"17078865-8ccd-4862-b091-1f5803386d60","resolution":{"observed_at":"2026-08-06T15:40:09.842492Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:09.818585Z","title":"Watch or listen: Robust audio-visual speech recognition with visual corruption modeling and reliability scoring,","venue":null,"work_id":"f9dee7f3-9a64-4352-9b64-35d4e2ef0d7b","year":2023},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-06T15:33:05.211063Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.506931Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:d20582add53abea12250c849cd972f557355a47cb5a2f7d6739e8a25ce229fd7","observation_id":"ac2c226e-f775-4761-9c08-30a9a67f8a2a","resolution":{"observed_at":"2026-08-06T15:40:09.825636Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:09.801074Z","title":"V oxceleb2: Deep speaker recognition,","venue":null,"work_id":"39c2a9f7-b971-464d-80a5-cf8e1c3e1c8e","year":2018},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-06T15:33:05.211063Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.511270Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:af1f6330aae15cf071f156bb7ff36c7aee0ec0e6b42407d26c97619aeee0b9bb","observation_id":"a38afe9a-a0f5-4d0f-b894-fb657b1d27c7","resolution":{"observed_at":"2026-08-06T15:40:09.806766Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:09.782165Z","title":"Avhumar: Audio-visual target speech extraction with pre-trained av-hubert and mask-and-recover strategy,","venue":null,"work_id":"0934fd4f-8bc6-432e-b38f-1c725745cf29","year":2024},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-06T15:33:05.211063Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.515654Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:ea83f8157e99fab5ee7d8c032539a4acf9802fb979fc4097445442dc1793b27a","observation_id":"60b84ecc-6bd7-4797-a666-4cc5be932f54","resolution":{"observed_at":"2026-08-06T15:40:09.787987Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:09.761612Z","title":"Target speech extraction with pre-trained av-hubert and mask-and-recover strategy,","venue":null,"work_id":"193c219a-e26c-4e60-9dbc-59232c6ebf48","year":2024},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-06T15:33:05.211063Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.521222Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:3883e891cfd11e8467968d10cbdd7a3f06708a4df7300bcd37a9440a3de6b528","observation_id":"7e5d0481-f3bb-42df-8a8c-4fe34c912811","resolution":{"observed_at":"2026-08-06T15:40:09.766513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:09.744856Z","title":"Sdr–half-baked or well done?","venue":null,"work_id":"599eba8d-f1d4-420d-b992-4dfa5d83e9fb","year":null},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-06T15:33:05.211063Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.525852Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:7a7c0896906ff2ac67428bf36a974bf268a043ccb756d9e34d7801a085ec2f52","observation_id":"89aae3a2-1857-492b-bb66-7adf0a6cd7da","resolution":{"observed_at":"2026-08-06T15:40:09.749611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:09.727808Z","title":"Perceptual evaluation of speech quality (pesq)-a new method for speech quality assessment of telephone networks and codecs,","venue":null,"work_id":"57dc7143-6c8b-49cb-a2ac-28a5208927b7","year":null},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-06T15:33:05.211063Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.530574Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:fb0a2c4b07bbefc52c889ad22fb29870c30fda150d5934f431d511e03aa47051","observation_id":"03e57a72-d5f5-46cf-8ff2-e8a5e8c6791b","resolution":{"observed_at":"2026-08-06T15:40:09.733522Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:09.707630Z","title":"A short- time objective intelligibility measure for time-frequency weighted noisy speech,","venue":null,"work_id":"f8dcb293-0975-47b3-97fa-73448fcc4637","year":null},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-06T15:33:05.211063Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.535064Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:0bf421495cb1f276eadc2cdf1ad9657e4279e03077c12d53e1a92a3de2fe16be","observation_id":"c9560885-5aa4-4169-8ffe-8241c468c3dd","resolution":{"observed_at":"2026-08-06T15:40:09.713313Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:09.686981Z","title":"Time domain audio visual speech separation,","venue":null,"work_id":"c6dc01c9-0343-4b9d-81a7-17fb4f4b3fca","year":2019},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-06T15:33:05.211063Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.540459Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:0b6c1478c80605237571f8dc7c2f765c7187e0880ebcc00d2ab46e5366a55b40","observation_id":"f1c2c8e9-7380-4dc0-aab9-0c7cabd69ed8","resolution":{"observed_at":"2026-08-06T15:40:09.693485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:09.545087Z","title":"Conv-tasnet: Surpassing ideal time–frequency magnitude masking for speech separation,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-06T15:33:05.211063Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.545087Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:97d98e298cdf69011d4133e63228886ac80dc6f371e241647c2d807ed1c15028","observation_id":"7cf1d4a5-6276-456f-9ad5-bdb419330ec7","resolution":{"observed_at":"2026-08-06T15:40:09.545087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:09.549514Z","title":"Music source separation with band-split rnn,","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-06T15:33:05.211063Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.549514Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:8679fdca82ef19bde48555762741bc0095db34b7d691729040d642f529eb5e00","observation_id":"4453c919-dd08-4af9-a213-2da60ed02d89","resolution":{"observed_at":"2026-08-06T15:40:09.549514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:09.644169Z","title":"Wesep: A scalable and flexible toolkit towards generalizable target speaker extraction,","venue":null,"work_id":"a9e83b6c-d050-4d02-85a3-6574811d8106","year":2024},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-06T15:33:05.211063Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.554592Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:6ac5a52a2d795d076637d6c46fb608377453a81f055d5ad04ad5ead0f9cc1397","observation_id":"88f831c1-baf9-4a3f-9125-e6d48eb7bc4d","resolution":{"observed_at":"2026-08-06T15:40:09.648914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:09.624269Z","title":"Audio-visual target speaker extraction with selective auditory attention,","venue":null,"work_id":"536b4d44-09bc-4dde-853a-4c5362e8d917","year":2025},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-06T15:33:05.211063Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.559373Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:0edf217205337a4053321a54cd8a07a9cbf8350e07c79905e7937364dbc89c17","observation_id":"8e34c688-aeea-432b-b1fc-c5cc47cd47d5","resolution":{"observed_at":"2026-08-06T15:40:09.631585Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:09.564250Z","title":"Attention is all you need in speech separation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-06T15:33:05.211063Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.564250Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:8c2455dfa714b5b00b22e18b8b70d32f2b98ed725e0dcf51daf780f418f78af4","observation_id":"aa5cd0ee-cf22-4bee-8798-2d7dd572e36e","resolution":{"observed_at":"2026-08-06T15:40:09.564250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","latest_version":2,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-06T15:33:05.211063Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions"},"reference_resolution":{"displayed":82,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":10,"verified_exact":0,"verified_fuzzy":72},"total_outbound_references":82},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 82 of 82 outbound references and 1 inbound Pith citation observation for arXiv:2507.15294."}