{"as_of":"2026-08-07T21:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:aa901485568931839f918b3cbc00a34565fe4495c9495000e36de744348f5c15","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:08:17.836014Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:41:16.865462Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T18:41:18.737055Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.00466","last_updated":"2025-05-31T08:33:57Z","snapshot_observed_at":"2026-08-07T12:02:18.638691Z","submitted_at":"2025-05-31T08:33:57Z","title":"M3ANet: Multi-scale and Multi-Modal Alignment Network for Brain-Assisted Target Speaker Extraction","version":1},"cited_work":{"arxiv_id":"2506.00466","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.00466","snapshot_observed_at":"2026-08-06T18:41:18.737055Z","title":"M3ANet: Multi-scale and Multi-Modal Alignment Network for Brain-Assisted Target Speaker Extraction","venue":"eess.AS","work_id":"86ba7c4d-69fc-44ed-ba56-a0ecb583846f","year":2025},"citing_paper":{"arxiv_id":"2507.07526","last_updated":"2025-08-11T07:29:51Z","snapshot_observed_at":"2026-08-06T18:36:14.630896Z","submitted_at":"2025-07-10T08:15:03Z","title":"DMF2Mel: A Dynamic Multiscale Fusion Network for EEG-Driven Mel Spectrogram Reconstruction","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T18:41:16.865462Z"},"links":{"cited_paper":"/paper/2506.00466","citing_paper":"/paper/2507.07526"},"observation_digest":"sha256:de8e0bd6987fbc2ae4d11de8b4beb74e857be9b85b9caf7e5443cdeeeae64f9c","observation_id":"8de67a4d-dd98-4d1f-9a7e-c8cfb58efa2a","resolution":{"observed_at":"2026-08-06T18:41:18.762933Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00466","last_updated":"2025-05-31T08:33:57Z","snapshot_observed_at":"2026-08-07T12:02:18.638691Z","submitted_at":"2025-05-31T08:33:57Z","title":"M3ANet: Multi-scale and Multi-Modal Alignment Network for Brain-Assisted Target Speaker Extraction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00466","snapshot_observed_at":"2026-08-03T07:24:44.110448Z","title":"M3ANet: Multi-scale and Multi- Modal Alignment Network for Brain-Assisted Target Speaker Ex- traction,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.20542","last_updated":"2026-05-23T03:34:27Z","snapshot_observed_at":"2026-08-03T07:24:42.414429Z","submitted_at":"2026-01-28T12:37:20Z","title":"Decoding Speech Envelopes from Electroencephalogram with a Contrastive Pearson Correlation Coefficient Loss","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T07:24:44.110448Z"},"links":{"cited_paper":"/paper/2506.00466","citing_paper":"/paper/2601.20542"},"observation_digest":"sha256:af191fea5c5f8ab59f7f8216afa8334dd5a1255150e8d2d5abd9a318674cfc36","observation_id":"36a42793-abee-433f-8157-6c307e1077df","resolution":{"observed_at":"2026-08-03T07:24:44.110448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.00466/citation-record","integrity":"/paper/2506.00466/integrity","json":"/paper/2506.00466/citation-record.json","paper":"/paper/2506.00466"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:24.506979Z","title":"Electrophysiological correlates of semantic dissimilarity reflect the comprehension of natural, narra- tive speech.Current Biology, 28(5):803–809,","venue":null,"work_id":"6c782b97-7cb2-4f8c-8e32-07a83f69cefd","year":2018},"citing_paper":{"arxiv_id":"2506.00466","last_updated":"2025-05-31T08:33:57Z","snapshot_observed_at":"2026-08-07T12:02:18.638691Z","submitted_at":"2025-05-31T08:33:57Z","title":"M3ANet: Multi-scale and Multi-Modal Alignment Network for Brain-Assisted Target Speaker Extraction","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:14.230964Z"},"links":{"citing_paper":"/paper/2506.00466"},"observation_digest":"sha256:4d67999e93dcb804ec738078df3440a4ff96100af8c79053d26ce2a729a0dbea","observation_id":"bc195b6e-d5d0-4f63-a9d0-04ac866c9326","resolution":{"observed_at":"2026-08-07T12:08:24.666999Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01673","last_updated":"2025-01-03T07:27:51Z","snapshot_observed_at":"2026-08-03T14:49:01.060706Z","submitted_at":"2025-01-03T07:27:51Z","title":"Improved Feature Extraction Network for Neuro-Oriented Target Speaker Extraction","version":1},"cited_work":{"arxiv_id":"2501.01673","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.01673","snapshot_observed_at":"2026-08-07T12:08:18.058919Z","title":"Improved Feature Extraction Network for Neuro-Oriented Target Speaker Extraction","venue":"cs.SD","work_id":"86cd8fc5-4ca6-429e-a339-0420581869cb","year":2025},"citing_paper":{"arxiv_id":"2506.00466","last_updated":"2025-05-31T08:33:57Z","snapshot_observed_at":"2026-08-07T12:02:18.638691Z","submitted_at":"2025-05-31T08:33:57Z","title":"M3ANet: Multi-scale and Multi-Modal Alignment Network for Brain-Assisted Target Speaker Extraction","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:14.691413Z"},"links":{"cited_paper":"/paper/2501.01673","citing_paper":"/paper/2506.00466"},"observation_digest":"sha256:448fde63353c3848f1b44532deb0343c23aae4a9092b5588f6fc7430d8d01e20","observation_id":"8f307be1-86c4-49ac-8956-6f9759ca9460","resolution":{"observed_at":"2026-08-07T12:08:18.114926Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:23.657822Z","title":"L-spex: Localized target speaker extraction","venue":null,"work_id":"8419301d-cd53-4de5-bcad-978ecf8d0ad6","year":2022},"citing_paper":{"arxiv_id":"2506.00466","last_updated":"2025-05-31T08:33:57Z","snapshot_observed_at":"2026-08-07T12:02:18.638691Z","submitted_at":"2025-05-31T08:33:57Z","title":"M3ANet: Multi-scale and Multi-Modal Alignment Network for Brain-Assisted Target Speaker Extraction","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:14.922931Z"},"links":{"citing_paper":"/paper/2506.00466"},"observation_digest":"sha256:409e455f8aa3d6a9190f78e6864fe60d3f1d45cfea5552791723cc220f62c766","observation_id":"13523b52-39f6-431a-b171-19ca9d351e34","resolution":{"observed_at":"2026-08-07T12:08:23.756034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:22.731889Z","title":"The cocktail party problem.Neural computation, 17(9):1875– 1902,","venue":null,"work_id":"aa494a80-80c5-4ef8-a51d-5f40c887278d","year":2005},"citing_paper":{"arxiv_id":"2506.00466","last_updated":"2025-05-31T08:33:57Z","snapshot_observed_at":"2026-08-07T12:02:18.638691Z","submitted_at":"2025-05-31T08:33:57Z","title":"M3ANet: Multi-scale and Multi-Modal Alignment Network for Brain-Assisted Target Speaker Extraction","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:15.321264Z"},"links":{"citing_paper":"/paper/2506.00466"},"observation_digest":"sha256:5f928816a3ba7e22987b80a39d10d80b8862d23b1478836b229188278e91cdf2","observation_id":"e2974a40-42d1-4de0-8110-e608a5038a5f","resolution":{"observed_at":"2026-08-07T12:08:22.856502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:22.353195Z","title":"Speaker-independent brain enhanced speech denoising","venue":null,"work_id":"6f4d6828-6da9-4a87-bef5-07fa5d58ad1e","year":2021},"citing_paper":{"arxiv_id":"2506.00466","last_updated":"2025-05-31T08:33:57Z","snapshot_observed_at":"2026-08-07T12:02:18.638691Z","submitted_at":"2025-05-31T08:33:57Z","title":"M3ANet: Multi-scale and Multi-Modal Alignment Network for Brain-Assisted Target Speaker Extraction","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:15.542157Z"},"links":{"citing_paper":"/paper/2506.00466"},"observation_digest":"sha256:045d8eff1970f4b98e3069a88ed050a9ba2dbc835c82122cc7d19914a07ee001","observation_id":"df764bc2-ffa9-4846-8928-5a6b8931a09f","resolution":{"observed_at":"2026-08-07T12:08:22.420567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:21.841483Z","title":"Cross-modal global interaction and local alignment for audio-visual speech recognition","venue":null,"work_id":"34879e3a-acef-4d22-8596-59759010b4bb","year":2023},"citing_paper":{"arxiv_id":"2506.00466","last_updated":"2025-05-31T08:33:57Z","snapshot_observed_at":"2026-08-07T12:02:18.638691Z","submitted_at":"2025-05-31T08:33:57Z","title":"M3ANet: Multi-scale and Multi-Modal Alignment Network for Brain-Assisted Target Speaker Extraction","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:15.738422Z"},"links":{"citing_paper":"/paper/2506.00466"},"observation_digest":"sha256:caf2e3bb90d4a4919a79272e7ea0bf69f163ed720915289950703d6dbe192c98","observation_id":"3c2dcafd-2de0-422b-af07-0b1cda3acfb3","resolution":{"observed_at":"2026-08-07T12:08:22.007943Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:21.659181Z","title":"[Le Rouxet al., 2019 ] Jonathan Le Roux, Scott Wisdom, Hakan Erdogan, and John R Hershey","venue":null,"work_id":"3dd21fc0-f1d1-4404-9e9e-a7bf03393969","year":2019},"citing_paper":{"arxiv_id":"2506.00466","last_updated":"2025-05-31T08:33:57Z","snapshot_observed_at":"2026-08-07T12:02:18.638691Z","submitted_at":"2025-05-31T08:33:57Z","title":"M3ANet: Multi-scale and Multi-Modal Alignment Network for Brain-Assisted Target Speaker Extraction","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:15.828302Z"},"links":{"citing_paper":"/paper/2506.00466"},"observation_digest":"sha256:31427f4ba6359c9516186adfc09a69d0173c35f8a239a4f9be4f55c3194cd24f","observation_id":"5fa6fbf7-6719-4168-b5c3-cc96e9102fa3","resolution":{"observed_at":"2026-08-07T12:08:21.729131Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:15.910755Z","title":"Align before fuse: Vision and language representation learning with momentum distilla- tion.Advances in neural information processing systems, 34:9694–9705,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.00466","last_updated":"2025-05-31T08:33:57Z","snapshot_observed_at":"2026-08-07T12:02:18.638691Z","submitted_at":"2025-05-31T08:33:57Z","title":"M3ANet: Multi-scale and Multi-Modal Alignment Network for Brain-Assisted Target Speaker Extraction","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:15.910755Z"},"links":{"citing_paper":"/paper/2506.00466"},"observation_digest":"sha256:7a5a459ab578a09a511c644f242a29118177ba173cc4dd4eb51d8ee49c527584","observation_id":"efeb095b-13d3-4666-b5b3-3425874acfd2","resolution":{"observed_at":"2026-08-07T12:08:15.910755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:21.332688Z","title":"Audio-visual active speaker extraction for sparsely overlapped multi-talker speech","venue":null,"work_id":"fa53a02e-2ae8-45c0-b27f-4986df1de006","year":2024},"citing_paper":{"arxiv_id":"2506.00466","last_updated":"2025-05-31T08:33:57Z","snapshot_observed_at":"2026-08-07T12:02:18.638691Z","submitted_at":"2025-05-31T08:33:57Z","title":"M3ANet: Multi-scale and Multi-Modal Alignment Network for Brain-Assisted Target Speaker Extraction","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:16.002599Z"},"links":{"citing_paper":"/paper/2506.00466"},"observation_digest":"sha256:2fff7d0ead03d686c1f9a43ce7190e00c9e7d4d2f847cd9f4d44c60637f3dfb7","observation_id":"2efd5f25-00e7-4d3f-8874-eb720ed719a3","resolution":{"observed_at":"2026-08-07T12:08:21.476889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:21.112220Z","title":"Av- sepformer: Cross-attention sepformer for audio-visual tar- get speaker extraction","venue":null,"work_id":"61d67dff-3c29-4513-8731-de963156dca8","year":2023},"citing_paper":{"arxiv_id":"2506.00466","last_updated":"2025-05-31T08:33:57Z","snapshot_observed_at":"2026-08-07T12:02:18.638691Z","submitted_at":"2025-05-31T08:33:57Z","title":"M3ANet: Multi-scale and Multi-Modal Alignment Network for Brain-Assisted Target Speaker Extraction","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:16.099123Z"},"links":{"citing_paper":"/paper/2506.00466"},"observation_digest":"sha256:ebb6da808419ace0c88b239124374c062e67bbcdc2e44f624e8cce13362f8c06","observation_id":"51088153-38b9-44cf-9d43-d86685d3973a","resolution":{"observed_at":"2026-08-07T12:08:21.207261Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:20.917128Z","title":"Development of the audi- tory system.Handbook of clinical neurology, 129:55–72,","venue":null,"work_id":"64e5deca-175b-4183-81ef-5010c6e9f510","year":2015},"citing_paper":{"arxiv_id":"2506.00466","last_updated":"2025-05-31T08:33:57Z","snapshot_observed_at":"2026-08-07T12:02:18.638691Z","submitted_at":"2025-05-31T08:33:57Z","title":"M3ANet: Multi-scale and Multi-Modal Alignment Network for Brain-Assisted Target Speaker Extraction","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:16.177957Z"},"links":{"citing_paper":"/paper/2506.00466"},"observation_digest":"sha256:569a7adecbe33a1094c58d5691e0d38bd3663c61de36280961949d7d5146cc61","observation_id":"bafb6e57-f5e0-45ae-8f6c-cb2825084cc9","resolution":{"observed_at":"2026-08-07T12:08:20.995877Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:20.514306Z","title":"Dual-path rnn: efficient long sequence modeling for time-domain single-channel speech separation","venue":null,"work_id":"2ebf6a3b-e78d-4043-92f1-bec39c5d6b43","year":2020},"citing_paper":{"arxiv_id":"2506.00466","last_updated":"2025-05-31T08:33:57Z","snapshot_observed_at":"2026-08-07T12:02:18.638691Z","submitted_at":"2025-05-31T08:33:57Z","title":"M3ANet: Multi-scale and Multi-Modal Alignment Network for Brain-Assisted Target Speaker Extraction","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:16.365027Z"},"links":{"citing_paper":"/paper/2506.00466"},"observation_digest":"sha256:d28e349a0508dcee99b213b342ebe6a4f740f7814b47c65da07da9d52da555f1","observation_id":"5bd4c207-95ca-4561-bd42-5119b2fd12e1","resolution":{"observed_at":"2026-08-07T12:08:20.631601Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:20.330478Z","title":"Dbpnet: Dual- branch parallel network with temporal-frequency fusion for auditory attention detection","venue":null,"work_id":"b8de22c2-6819-4f43-9c58-e64263b372c8","year":2024},"citing_paper":{"arxiv_id":"2506.00466","last_updated":"2025-05-31T08:33:57Z","snapshot_observed_at":"2026-08-07T12:02:18.638691Z","submitted_at":"2025-05-31T08:33:57Z","title":"M3ANet: Multi-scale and Multi-Modal Alignment Network for Brain-Assisted Target Speaker Extraction","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:16.461928Z"},"links":{"citing_paper":"/paper/2506.00466"},"observation_digest":"sha256:d39725cbb0179668dbfe909babb6f59cbbf3472ef3ab6f51668fc83b011fb989","observation_id":"1556424d-5a68-4f54-a3d0-172c329858fa","resolution":{"observed_at":"2026-08-07T12:08:20.412865Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:20.142787Z","title":"Attentional selection in a cocktail party environment can be decoded from single- trial eeg.Cerebral cortex, 25(7):1697–1706,","venue":null,"work_id":"907dea6a-af83-46ce-97ee-38b1f46fc4bb","year":2015},"citing_paper":{"arxiv_id":"2506.00466","last_updated":"2025-05-31T08:33:57Z","snapshot_observed_at":"2026-08-07T12:02:18.638691Z","submitted_at":"2025-05-31T08:33:57Z","title":"M3ANet: Multi-scale and Multi-Modal Alignment Network for Brain-Assisted Target Speaker Extraction","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:16.586298Z"},"links":{"citing_paper":"/paper/2506.00466"},"observation_digest":"sha256:7c71f78ecda2dd6cd0fc5c897d8f8e0662d2edea7ad3deac25149516caa9e57d","observation_id":"37e4535f-4d26-4e5c-9eeb-a1b405a74090","resolution":{"observed_at":"2026-08-07T12:08:20.240052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:19.965493Z","title":"Neural decoding of at- tentional selection in multi-speaker environments without access to clean sources.Journal of neural engineering, 14(5):056001,","venue":null,"work_id":"795985e2-3a99-4f2b-a94c-329f3dce84a8","year":2017},"citing_paper":{"arxiv_id":"2506.00466","last_updated":"2025-05-31T08:33:57Z","snapshot_observed_at":"2026-08-07T12:02:18.638691Z","submitted_at":"2025-05-31T08:33:57Z","title":"M3ANet: Multi-scale and Multi-Modal Alignment Network for Brain-Assisted Target Speaker Extraction","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:16.677988Z"},"links":{"citing_paper":"/paper/2506.00466"},"observation_digest":"sha256:ce6cebf5fc1a87d5e67a738d897c1c5be235ba5f31b0c017de5ae034f3fd733f","observation_id":"6046fe9f-d1f6-4977-8a76-b8d3c9047317","resolution":{"observed_at":"2026-08-07T12:08:20.058858Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:19.787811Z","title":"Neu- roheed+: Improving neuro-steered speaker extraction with joint auditory attention detection","venue":null,"work_id":"cc5b9b6a-9fc4-4e96-abdd-448fb18065fb","year":2024},"citing_paper":{"arxiv_id":"2506.00466","last_updated":"2025-05-31T08:33:57Z","snapshot_observed_at":"2026-08-07T12:02:18.638691Z","submitted_at":"2025-05-31T08:33:57Z","title":"M3ANet: Multi-scale and Multi-Modal Alignment Network for Brain-Assisted Target Speaker Extraction","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:16.758386Z"},"links":{"citing_paper":"/paper/2506.00466"},"observation_digest":"sha256:3ccf52ca5ab57d0ea0d6dad7bff2b0e912c0c716e33ba056913a20e0a8757c24","observation_id":"b3e6997e-0ba2-4970-ac42-73566d32e77a","resolution":{"observed_at":"2026-08-07T12:08:19.870687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:19.597400Z","title":"Tf-nsse: A time–frequency domain neuro-steered speaker extractor.Applied Acous- tics, 211:109519,","venue":null,"work_id":"226cbc79-8866-4432-8cde-5497d3eb7a38","year":2023},"citing_paper":{"arxiv_id":"2506.00466","last_updated":"2025-05-31T08:33:57Z","snapshot_observed_at":"2026-08-07T12:02:18.638691Z","submitted_at":"2025-05-31T08:33:57Z","title":"M3ANet: Multi-scale and Multi-Modal Alignment Network for Brain-Assisted Target Speaker Extraction","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:16.857130Z"},"links":{"citing_paper":"/paper/2506.00466"},"observation_digest":"sha256:06f8128e64b2f5fd2e0ce0c034f9ef366f751a95ffc895dae5329c15a091c412","observation_id":"20c99bcf-0126-4174-a528-1a75a08b5db6","resolution":{"observed_at":"2026-08-07T12:08:19.706750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:19.381334Z","title":"Phase space graph convolutional network for chaotic time series learning.IEEE Transactions on Industrial Informat- ics,","venue":null,"work_id":"6346382b-d19c-4361-8112-a6fe4e003635","year":2024},"citing_paper":{"arxiv_id":"2506.00466","last_updated":"2025-05-31T08:33:57Z","snapshot_observed_at":"2026-08-07T12:02:18.638691Z","submitted_at":"2025-05-31T08:33:57Z","title":"M3ANet: Multi-scale and Multi-Modal Alignment Network for Brain-Assisted Target Speaker Extraction","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:16.950800Z"},"links":{"citing_paper":"/paper/2506.00466"},"observation_digest":"sha256:0aa815ffeeffb96e63068acaca4d60226039181f9b8cde2d1692f0dfd736be64","observation_id":"6acfd61d-a7aa-40dc-a6c3-b881a3eb6a0e","resolution":{"observed_at":"2026-08-07T12:08:19.492949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:19.218615Z","title":"Perceptual evaluation of speech quality (pesq)-a new method for speech quality assessment of telephone networks and codecs","venue":null,"work_id":"6ea8c25d-a95b-4730-9be9-f4e9f5d6dd5a","year":2001},"citing_paper":{"arxiv_id":"2506.00466","last_updated":"2025-05-31T08:33:57Z","snapshot_observed_at":"2026-08-07T12:02:18.638691Z","submitted_at":"2025-05-31T08:33:57Z","title":"M3ANet: Multi-scale and Multi-Modal Alignment Network for Brain-Assisted Target Speaker Extraction","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:17.035539Z"},"links":{"citing_paper":"/paper/2506.00466"},"observation_digest":"sha256:49617777c7248082d43f04cd836f49092aa75301a250219656bb64076c0c77e3","observation_id":"4beca81b-dc3b-475c-aa27-943dd8141bc5","resolution":{"observed_at":"2026-08-07T12:08:19.286102Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:19.053600Z","title":"An algorithm for intelligibil- ity prediction of time–frequency weighted noisy speech","venue":null,"work_id":"f353bcee-72d6-4506-9ad0-0b953dfeb399","year":2011},"citing_paper":{"arxiv_id":"2506.00466","last_updated":"2025-05-31T08:33:57Z","snapshot_observed_at":"2026-08-07T12:02:18.638691Z","submitted_at":"2025-05-31T08:33:57Z","title":"M3ANet: Multi-scale and Multi-Modal Alignment Network for Brain-Assisted Target Speaker Extraction","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:17.277497Z"},"links":{"citing_paper":"/paper/2506.00466"},"observation_digest":"sha256:27dab63022348c095c22ae9d7ac6fc501a747b57ed1d6cbb88be77dd78beb16e","observation_id":"8e2a4f39-bf0f-4ec0-ae23-f64f8f361103","resolution":{"observed_at":"2026-08-07T12:08:19.136099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:18.886567Z","title":"A study of multichannel spatiotemporal features and knowledge distillation on robust target speaker extraction","venue":null,"work_id":"7ddf0daf-ebf7-4079-ae7c-6ac58082e14f","year":2024},"citing_paper":{"arxiv_id":"2506.00466","last_updated":"2025-05-31T08:33:57Z","snapshot_observed_at":"2026-08-07T12:02:18.638691Z","submitted_at":"2025-05-31T08:33:57Z","title":"M3ANet: Multi-scale and Multi-Modal Alignment Network for Brain-Assisted Target Speaker Extraction","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:17.447655Z"},"links":{"citing_paper":"/paper/2506.00466"},"observation_digest":"sha256:cbecfdcc4bac4992ee5e75d0c4bc2fa8c682479a837ca1d2e83dcc75b17ebc2b","observation_id":"3cb4f928-39ea-4f02-acbd-1f4a5fbd31e0","resolution":{"observed_at":"2026-08-07T12:08:18.950548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:18.767146Z","title":"Spex: Multi-scale time domain speaker extraction network.IEEE/ACM transactions on audio, speech, and language processing, 28:1370–1384,","venue":null,"work_id":"c9c4624c-b8ed-468a-9ee8-480c918ec0fb","year":2020},"citing_paper":{"arxiv_id":"2506.00466","last_updated":"2025-05-31T08:33:57Z","snapshot_observed_at":"2026-08-07T12:02:18.638691Z","submitted_at":"2025-05-31T08:33:57Z","title":"M3ANet: Multi-scale and Multi-Modal Alignment Network for Brain-Assisted Target Speaker Extraction","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:17.503332Z"},"links":{"citing_paper":"/paper/2506.00466"},"observation_digest":"sha256:3d93f81bcced4eeb88b7520f5c4d9c37ff3ac0c3e1c5860b08a18fc5a779c4f3","observation_id":"ff249c62-b548-44b8-aa3d-a2595cb51d0a","resolution":{"observed_at":"2026-08-07T12:08:18.820826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11181","last_updated":"2024-11-18T16:25:53Z","snapshot_observed_at":"2026-07-06T19:33:34.819837Z","submitted_at":"2024-10-15T01:51:29Z","title":"DARNet: Dual Attention Refinement Network with Spatiotemporal Construction for Auditory Attention Detection","version":2},"cited_work":{"arxiv_id":"2410.11181","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.11181","snapshot_observed_at":"2026-08-07T12:08:17.928333Z","title":"DARNet: Dual Attention Refinement Network with Spatiotemporal Construction for Auditory Attention Detection","venue":"eess.AS","work_id":"c7356eb0-3296-48b1-bfa1-38c4a06274fb","year":2024},"citing_paper":{"arxiv_id":"2506.00466","last_updated":"2025-05-31T08:33:57Z","snapshot_observed_at":"2026-08-07T12:02:18.638691Z","submitted_at":"2025-05-31T08:33:57Z","title":"M3ANet: Multi-scale and Multi-Modal Alignment Network for Brain-Assisted Target Speaker Extraction","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:17.613996Z"},"links":{"cited_paper":"/paper/2410.11181","citing_paper":"/paper/2506.00466"},"observation_digest":"sha256:a1213308b4f7301628bf5f4ec5c08f19505581081771f820f1d23bd88cdf6dcc","observation_id":"3ad76a10-e7c1-4e4d-8d48-72455b9e78c3","resolution":{"observed_at":"2026-08-07T12:08:17.955113Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:18.638209Z","title":"Basen: Time-domain brain-assisted speech enhancement network with convolutional cross at- tention in multi-talker conditions.Interspeech 2023,","venue":null,"work_id":"0c14d44b-c5ed-411c-a6f9-5d0c3c26845d","year":2023},"citing_paper":{"arxiv_id":"2506.00466","last_updated":"2025-05-31T08:33:57Z","snapshot_observed_at":"2026-08-07T12:02:18.638691Z","submitted_at":"2025-05-31T08:33:57Z","title":"M3ANet: Multi-scale and Multi-Modal Alignment Network for Brain-Assisted Target Speaker Extraction","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:17.692399Z"},"links":{"citing_paper":"/paper/2506.00466"},"observation_digest":"sha256:bdb65d85388c05dc99a2e969acc1481982226c0fe4698f7d0db122c5b76c2203","observation_id":"bc8e5ec2-d71f-41e9-8950-eb2003d6de73","resolution":{"observed_at":"2026-08-07T12:08:18.705495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:18.495126Z","title":"Based on audio-video evoked auditory attention detection electroencephalogram dataset.Journal of Tsinghua University (Science and Tech- nology), 64(11):1919–1926,","venue":null,"work_id":"c7720a55-d2b7-4e9f-823e-f620f1ab0a94","year":2024},"citing_paper":{"arxiv_id":"2506.00466","last_updated":"2025-05-31T08:33:57Z","snapshot_observed_at":"2026-08-07T12:02:18.638691Z","submitted_at":"2025-05-31T08:33:57Z","title":"M3ANet: Multi-scale and Multi-Modal Alignment Network for Brain-Assisted Target Speaker Extraction","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:17.749495Z"},"links":{"citing_paper":"/paper/2506.00466"},"observation_digest":"sha256:b96f01742b6754caa270e4d1786ebbaad22355e84d0cabe9692707c36669011b","observation_id":"4c96733a-00b6-4f10-8b93-6354c97f32d8","resolution":{"observed_at":"2026-08-07T12:08:18.568754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:18.335744Z","title":"Neural target speech extraction: An overview.IEEE Signal Processing Magazine, 40(3):8–29, 2023","venue":null,"work_id":"5a66c495-5fde-4990-b366-94e900554e96","year":2023},"citing_paper":{"arxiv_id":"2506.00466","last_updated":"2025-05-31T08:33:57Z","snapshot_observed_at":"2026-08-07T12:02:18.638691Z","submitted_at":"2025-05-31T08:33:57Z","title":"M3ANet: Multi-scale and Multi-Modal Alignment Network for Brain-Assisted Target Speaker Extraction","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:17.836014Z"},"links":{"citing_paper":"/paper/2506.00466"},"observation_digest":"sha256:982057ae2e82611d46b5a4fddb3edf7a0c6f6de0a74a7a12b1bf78ae1fce88e4","observation_id":"54d544ed-48a9-4f5b-b627-dfc15aff88a2","resolution":{"observed_at":"2026-08-07T12:08:18.404454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.13772","last_updated":"2025-03-28T23:38:22Z","snapshot_observed_at":"2026-08-04T21:17:03.297277Z","submitted_at":"2024-07-18T17:59:58Z","title":"GroupMamba: Efficient Group-Based Visual State Space Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.13772","snapshot_observed_at":"2026-08-07T12:08:17.151270Z","title":"Groupmamba: Parameter-efficient and accu- rate group visual state space model.arXiv preprint arXiv:2407.13772,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00466","last_updated":"2025-05-31T08:33:57Z","snapshot_observed_at":"2026-08-07T12:02:18.638691Z","submitted_at":"2025-05-31T08:33:57Z","title":"M3ANet: Multi-scale and Multi-Modal Alignment Network for Brain-Assisted Target Speaker Extraction","version":1},"reference_index":2001,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:17.151270Z"},"links":{"cited_paper":"/paper/2407.13772","citing_paper":"/paper/2506.00466"},"observation_digest":"sha256:5baa92f03a37b492c9c9382d85797ba2c3d200aa665df0d2369335d594bc866b","observation_id":"cb6d813a-1da5-4dd1-82c2-343b6f83e2c9","resolution":{"observed_at":"2026-08-07T12:08:17.151270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:22.524139Z","title":"Centroid estimation with transformer-based speaker embedder for robust target speaker extraction","venue":null,"work_id":"d513941c-9c80-4965-90b4-823ae425f99c","year":2024},"citing_paper":{"arxiv_id":"2506.00466","last_updated":"2025-05-31T08:33:57Z","snapshot_observed_at":"2026-08-07T12:02:18.638691Z","submitted_at":"2025-05-31T08:33:57Z","title":"M3ANet: Multi-scale and Multi-Modal Alignment Network for Brain-Assisted Target Speaker Extraction","version":1},"reference_index":2005,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:15.440078Z"},"links":{"citing_paper":"/paper/2506.00466"},"observation_digest":"sha256:79aedb6b76d0b406d6c97b652f3807de3c9e90add233969abbcd4fbde7150746","observation_id":"c4fc0c39-1540-4c36-83cd-f0c5369100b8","resolution":{"observed_at":"2026-08-07T12:08:22.610268Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:19.029549Z","title":"Speech intelligibility predicted from neural entrainment of the speech envelope.Journal of the Association for Re- search in Otolaryngology, 19:181–191,","venue":null,"work_id":"060b59d5-441a-4ca8-861c-1d59eaa0651e","year":2018},"citing_paper":{"arxiv_id":"2506.00466","last_updated":"2025-05-31T08:33:57Z","snapshot_observed_at":"2026-08-07T12:02:18.638691Z","submitted_at":"2025-05-31T08:33:57Z","title":"M3ANet: Multi-scale and Multi-Modal Alignment Network for Brain-Assisted Target Speaker Extraction","version":1},"reference_index":2011,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:17.369243Z"},"links":{"citing_paper":"/paper/2506.00466"},"observation_digest":"sha256:41a89068edc4b4fc94ba5190a7388f89961c25f87090f9a64be23b2e99815d03","observation_id":"cc40db08-4309-4add-a24d-7547d36f37ff","resolution":{"observed_at":"2026-08-07T12:08:19.047429Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:20.715000Z","title":"Conv-tasnet: Surpassing ideal time–frequency magnitude masking for speech separation.IEEE/ACM transactions on audio, speech, and language processing, 27(8):1256– 1266,","venue":null,"work_id":"5ed129c1-4216-4114-b2dd-5346ec13d408","year":2019},"citing_paper":{"arxiv_id":"2506.00466","last_updated":"2025-05-31T08:33:57Z","snapshot_observed_at":"2026-08-07T12:02:18.638691Z","submitted_at":"2025-05-31T08:33:57Z","title":"M3ANet: Multi-scale and Multi-Modal Alignment Network for Brain-Assisted Target Speaker Extraction","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:16.284920Z"},"links":{"citing_paper":"/paper/2506.00466"},"observation_digest":"sha256:4b5db07da93f1033ad2cffba534a90f23c1aca5ffbf07be192128282453ae3f6","observation_id":"187771db-3a3e-4b65-a4cd-ec87fac5dad5","resolution":{"observed_at":"2026-08-07T12:08:20.818684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:24.207973Z","title":"Brain-informed speech separation (biss) for enhancement of target speaker in multitalker speech perception.NeuroImage, 223:117282,","venue":null,"work_id":"dfe19f98-eeb4-447c-83ee-c06a59750d88","year":2020},"citing_paper":{"arxiv_id":"2506.00466","last_updated":"2025-05-31T08:33:57Z","snapshot_observed_at":"2026-08-07T12:02:18.638691Z","submitted_at":"2025-05-31T08:33:57Z","title":"M3ANet: Multi-scale and Multi-Modal Alignment Network for Brain-Assisted Target Speaker Extraction","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:14.335409Z"},"links":{"citing_paper":"/paper/2506.00466"},"observation_digest":"sha256:2d633841291b0e3fc903b2b93c82a76ccf67f0a99f2bc51c254a060f353a5956","observation_id":"493b7a6c-6905-47f2-88dd-dccd89182d9c","resolution":{"observed_at":"2026-08-07T12:08:24.313507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07284","last_updated":"2024-10-07T06:54:30Z","snapshot_observed_at":"2026-07-06T16:31:03.559653Z","submitted_at":"2023-10-11T08:17:54Z","title":"Typing to Listen at the Cocktail Party: Text-Guided Target Speaker Extraction","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07284","snapshot_observed_at":"2026-08-07T12:08:15.107005Z","title":"Typing to listen at the cocktail party: Text-guided target speaker extraction","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00466","last_updated":"2025-05-31T08:33:57Z","snapshot_observed_at":"2026-08-07T12:02:18.638691Z","submitted_at":"2025-05-31T08:33:57Z","title":"M3ANet: Multi-scale and Multi-Modal Alignment Network for Brain-Assisted Target Speaker Extraction","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:15.107005Z"},"links":{"cited_paper":"/paper/2310.07284","citing_paper":"/paper/2506.00466"},"observation_digest":"sha256:7d4a28a21da280c43295cbedd513d386ad6b08773abab8c51cf7d73b0bd57c78","observation_id":"d0c08969-5790-4ea4-b3f3-29de1790de9c","resolution":{"observed_at":"2026-08-07T12:08:15.107005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02489","last_updated":"2024-09-16T06:35:07Z","snapshot_observed_at":"2026-08-07T15:59:26.568097Z","submitted_at":"2024-09-04T07:33:01Z","title":"NeuroSpex: Neuro-Guided Speaker Extraction with Cross-Modal Attention","version":2},"cited_work":{"arxiv_id":"2409.02489","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.02489","snapshot_observed_at":"2026-08-07T12:08:18.180099Z","title":"NeuroSpex: Neuro-Guided Speaker Extraction with Cross-Modal Attention","venue":"cs.SD","work_id":"384ca7e0-b2ee-4853-8e47-16b71b1f8c4e","year":2024},"citing_paper":{"arxiv_id":"2506.00466","last_updated":"2025-05-31T08:33:57Z","snapshot_observed_at":"2026-08-07T12:02:18.638691Z","submitted_at":"2025-05-31T08:33:57Z","title":"M3ANet: Multi-scale and Multi-Modal Alignment Network for Brain-Assisted Target Speaker Extraction","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:14.465323Z"},"links":{"cited_paper":"/paper/2409.02489","citing_paper":"/paper/2506.00466"},"observation_digest":"sha256:8f520574d257d4ccd55281f323081d5350d9d0b9c500706d7fa1e02e4a2018e2","observation_id":"0cd41983-8063-42d2-adc1-94a39ac04e1c","resolution":{"observed_at":"2026-08-07T12:08:18.245325Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:22.110190Z","title":"End-to-end brain-driven speech enhance- ment in multi-talker conditions.IEEE/ACM Transactions on Audio, Speech, and Language Processing, 30:1718– 1733,","venue":null,"work_id":"3f760925-e368-48b0-bd2e-dda389262e24","year":2022},"citing_paper":{"arxiv_id":"2506.00466","last_updated":"2025-05-31T08:33:57Z","snapshot_observed_at":"2026-08-07T12:02:18.638691Z","submitted_at":"2025-05-31T08:33:57Z","title":"M3ANet: Multi-scale and Multi-Modal Alignment Network for Brain-Assisted Target Speaker Extraction","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:15.638340Z"},"links":{"citing_paper":"/paper/2506.00466"},"observation_digest":"sha256:111901a4ecc33d886177e706039037b4a2eec43d2d079641457285e6c5a114ba","observation_id":"f3f7cfbf-b1ee-46ac-8306-2586aa49a79c","resolution":{"observed_at":"2026-08-07T12:08:22.213036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:23.331681Z","title":"Speaker-independent auditory attention decoding with- out access to clean speech sources.Science advances, 5(5):eaav6134,","venue":null,"work_id":"3c2a191f-54bd-4d3b-87f3-45bc3aa92ad1","year":2019},"citing_paper":{"arxiv_id":"2506.00466","last_updated":"2025-05-31T08:33:57Z","snapshot_observed_at":"2026-08-07T12:02:18.638691Z","submitted_at":"2025-05-31T08:33:57Z","title":"M3ANet: Multi-scale and Multi-Modal Alignment Network for Brain-Assisted Target Speaker Extraction","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:15.015545Z"},"links":{"citing_paper":"/paper/2506.00466"},"observation_digest":"sha256:fff3bc8ec3aa922130bea0ecb37f3494212fed6f7c0142a87578027ab5fd9868","observation_id":"65930c91-b637-452e-9df8-32bf922a2c89","resolution":{"observed_at":"2026-08-07T12:08:23.495225Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:23.026771Z","title":"X-tf-gridnet: A time–frequency domain target speaker extraction network with adaptive speaker embed- ding fusion.Information Fusion, 112:102550,","venue":null,"work_id":"d5194ba0-7daa-457f-aa34-0fe292c62f8a","year":2024},"citing_paper":{"arxiv_id":"2506.00466","last_updated":"2025-05-31T08:33:57Z","snapshot_observed_at":"2026-08-07T12:02:18.638691Z","submitted_at":"2025-05-31T08:33:57Z","title":"M3ANet: Multi-scale and Multi-Modal Alignment Network for Brain-Assisted Target Speaker Extraction","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:15.228471Z"},"links":{"citing_paper":"/paper/2506.00466"},"observation_digest":"sha256:e92c737ac98ea72bba034febb86af7f31db2e614983f05b38245528517d7d9f3","observation_id":"f78d3635-634d-4020-9633-6f9d2e4ad98c","resolution":{"observed_at":"2026-08-07T12:08:23.157869Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:23.946755Z","title":"Msfnet: Multi-scale fusion net- work for brain-controlled speaker extraction","venue":null,"work_id":"bcab65cc-4bce-4d7c-854e-100fc3f8cf8b","year":2024},"citing_paper":{"arxiv_id":"2506.00466","last_updated":"2025-05-31T08:33:57Z","snapshot_observed_at":"2026-08-07T12:02:18.638691Z","submitted_at":"2025-05-31T08:33:57Z","title":"M3ANet: Multi-scale and Multi-Modal Alignment Network for Brain-Assisted Target Speaker Extraction","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:14.580915Z"},"links":{"citing_paper":"/paper/2506.00466"},"observation_digest":"sha256:ae20bc801307d27c092a65983a50a4d4d630ee1984c17dbb6266c98fe91a5a4a","observation_id":"e8195b1e-72b8-4d7c-aa33-933a0806b837","resolution":{"observed_at":"2026-08-07T12:08:24.082962Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.04686","last_updated":"2020-08-18T03:03:01Z","snapshot_observed_at":"2026-08-03T10:59:41.809299Z","submitted_at":"2020-05-10T15:00:07Z","title":"SpEx+: A Complete Time Domain Speaker Extraction Network","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.04686","snapshot_observed_at":"2026-08-07T12:08:14.833000Z","title":"Spex+: A complete time domain speaker extraction network.arXiv preprint arXiv:2005.04686,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.00466","last_updated":"2025-05-31T08:33:57Z","snapshot_observed_at":"2026-08-07T12:02:18.638691Z","submitted_at":"2025-05-31T08:33:57Z","title":"M3ANet: Multi-scale and Multi-Modal Alignment Network for Brain-Assisted Target Speaker Extraction","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:14.833000Z"},"links":{"cited_paper":"/paper/2005.04686","citing_paper":"/paper/2506.00466"},"observation_digest":"sha256:bf5b1bc52444521c731f7f460ec488accd423aebb8cf10d9ecd24e4843d0d485","observation_id":"b3fb19f1-d6c2-4a3c-ad58-871fcf6c22aa","resolution":{"observed_at":"2026-08-07T12:08:14.833000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.00466","last_updated":"2025-05-31T08:33:57Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-07T12:02:18.638691Z","submitted_at":"2025-05-31T08:33:57Z","title":"M3ANet: Multi-scale and Multi-Modal Alignment Network for Brain-Assisted Target Speaker Extraction"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":4,"verified_exact":3,"verified_fuzzy":31},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 2 inbound Pith citation observations for arXiv:2506.00466."}