{"as_of":"2026-08-07T20:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:23b4513841dbdcbef8999e09b6d309e3453a9e7480c37fb831b767ab2d343fc7","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T19:39:52.897328Z","state":"measured"},{"denominator":57,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":57,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2603.01530/citation-record","integrity":"/paper/2603.01530/integrity","json":"/paper/2603.01530/citation-record.json","paper":"/paper/2603.01530"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:39:47.651812Z","title":"Late audio-visual fusion for in-the-wild speaker diarization,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.01530","last_updated":"2026-06-29T12:25:41Z","snapshot_observed_at":"2026-08-06T03:17:20.565468Z","submitted_at":"2026-03-02T07:00:48Z","title":"CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T19:39:47.651812Z"},"links":{"citing_paper":"/paper/2603.01530"},"observation_digest":"sha256:6589bf4842c40a82bb3824bfc13860285e998b5f7cf3a509cba75719d576d7f7","observation_id":"7e745d9b-7458-4b8b-bbe7-c2f906a187bf","resolution":{"observed_at":"2026-08-02T19:39:47.651812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:39:47.707197Z","title":"Predict-and-update network: Audio-visual speech recognition inspired by human speech perception,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.01530","last_updated":"2026-06-29T12:25:41Z","snapshot_observed_at":"2026-08-06T03:17:20.565468Z","submitted_at":"2026-03-02T07:00:48Z","title":"CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T19:39:47.707197Z"},"links":{"citing_paper":"/paper/2603.01530"},"observation_digest":"sha256:733894adc86eddbfdae600b975b6ddaad50298037fb113d42aa30ad9a5e2f4e9","observation_id":"63a9d8fc-3871-4b88-9369-966523c65264","resolution":{"observed_at":"2026-08-02T19:39:47.707197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:39:47.781204Z","title":"Audio-visual cross- attention network for robotic speaker tracking,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.01530","last_updated":"2026-06-29T12:25:41Z","snapshot_observed_at":"2026-08-06T03:17:20.565468Z","submitted_at":"2026-03-02T07:00:48Z","title":"CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T19:39:47.781204Z"},"links":{"citing_paper":"/paper/2603.01530"},"observation_digest":"sha256:6cc99aec1697b62787bccb21498ef7e413b5c696e46bde1fcf92392b23be9c68","observation_id":"cf4cf079-4ba3-4aa5-88d6-1ce30a822961","resolution":{"observed_at":"2026-08-02T19:39:47.781204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:39:47.881501Z","title":"My lips are concealed: Audio-visual speech enhancement through obstructions,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2603.01530","last_updated":"2026-06-29T12:25:41Z","snapshot_observed_at":"2026-08-06T03:17:20.565468Z","submitted_at":"2026-03-02T07:00:48Z","title":"CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T19:39:47.881501Z"},"links":{"citing_paper":"/paper/2603.01530"},"observation_digest":"sha256:171aaecae9d8122cf55a317ca9055da7c8a524706d7501b25b2cbacb8d46c8bb","observation_id":"53e1d0f9-1ca6-4203-9034-30adf9fb679f","resolution":{"observed_at":"2026-08-02T19:39:47.881501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:39:47.988063Z","title":"Multimodal attention fusion for target speaker extraction,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.01530","last_updated":"2026-06-29T12:25:41Z","snapshot_observed_at":"2026-08-06T03:17:20.565468Z","submitted_at":"2026-03-02T07:00:48Z","title":"CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T19:39:47.988063Z"},"links":{"citing_paper":"/paper/2603.01530"},"observation_digest":"sha256:ae4731d45e5735f209a3848878984de4abf03e8c5a451278148ef4282dd8f9cc","observation_id":"987c4fe5-f154-4815-bf84-06d766542a17","resolution":{"observed_at":"2026-08-02T19:39:47.988063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:39:48.134760Z","title":"Time-domain audio-visual speech separation on low quality videos,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.01530","last_updated":"2026-06-29T12:25:41Z","snapshot_observed_at":"2026-08-06T03:17:20.565468Z","submitted_at":"2026-03-02T07:00:48Z","title":"CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T19:39:48.134760Z"},"links":{"citing_paper":"/paper/2603.01530"},"observation_digest":"sha256:3c1ca9b8c222c808368c14ba9cc0e79c2a8c1bf3e44c07681128ccdecb57063c","observation_id":"bad0a1cd-ae40-4ee0-b7c3-8891513ad009","resolution":{"observed_at":"2026-08-02T19:39:48.134760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:39:48.239563Z","title":"A two-stage audio-visual speech separation method without visual signals for testing and tuples loss with dynamic margin,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.01530","last_updated":"2026-06-29T12:25:41Z","snapshot_observed_at":"2026-08-06T03:17:20.565468Z","submitted_at":"2026-03-02T07:00:48Z","title":"CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T19:39:48.239563Z"},"links":{"citing_paper":"/paper/2603.01530"},"observation_digest":"sha256:3a2e4a725d93fe4c217f16b260d7c761ce3f7002ab473151ed202b2747b130ba","observation_id":"1bc86261-7476-4377-9659-3a978ba39533","resolution":{"observed_at":"2026-08-02T19:39:48.239563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:39:48.336598Z","title":"Ravss: Robust audio- visual speech separation in multi-speaker scenarios with missing visual cues,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.01530","last_updated":"2026-06-29T12:25:41Z","snapshot_observed_at":"2026-08-06T03:17:20.565468Z","submitted_at":"2026-03-02T07:00:48Z","title":"CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T19:39:48.336598Z"},"links":{"citing_paper":"/paper/2603.01530"},"observation_digest":"sha256:0c2b27fd6f24ee57498fcaabd95d77c1f7db412f469f04081264b59c6b8d97bc","observation_id":"d505beb3-6b6d-4c24-a05d-f3c6fb0c9083","resolution":{"observed_at":"2026-08-02T19:39:48.336598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:39:48.413660Z","title":"Multi-modal multi-correlation learning for audio-visual speech separation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.01530","last_updated":"2026-06-29T12:25:41Z","snapshot_observed_at":"2026-08-06T03:17:20.565468Z","submitted_at":"2026-03-02T07:00:48Z","title":"CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T19:39:48.413660Z"},"links":{"citing_paper":"/paper/2603.01530"},"observation_digest":"sha256:ff22eb89d8093588fc12d2b58177aabcc2d3ebebfd16ad610f019f95ff462b8e","observation_id":"9fdabcf9-e31b-4906-97fe-bfc6b61e1ab9","resolution":{"observed_at":"2026-08-02T19:39:48.413660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:39:48.493817Z","title":"Visualvoice: Audio-visual speech separa- tion with cross-modal consistency,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.01530","last_updated":"2026-06-29T12:25:41Z","snapshot_observed_at":"2026-08-06T03:17:20.565468Z","submitted_at":"2026-03-02T07:00:48Z","title":"CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T19:39:48.493817Z"},"links":{"citing_paper":"/paper/2603.01530"},"observation_digest":"sha256:e851da6ec5461984ebedb745773fe88ac2ad5b46fd0aae9d568287ed9c27f073","observation_id":"8568c310-aa1a-4828-827b-73181b449ef7","resolution":{"observed_at":"2026-08-02T19:39:48.493817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:39:48.591505Z","title":"Explaining face-voice matching decisions: The contribution of mouth movements, stimulus effects and response biases,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.01530","last_updated":"2026-06-29T12:25:41Z","snapshot_observed_at":"2026-08-06T03:17:20.565468Z","submitted_at":"2026-03-02T07:00:48Z","title":"CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T19:39:48.591505Z"},"links":{"citing_paper":"/paper/2603.01530"},"observation_digest":"sha256:187b872000c9758742d0661458edf26df0f9cd1a11397bcf823a0472c9260422","observation_id":"d5ce327e-36a9-4e13-bac5-9532e4eee839","resolution":{"observed_at":"2026-08-02T19:39:48.591505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:39:48.661921Z","title":"Rethinking the visual cues in audio-visual speaker extraction,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.01530","last_updated":"2026-06-29T12:25:41Z","snapshot_observed_at":"2026-08-06T03:17:20.565468Z","submitted_at":"2026-03-02T07:00:48Z","title":"CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T19:39:48.661921Z"},"links":{"citing_paper":"/paper/2603.01530"},"observation_digest":"sha256:8d824d0d4d555b080d04bb1c78921ffeb19955b4c356c099850c60daadf61514","observation_id":"9bc51f8a-9fb8-49dd-b95a-b842d2d15a59","resolution":{"observed_at":"2026-08-02T19:39:48.661921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:39:48.701570Z","title":"Muse: Multi-modal target speaker extraction with visual cues,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.01530","last_updated":"2026-06-29T12:25:41Z","snapshot_observed_at":"2026-08-06T03:17:20.565468Z","submitted_at":"2026-03-02T07:00:48Z","title":"CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T19:39:48.701570Z"},"links":{"citing_paper":"/paper/2603.01530"},"observation_digest":"sha256:0f68bded7565e09ac4b9454bd6c8e1bad8d484d9aadcfd40e115128056e99417","observation_id":"f1cd3764-6ff2-4e55-bd54-65183bec8189","resolution":{"observed_at":"2026-08-02T19:39:48.701570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:39:48.807239Z","title":"Hearing lips and seeing voices,","venue":null,"work_id":null,"year":1976},"citing_paper":{"arxiv_id":"2603.01530","last_updated":"2026-06-29T12:25:41Z","snapshot_observed_at":"2026-08-06T03:17:20.565468Z","submitted_at":"2026-03-02T07:00:48Z","title":"CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T19:39:48.807239Z"},"links":{"citing_paper":"/paper/2603.01530"},"observation_digest":"sha256:ae175f7a5eeadd1c2f0f082f4826972eadd754927ec989c32a6329cf7ce27f5b","observation_id":"e85590b2-679c-4c45-849d-ca11468bc116","resolution":{"observed_at":"2026-08-02T19:39:48.807239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:39:48.904251Z","title":"The effect of speechreading on masked detection thresh- olds for filtered speech,","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2603.01530","last_updated":"2026-06-29T12:25:41Z","snapshot_observed_at":"2026-08-06T03:17:20.565468Z","submitted_at":"2026-03-02T07:00:48Z","title":"CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T19:39:48.904251Z"},"links":{"citing_paper":"/paper/2603.01530"},"observation_digest":"sha256:1f980b69a698368be5a57ea125dd940c09c95297a0693d75f0e8374b43d8c28e","observation_id":"82f601e2-676a-44f0-a97b-9ed29faa003a","resolution":{"observed_at":"2026-08-02T19:39:48.904251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:39:48.980472Z","title":"Neural target speech extraction: An overview,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.01530","last_updated":"2026-06-29T12:25:41Z","snapshot_observed_at":"2026-08-06T03:17:20.565468Z","submitted_at":"2026-03-02T07:00:48Z","title":"CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T19:39:48.980472Z"},"links":{"citing_paper":"/paper/2603.01530"},"observation_digest":"sha256:0a6e36240b9682566f4d8b7c1eb8b1afb7fa72c43a374a269d58c8f517d1465b","observation_id":"85a12557-dfd5-4976-a272-f45ea94cdfbd","resolution":{"observed_at":"2026-08-02T19:39:48.980472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:39:49.048817Z","title":"Multi-cue guided semi-supervised learning toward target speaker separation in real environments,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.01530","last_updated":"2026-06-29T12:25:41Z","snapshot_observed_at":"2026-08-06T03:17:20.565468Z","submitted_at":"2026-03-02T07:00:48Z","title":"CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T19:39:49.048817Z"},"links":{"citing_paper":"/paper/2603.01530"},"observation_digest":"sha256:b0e19ad06364b9b7962644e9adb8f90299a37db494d459e2332bb3f7fa37b4b6","observation_id":"a04400b8-a94e-4b62-9326-6d13188619c0","resolution":{"observed_at":"2026-08-02T19:39:49.048817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:39:49.105895Z","title":"Multi- level speaker representation for target speaker extraction,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.01530","last_updated":"2026-06-29T12:25:41Z","snapshot_observed_at":"2026-08-06T03:17:20.565468Z","submitted_at":"2026-03-02T07:00:48Z","title":"CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T19:39:49.105895Z"},"links":{"citing_paper":"/paper/2603.01530"},"observation_digest":"sha256:c8aa954bbaea0a11c05130325fd0e363924751340b4781a7f2372ee6cf145e7c","observation_id":"0e4e957a-21e2-49a6-b2d8-f4e8c1e28713","resolution":{"observed_at":"2026-08-02T19:39:49.105895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:39:49.191132Z","title":"Usef-tse: Universal speaker embedding free target speaker extraction,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.01530","last_updated":"2026-06-29T12:25:41Z","snapshot_observed_at":"2026-08-06T03:17:20.565468Z","submitted_at":"2026-03-02T07:00:48Z","title":"CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T19:39:49.191132Z"},"links":{"citing_paper":"/paper/2603.01530"},"observation_digest":"sha256:de0e874cf09a4e2f6ef216632566532b47c6371a7c53401ace959f0533e10316","observation_id":"88058dec-30e4-45d3-add3-c9134998d60e","resolution":{"observed_at":"2026-08-02T19:39:49.191132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:39:49.277012Z","title":"Contextual speech extraction: Leveraging textual history as an implicit cue for target speech extraction,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.01530","last_updated":"2026-06-29T12:25:41Z","snapshot_observed_at":"2026-08-06T03:17:20.565468Z","submitted_at":"2026-03-02T07:00:48Z","title":"CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T19:39:49.277012Z"},"links":{"citing_paper":"/paper/2603.01530"},"observation_digest":"sha256:f99fa37e681efb5f377a8cc83f094418f5ff60e809a3050d70f95bc7679ef1a0","observation_id":"4f2b76a7-4c7e-4336-bb74-c2254bf92e91","resolution":{"observed_at":"2026-08-02T19:39:49.277012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:39:49.344715Z","title":"Conceptbeam: Concept driven target speech extraction,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.01530","last_updated":"2026-06-29T12:25:41Z","snapshot_observed_at":"2026-08-06T03:17:20.565468Z","submitted_at":"2026-03-02T07:00:48Z","title":"CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T19:39:49.344715Z"},"links":{"citing_paper":"/paper/2603.01530"},"observation_digest":"sha256:ba059892b242d82125579598d56b4f4ca18b2f0fc232396cc691690091b1867c","observation_id":"380459a4-3d15-4e84-88b7-4e652e6ac1cf","resolution":{"observed_at":"2026-08-02T19:39:49.344715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.24708","last_updated":"2026-04-05T03:27:11Z","snapshot_observed_at":"2026-08-04T09:40:49.585423Z","submitted_at":"2025-09-29T12:34:58Z","title":"SenSE: Semantic-Aware High-Fidelity Universal Speech Enhancement","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.24708","snapshot_observed_at":"2026-08-02T19:39:49.452897Z","title":"Sense: Semantic-aware high-fidelity universal speech enhancement,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.01530","last_updated":"2026-06-29T12:25:41Z","snapshot_observed_at":"2026-08-06T03:17:20.565468Z","submitted_at":"2026-03-02T07:00:48Z","title":"CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T19:39:49.452897Z"},"links":{"cited_paper":"/paper/2509.24708","citing_paper":"/paper/2603.01530"},"observation_digest":"sha256:c41ed8965c0a3baa26a14dc31f4a23ddd8f2a399d11eeda7c60813e389a47ba3","observation_id":"09c71ba3-7a9c-46af-b636-f08cbbeefda8","resolution":{"observed_at":"2026-08-02T19:39:49.452897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:39:49.559335Z","title":"Av-crossnet: An audiovisual complex spectral mapping network for speech separation by leveraging narrow-and cross-band modeling,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.01530","last_updated":"2026-06-29T12:25:41Z","snapshot_observed_at":"2026-08-06T03:17:20.565468Z","submitted_at":"2026-03-02T07:00:48Z","title":"CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T19:39:49.559335Z"},"links":{"citing_paper":"/paper/2603.01530"},"observation_digest":"sha256:4a3ce3d1a0b67a38d25105810329c23f6a4f6886351eb8e5de0d9210f0abeb53","observation_id":"1943fd70-11df-4ce3-82f5-4ec69984d198","resolution":{"observed_at":"2026-08-02T19:39:49.559335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:39:49.608480Z","title":"Audio-visual speech separation and dereverberation with a two-stage multimodal network,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2603.01530","last_updated":"2026-06-29T12:25:41Z","snapshot_observed_at":"2026-08-06T03:17:20.565468Z","submitted_at":"2026-03-02T07:00:48Z","title":"CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T19:39:49.608480Z"},"links":{"citing_paper":"/paper/2603.01530"},"observation_digest":"sha256:2489d11fa7f9f46bace7ca039c8327e5f0b2d030d1057420cd1b8f0a2b2a58b5","observation_id":"0e469bc5-a982-4c66-8de4-f280c8144b95","resolution":{"observed_at":"2026-08-02T19:39:49.608480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:39:49.722228Z","title":"Spatialnet: Extensively learning spatial information for multichannel joint speech separation, denoising and dereverberation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.01530","last_updated":"2026-06-29T12:25:41Z","snapshot_observed_at":"2026-08-06T03:17:20.565468Z","submitted_at":"2026-03-02T07:00:48Z","title":"CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T19:39:49.722228Z"},"links":{"citing_paper":"/paper/2603.01530"},"observation_digest":"sha256:1e7c152cd202fc6617c5a918b01111813490525f42b0f4786e8039e9bee463d0","observation_id":"cfef3ce0-3b85-4080-be40-26b12408f5de","resolution":{"observed_at":"2026-08-02T19:39:49.722228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:39:49.781277Z","title":"Fasnet: Low- latency adaptive beamforming for multi-microphone audio processing,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2603.01530","last_updated":"2026-06-29T12:25:41Z","snapshot_observed_at":"2026-08-06T03:17:20.565468Z","submitted_at":"2026-03-02T07:00:48Z","title":"CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T19:39:49.781277Z"},"links":{"citing_paper":"/paper/2603.01530"},"observation_digest":"sha256:7362933eb83c33362f6b5641a1569f1790b1c2bb6d3c1e622b14b5a22e8f4e18","observation_id":"04a2a2f6-a6b0-4183-8185-b3d3a328c608","resolution":{"observed_at":"2026-08-02T19:39:49.781277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:39:49.841882Z","title":"Multi-modal multi-channel target speech separation,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2603.01530","last_updated":"2026-06-29T12:25:41Z","snapshot_observed_at":"2026-08-06T03:17:20.565468Z","submitted_at":"2026-03-02T07:00:48Z","title":"CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T19:39:49.841882Z"},"links":{"citing_paper":"/paper/2603.01530"},"observation_digest":"sha256:685aec0ce7db8dd8d27abb35ee7283a7bca878803a3a6e955d646cc445c3d110","observation_id":"660cbdaa-f9f3-47ac-99ba-357a0294e03c","resolution":{"observed_at":"2026-08-02T19:39:49.841882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:39:49.952505Z","title":"An overview of deep-learning-based audio-visual speech en- hancement and separation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.01530","last_updated":"2026-06-29T12:25:41Z","snapshot_observed_at":"2026-08-06T03:17:20.565468Z","submitted_at":"2026-03-02T07:00:48Z","title":"CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T19:39:49.952505Z"},"links":{"citing_paper":"/paper/2603.01530"},"observation_digest":"sha256:56164db4885080a075461771685d929304dbdfca6fc957d35ddecd315f3eabe5","observation_id":"0e4f0049-db7f-4fe2-b9c2-759f3fc98d65","resolution":{"observed_at":"2026-08-02T19:39:49.952505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:39:50.040323Z","title":"Unified audio visual cues for target speaker extraction,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.01530","last_updated":"2026-06-29T12:25:41Z","snapshot_observed_at":"2026-08-06T03:17:20.565468Z","submitted_at":"2026-03-02T07:00:48Z","title":"CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T19:39:50.040323Z"},"links":{"citing_paper":"/paper/2603.01530"},"observation_digest":"sha256:c172517d376effbfb5e371cb950edeea0ea1a4d90740463dd8a9e76f157fcc39","observation_id":"6ac8057b-44e4-40b1-a379-571d7678c9d6","resolution":{"observed_at":"2026-08-02T19:39:50.040323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08247","last_updated":"2025-03-31T13:31:19Z","snapshot_observed_at":"2026-07-06T20:05:10.188170Z","submitted_at":"2024-12-11T09:55:09Z","title":"MoMuSE: Momentum Multi-modal Target Speaker Extraction for Real-time Scenarios with Impaired Visual Cues","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.08247","snapshot_observed_at":"2026-08-02T19:39:50.132135Z","title":"Momuse: Momentum multi-modal target speaker extraction for real-time scenarios with impaired visual cues,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.01530","last_updated":"2026-06-29T12:25:41Z","snapshot_observed_at":"2026-08-06T03:17:20.565468Z","submitted_at":"2026-03-02T07:00:48Z","title":"CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T19:39:50.132135Z"},"links":{"cited_paper":"/paper/2412.08247","citing_paper":"/paper/2603.01530"},"observation_digest":"sha256:556bc21d290eedba87b707d3365afa5e2a2a41cf222332acff4f82dda76568d7","observation_id":"7e7e147e-96ba-4759-a544-6ae1f7d213e7","resolution":{"observed_at":"2026-08-02T19:39:50.132135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-06T15:33:05.211063Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.15294","snapshot_observed_at":"2026-08-02T19:39:50.277622Z","title":"Memo: Attentional momentum for real-time audio-visual speaker extraction under impaired visual conditions,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.01530","last_updated":"2026-06-29T12:25:41Z","snapshot_observed_at":"2026-08-06T03:17:20.565468Z","submitted_at":"2026-03-02T07:00:48Z","title":"CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T19:39:50.277622Z"},"links":{"cited_paper":"/paper/2507.15294","citing_paper":"/paper/2603.01530"},"observation_digest":"sha256:7f82063b447f083bc6bfe04c27f539e3a33355123a9287ae75b39a8db7524b12","observation_id":"a093622f-23ed-4eee-b9d4-df82da779cc2","resolution":{"observed_at":"2026-08-02T19:39:50.277622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:39:50.421972Z","title":"Tf-gridnet: Making time-frequency domain models great again for monaural speaker separation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.01530","last_updated":"2026-06-29T12:25:41Z","snapshot_observed_at":"2026-08-06T03:17:20.565468Z","submitted_at":"2026-03-02T07:00:48Z","title":"CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T19:39:50.421972Z"},"links":{"citing_paper":"/paper/2603.01530"},"observation_digest":"sha256:a238df9556ecc7beded85a190956e7a76a29a6a37fe4a04dc88c2b8b21efecf9","observation_id":"9236990d-7209-4cd7-bfe7-6c87dcfc5928","resolution":{"observed_at":"2026-08-02T19:39:50.421972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12725","last_updated":"2024-05-05T08:00:17Z","snapshot_observed_at":"2026-07-06T18:02:36.759308Z","submitted_at":"2024-04-19T09:08:44Z","title":"Separate in the Speech Chain: Cross-Modal Conditional Audio-Visual Target Speech Extraction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12725","snapshot_observed_at":"2026-08-02T19:39:50.510822Z","title":"Separate in the speech chain: Cross-modal conditional audio-visual target speech extraction,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.01530","last_updated":"2026-06-29T12:25:41Z","snapshot_observed_at":"2026-08-06T03:17:20.565468Z","submitted_at":"2026-03-02T07:00:48Z","title":"CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T19:39:50.510822Z"},"links":{"cited_paper":"/paper/2404.12725","citing_paper":"/paper/2603.01530"},"observation_digest":"sha256:982c984400c0a4aafab8ab0f96cfbbc3fa22606a3eff72f1db0474eec85c2ce1","observation_id":"7691e0c9-511a-47ff-8a85-d36e2f90fdbc","resolution":{"observed_at":"2026-08-02T19:39:50.510822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19398","last_updated":"2025-06-24T08:01:33Z","snapshot_observed_at":"2026-08-07T06:16:42.699266Z","submitted_at":"2025-06-24T08:01:33Z","title":"ClearerVoice-Studio: Bridging Advanced Speech Processing Research and Practical Deployment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.19398","snapshot_observed_at":"2026-08-02T19:39:50.604200Z","title":"Clearervoice-studio: Bridging advanced speech processing research and practical deployment,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.01530","last_updated":"2026-06-29T12:25:41Z","snapshot_observed_at":"2026-08-06T03:17:20.565468Z","submitted_at":"2026-03-02T07:00:48Z","title":"CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T19:39:50.604200Z"},"links":{"cited_paper":"/paper/2506.19398","citing_paper":"/paper/2603.01530"},"observation_digest":"sha256:e1fc1f347d108aa1d8cee599dd7658c102797efaf1f3415bdd40f53b7becfba8","observation_id":"02546d07-92d4-4255-a078-45e13b8b6517","resolution":{"observed_at":"2026-08-02T19:39:50.604200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:39:50.666512Z","title":"Av-sepformer: Cross-attention sepformer for audio-visual target speaker extraction,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.01530","last_updated":"2026-06-29T12:25:41Z","snapshot_observed_at":"2026-08-06T03:17:20.565468Z","submitted_at":"2026-03-02T07:00:48Z","title":"CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T19:39:50.666512Z"},"links":{"citing_paper":"/paper/2603.01530"},"observation_digest":"sha256:49c969b670e6cba73d3f139e99d0e1a3a12029926964b4e099bd221277f7e4a7","observation_id":"6f81324b-2b19-405e-8ff6-4eefc7fed8ef","resolution":{"observed_at":"2026-08-02T19:39:50.666512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:39:50.710240Z","title":"Deep residual learning for image recognition,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2603.01530","last_updated":"2026-06-29T12:25:41Z","snapshot_observed_at":"2026-08-06T03:17:20.565468Z","submitted_at":"2026-03-02T07:00:48Z","title":"CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T19:39:50.710240Z"},"links":{"citing_paper":"/paper/2603.01530"},"observation_digest":"sha256:0a8bacc51a2582315a2b0c6514d54a30d3c8af9369de696f072342c1eecdead3","observation_id":"42cae12f-b223-4ce4-aed9-ad366c7f16b2","resolution":{"observed_at":"2026-08-02T19:39:50.710240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:39:50.758566Z","title":"Audio-visual target speaker extraction with selective auditory attention,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.01530","last_updated":"2026-06-29T12:25:41Z","snapshot_observed_at":"2026-08-06T03:17:20.565468Z","submitted_at":"2026-03-02T07:00:48Z","title":"CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T19:39:50.758566Z"},"links":{"citing_paper":"/paper/2603.01530"},"observation_digest":"sha256:a10ac4350cb1eb316264db6358943aa0a07247a51b032e55d72ed1f4ab3dd576","observation_id":"147f996f-0f6c-44d0-8946-9b8264e2aba8","resolution":{"observed_at":"2026-08-02T19:39:50.758566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:39:50.817421Z","title":"Pitch range variations improve cognitive processing of audio messages,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2603.01530","last_updated":"2026-06-29T12:25:41Z","snapshot_observed_at":"2026-08-06T03:17:20.565468Z","submitted_at":"2026-03-02T07:00:48Z","title":"CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T19:39:50.817421Z"},"links":{"citing_paper":"/paper/2603.01530"},"observation_digest":"sha256:19fa30ab7f5e81bca3820744353c50d9ca1c78c101386259fc725245de88a784","observation_id":"9e040b87-7754-4ebd-ab87-558186acd7c4","resolution":{"observed_at":"2026-08-02T19:39:50.817421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:39:50.878247Z","title":"Intonation and speaker identification,","venue":null,"work_id":null,"year":1978},"citing_paper":{"arxiv_id":"2603.01530","last_updated":"2026-06-29T12:25:41Z","snapshot_observed_at":"2026-08-06T03:17:20.565468Z","submitted_at":"2026-03-02T07:00:48Z","title":"CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T19:39:50.878247Z"},"links":{"citing_paper":"/paper/2603.01530"},"observation_digest":"sha256:66886c30c297a12a7e30c651a8567c0350664570db022b01f7050c5c73551a1c","observation_id":"83d5ffcf-441a-4334-9951-63ea1fc05a65","resolution":{"observed_at":"2026-08-02T19:39:50.878247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:39:50.973379Z","title":"Dual-path rnn: efficient long sequence modeling for time-domain single-channel speech separation,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2603.01530","last_updated":"2026-06-29T12:25:41Z","snapshot_observed_at":"2026-08-06T03:17:20.565468Z","submitted_at":"2026-03-02T07:00:48Z","title":"CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T19:39:50.973379Z"},"links":{"citing_paper":"/paper/2603.01530"},"observation_digest":"sha256:cf5a769c815bb64794ddf46c9179fdf62be4f9bea60a65b14518fe0e0c0a067e","observation_id":"a3c7590b-37bd-4fd8-b8f2-99b6028d3f0e","resolution":{"observed_at":"2026-08-02T19:39:50.973379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:39:51.116351Z","title":"Time domain audio visual speech separation,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2603.01530","last_updated":"2026-06-29T12:25:41Z","snapshot_observed_at":"2026-08-06T03:17:20.565468Z","submitted_at":"2026-03-02T07:00:48Z","title":"CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T19:39:51.116351Z"},"links":{"citing_paper":"/paper/2603.01530"},"observation_digest":"sha256:fe97603a856b10610c360ea8fc7253c202db2f1a7e51e56e1e8b77141cd0f97c","observation_id":"3bde35da-e50b-4f1e-a4a4-b0cea45ceb1b","resolution":{"observed_at":"2026-08-02T19:39:51.116351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:39:51.297240Z","title":"Learning audio- visual speech representation by masked multimodal cluster prediction,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.01530","last_updated":"2026-06-29T12:25:41Z","snapshot_observed_at":"2026-08-06T03:17:20.565468Z","submitted_at":"2026-03-02T07:00:48Z","title":"CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-02T19:39:51.297240Z"},"links":{"citing_paper":"/paper/2603.01530"},"observation_digest":"sha256:6ffe48fa4818b0e3fa44382fceccf6090fbdd012c52b1fa4c2d2cbcf1a243d43","observation_id":"861f072b-09f5-4af3-b854-a775d81c64cd","resolution":{"observed_at":"2026-08-02T19:39:51.297240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:39:51.421789Z","title":"Rethinking the inception architecture for computer vision,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2603.01530","last_updated":"2026-06-29T12:25:41Z","snapshot_observed_at":"2026-08-06T03:17:20.565468Z","submitted_at":"2026-03-02T07:00:48Z","title":"CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-02T19:39:51.421789Z"},"links":{"citing_paper":"/paper/2603.01530"},"observation_digest":"sha256:b7240bae86fee08bc33a0f2e1bed0c571369e04d31ee3b770a24737238d8f81c","observation_id":"2ec3e718-24ea-4b47-a486-cf2ee07409a7","resolution":{"observed_at":"2026-08-02T19:39:51.421789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:39:51.538493Z","title":"Sdr–half-baked or well done?","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2603.01530","last_updated":"2026-06-29T12:25:41Z","snapshot_observed_at":"2026-08-06T03:17:20.565468Z","submitted_at":"2026-03-02T07:00:48Z","title":"CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-02T19:39:51.538493Z"},"links":{"citing_paper":"/paper/2603.01530"},"observation_digest":"sha256:c9d25ff8784d91f9cb0d043187e2743a5e9e62176890250ca5c569f26dc488e7","observation_id":"99af4452-84f4-4a29-8fc8-7208625e9b3d","resolution":{"observed_at":"2026-08-02T19:39:51.538493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:39:51.693426Z","title":"Audio-Visual Speech Separation in Noisy Environments with a Lightweight Iterative Model,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.01530","last_updated":"2026-06-29T12:25:41Z","snapshot_observed_at":"2026-08-06T03:17:20.565468Z","submitted_at":"2026-03-02T07:00:48Z","title":"CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-02T19:39:51.693426Z"},"links":{"citing_paper":"/paper/2603.01530"},"observation_digest":"sha256:bf21cd93b35bfb6954cfc764078e0c606c88225fc4ad050573ba7ab534925274","observation_id":"2e4cbf8c-bce6-4d7c-8181-af5e0fd61cd4","resolution":{"observed_at":"2026-08-02T19:39:51.693426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:39:51.835676Z","title":"An audio-visual speech separation model inspired by cortico-thalamo-cortical circuits,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.01530","last_updated":"2026-06-29T12:25:41Z","snapshot_observed_at":"2026-08-06T03:17:20.565468Z","submitted_at":"2026-03-02T07:00:48Z","title":"CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-02T19:39:51.835676Z"},"links":{"citing_paper":"/paper/2603.01530"},"observation_digest":"sha256:b3ee9caebfee2ef2bf3ce71f2bd9e664734f0d0d91336a51f4a6ea4e8cb7b5e0","observation_id":"3c3d8a28-7000-4038-adf8-e588e3a7538f","resolution":{"observed_at":"2026-08-02T19:39:51.835676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:39:51.902230Z","title":"Iianet: an intra-and inter-modality attention network for audio-visual speech separation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.01530","last_updated":"2026-06-29T12:25:41Z","snapshot_observed_at":"2026-08-06T03:17:20.565468Z","submitted_at":"2026-03-02T07:00:48Z","title":"CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-02T19:39:51.902230Z"},"links":{"citing_paper":"/paper/2603.01530"},"observation_digest":"sha256:a414ce31277b0f018563680ca5898fa7df58f3e9fb25cc72d6c6049e5b945498","observation_id":"514335a0-d76a-4404-8576-ecdf84ed0ece","resolution":{"observed_at":"2026-08-02T19:39:51.902230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:39:51.948455Z","title":"Deep audio-visual speech recognition,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2603.01530","last_updated":"2026-06-29T12:25:41Z","snapshot_observed_at":"2026-08-06T03:17:20.565468Z","submitted_at":"2026-03-02T07:00:48Z","title":"CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-02T19:39:51.948455Z"},"links":{"citing_paper":"/paper/2603.01530"},"observation_digest":"sha256:d3f4c3897229af0e620b9c229bb0e17780ce5d91e36c9d5dab99a82f40ea22f6","observation_id":"b78ba67f-4f44-4135-abdf-d3d62d824dd6","resolution":{"observed_at":"2026-08-02T19:39:51.948455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1806.05622","last_updated":"2018-06-27T01:49:17Z","snapshot_observed_at":"2026-08-04T08:09:48.365818Z","submitted_at":"2018-06-14T15:59:12Z","title":"VoxCeleb2: Deep Speaker Recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.05622","snapshot_observed_at":"2026-08-02T19:39:52.095802Z","title":"V oxceleb2: Deep speaker recognition,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2603.01530","last_updated":"2026-06-29T12:25:41Z","snapshot_observed_at":"2026-08-06T03:17:20.565468Z","submitted_at":"2026-03-02T07:00:48Z","title":"CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-02T19:39:52.095802Z"},"links":{"cited_paper":"/paper/1806.05622","citing_paper":"/paper/2603.01530"},"observation_digest":"sha256:3b95e56fe5cd54eaa8e196964eb820e9ba1f51809cddb6816e1cc27fa5279aee","observation_id":"a667534c-8589-45d5-9bf7-6a3ec0025dae","resolution":{"observed_at":"2026-08-02T19:39:52.095802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:39:52.175405Z","title":"Looking into your speech: Learning cross-modal affinity for audio-visual speech separation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.01530","last_updated":"2026-06-29T12:25:41Z","snapshot_observed_at":"2026-08-06T03:17:20.565468Z","submitted_at":"2026-03-02T07:00:48Z","title":"CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-02T19:39:52.175405Z"},"links":{"citing_paper":"/paper/2603.01530"},"observation_digest":"sha256:ec42bacbd407339d86d3f714ddd831322927f99fcf9e55bd325234e5e8119dd1","observation_id":"de8584db-4a6a-46fa-ba23-6aa2417334f6","resolution":{"observed_at":"2026-08-02T19:39:52.175405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:39:52.273806Z","title":"Watch or listen: Robust audio- visual speech recognition with visual corruption modeling and reliability scoring,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.01530","last_updated":"2026-06-29T12:25:41Z","snapshot_observed_at":"2026-08-06T03:17:20.565468Z","submitted_at":"2026-03-02T07:00:48Z","title":"CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-02T19:39:52.273806Z"},"links":{"citing_paper":"/paper/2603.01530"},"observation_digest":"sha256:b76bafb32208e2417c648704bd66e212ab7a502821e52a77e5fad3426c5ccde3","observation_id":"a7256a29-e690-49c8-b956-a3dd7f0a2d5b","resolution":{"observed_at":"2026-08-02T19:39:52.273806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:39:52.379271Z","title":"Restoring speaking lips from occlusion for audio-visual speech recognition,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.01530","last_updated":"2026-06-29T12:25:41Z","snapshot_observed_at":"2026-08-06T03:17:20.565468Z","submitted_at":"2026-03-02T07:00:48Z","title":"CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-02T19:39:52.379271Z"},"links":{"citing_paper":"/paper/2603.01530"},"observation_digest":"sha256:8717c6bdd6e720b451feb9683d9406d289bdbf7ae3e28f3e726dbc17fcefef8a","observation_id":"b334d924-65e3-47f9-b207-5d84923d7c9f","resolution":{"observed_at":"2026-08-02T19:39:52.379271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:39:52.500142Z","title":"Delving into high-quality synthetic face occlusion segmentation datasets,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.01530","last_updated":"2026-06-29T12:25:41Z","snapshot_observed_at":"2026-08-06T03:17:20.565468Z","submitted_at":"2026-03-02T07:00:48Z","title":"CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-02T19:39:52.500142Z"},"links":{"citing_paper":"/paper/2603.01530"},"observation_digest":"sha256:3dd09f3ec53cf58ba5c0b5d407ff5874106682ca537301dd73ec51e10c7830fe","observation_id":"dd4a8bae-a187-420a-a7a4-4568218dfee1","resolution":{"observed_at":"2026-08-02T19:39:52.500142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:39:52.616289Z","title":"Data2vec: A general framework for self-supervised learning in speech, vision and language,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.01530","last_updated":"2026-06-29T12:25:41Z","snapshot_observed_at":"2026-08-06T03:17:20.565468Z","submitted_at":"2026-03-02T07:00:48Z","title":"CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-02T19:39:52.616289Z"},"links":{"citing_paper":"/paper/2603.01530"},"observation_digest":"sha256:ca2aa3263573c0116d4df22f6fe2079ef75f56d63eae951f9c7494e9d8322774","observation_id":"e34e8283-d8b2-4aab-9303-c6a80775876a","resolution":{"observed_at":"2026-08-02T19:39:52.616289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-02T19:39:52.723885Z","title":"Adam: A method for stochastic optimization,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2603.01530","last_updated":"2026-06-29T12:25:41Z","snapshot_observed_at":"2026-08-06T03:17:20.565468Z","submitted_at":"2026-03-02T07:00:48Z","title":"CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-02T19:39:52.723885Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2603.01530"},"observation_digest":"sha256:fff2a3de427cfa2c979c18e81795edc0bb9320f26a98b607b2ad24593a38cb85","observation_id":"82b83497-9b72-49fa-b5a1-0ebe40e3426a","resolution":{"observed_at":"2026-08-02T19:39:52.723885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:39:52.814970Z","title":"Long short-term memory,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2603.01530","last_updated":"2026-06-29T12:25:41Z","snapshot_observed_at":"2026-08-06T03:17:20.565468Z","submitted_at":"2026-03-02T07:00:48Z","title":"CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-02T19:39:52.814970Z"},"links":{"citing_paper":"/paper/2603.01530"},"observation_digest":"sha256:6a2def3bc83ec53f1b6ba198b9765ff400608213bf8b6dbb2d77415972a72492","observation_id":"cd1737d7-935f-4925-954b-b90a960cda81","resolution":{"observed_at":"2026-08-02T19:39:52.814970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:39:52.897328Z","title":"How many phonemes does the english language have,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2603.01530","last_updated":"2026-06-29T12:25:41Z","snapshot_observed_at":"2026-08-06T03:17:20.565468Z","submitted_at":"2026-03-02T07:00:48Z","title":"CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-02T19:39:52.897328Z"},"links":{"citing_paper":"/paper/2603.01530"},"observation_digest":"sha256:e704898bd3605372d160f7a657fb5a52170e97ba5055c269090e281bd039fe96","observation_id":"0edb5e94-dfa7-49ff-8040-5d7d0f070bfc","resolution":{"observed_at":"2026-08-02T19:39:52.897328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2603.01530","last_updated":"2026-06-29T12:25:41Z","latest_version":2,"primary_category":"cs.MM","snapshot_observed_at":"2026-08-06T03:17:20.565468Z","submitted_at":"2026-03-02T07:00:48Z","title":"CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":57,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 0 inbound Pith citation observations for arXiv:2603.01530."}